MaxKernel 논문 공개: TPU 커널을 멀티 에이전트로 만들고 하드웨어에서 바로 측정하는 방식 | DAKER 커뮤니티
2026년 9월 3일 arXiv에 공개된 MaxKernel은 TPU 커널 개발을 멀티 에이전트 시스템으로 다루는 방법을 제시합니다. 가속기용 고성능 커스텀 커널 작성은 원래 하드웨어 수준의 전문성이 필요한 작업으로 알려져 있는데, 이 논문 초록은 LLM과 실시간 컴파일러 피드백을 결합하면 커널 생성 에이전트 시스템을 만들 수 있다고 설명합니다.
지금 이 글을 읽을 만한 이유는 분명합니다. 생성만으로 끝나는 자동화가 아니라, 실제 하드웨어 프로파일링까지 포함한 루프를 전제로 한다는 점입니다. 오늘 글은 arXiv:2609.04523 초록과 공개 링크에서 확인되는 범위만 정리합니다. 없는 숫자나 확장 해석은 더하지 않습니다.

논문에서 말하는 MaxKernel의 범위
논문은 2026-09-03 arXiv에 올라왔습니다. 영문 제목은 MaxKernel: Agentic Kernel Generation for TPUs입니다. 저자는 Shangkun Wang, Nina Cai, Charles Hoong, Julian Walker, Gerson Kroiz, George Vanica, Deepak Patil, Andi Gavrilescu 외입니다. 초록과 PDF는 각각 arXiv:2609.04523, 같은 번호의 pdf에서 볼 수 있습니다.
가속기용 고성능 커스텀 커널 작성은 하드웨어 전문성이 필요한 복잡한 일이며, LLM과 실시간 컴파일러 피드백을 함께 쓰면 커널 생성용 에이전트 시스템을 만들 수 있다고 초록은 설명합니다.
이 글은 TPU 커널 생성이라는 논문 범위를 벗어나지 않습니다. GPU나 다른 가속기로 일반화하는 해석도 여기서는 덧붙이지 않습니다.
세 가지 패러다임으로 나뉜 멀티 에이전트 구조
초록에 따르면 MaxKernel은 TPU 커널 개발을 위한 멀티 에이전트 시스템이며, 세 가지 패러다임을 둡니다. 첫째는 Human-in-the-Loop(HITL)로 단계별 협업 설계를 다룹니다. 둘째는 Autonomous(Auto)로 metric/trace 기반의 완전 자동 최적화 루프입니다. 셋째는 Graph-Based Autonomous Search로, Auto 에이전트를 설계 공간 전역 탐색으로 확장한 방식입니다.
세 패러다임은 서로 완전히 분리된 구조가 아니라, 공통의 서브에이전트 풀을 공유합니다. 초록에서 언급하는 역할은 계획, 구현, 자기디버그, 테스트, 하드웨어 프로파일링입니다.
MaxKernel은 HITL 협업, 완전 자동 metric/trace 최적화 루프, 그래프 기반 자율 탐색이라는 세 패러다임을 두고, 계획·구현·자기디버그·테스트·하드웨어 프로파일링 전담 서브에이전트 풀을 공유합니다.
평가에 사용한 벤치와 워크로드
평가는 JaxBench TPU 커널 과제 50종과 최신 오픈소스 모델의 실제 워크로드를 함께 사용합니다. 이 대목에서 중요한 점은, 논문 초록이 단순한 코드 생성이 아니라 실제 워크로드까지 포함해 평가했다고 적고 있다는 사실입니다.
평가는 JaxBench TPU 커널 과제 50종과 최신 오픈소스 모델의 실제 워크로드를 함께 사용합니다.
초록은 MaxKernel이 고도로 최적화된 구현을 꾸준히 생성하며, 전문가 손튜닝 베이스라인에 맞추고 벤치 전반에서 유의한 성능을 낸다고 보고합니다. 다만 여기서도 퍼센트나 배속 같은 수치는 원문에 없는 이상 추가하지 않습니다.
이 논문에서 특히 눈에 띄는 지점
이 논문 초록이 눈에 띄는 이유는 커널을 생성했다는 주장과 하드웨어에서 측정했다는 주장을 함께 놓고 있기 때문입니다. 가속기 커널 작업에서는 생성 결과만으로 성능을 말하기 어렵고, 실제 프로파일링과 측정이 뒤따라야 의미가 생깁니다.
커널 생성만으로 성능을 주장하지 않고, 컴파일러 피드백과 하드웨어 프로파일링을 포함한 루프를 전제로 둔다는 점이 MaxKernel의 핵심입니다.
이 점은 논문을 읽는 사람뿐 아니라, 비슷한 자동화 실험을 옮겨보려는 팀에게도 기준이 됩니다. 생성 로그와 측정 로그를 분리해서 보기보다, 같은 실행 맥락 안에서 연결해 보는 것이 좋습니다.
오픈소스 공개 경로
초록은 에이전트가 오픈소스로 공개되었다고 적고 있으며, GitHub 경로도 함께 제시합니다. 공개 경로는 AI-Hypercomputer/accelerator-agents 아래 MaxKernel입니다.
이 글에서는 초록에 적힌 공개 링크만 남깁니다. 별도의 저장소나 추가 주소는 만들지 않습니다.
이 글이 다루지 않는 해석
모든 TPU 커널에서 전문가 베이스라인을 이긴다는 보증은 아닙니다. 여기서는 초록이 보고한 JaxBench 50종과 실제 워크로드 범위만 옮깁니다.
GPU나 다른 가속기에 바로 적용된다는 뜻도 아닙니다. 제목과 본문이 TPU 커널 생성을 대상으로 두고 있기 때문입니다.
HITL이 Auto보다 항상 낫다는 뜻도 아닙니다. 초록은 세 패러다임을 나란히 소개합니다.
참고 자료
arXiv:2609.04523 — MaxKernel: Agentic Kernel Generation for TPUs
PDF
GitHub: AI-Hypercomputer/accelerator-agents/tree/main/MaxKernel
이 논문 초록만 놓고 봤을 때, 여러분은 세 패러다임 가운데 어떤 방식이 실제 커널 개발 흐름에 가장 현실적이라고 보시는지 궁금합니다.