MaxKernel: sistema multiagente gera kernels para TPUs e é open-sourced

Sistema multiagente publicado no arXiv combina LLMs e feedback de compilador em tempo real e alcança baselines ajustados à mão por especialistas

Por Marcos Guimarães7 set 2026
MaxKernel: sistema multiagente gera kernels para TPUs e é open-sourced

O que aconteceu

O MaxKernel é um sistema multiagente para geração de kernels de TPU apresentado em artigo publicado no arXiv em 3 de setembro de 2026 (arXiv:2609.04523v1). O MaxKernel, sistema desenvolvido para aceleradores do tipo TPU, implementa três paradigmas distintos de desenvolvimento de kernels.

O primeiro é um agente Human-in-the-Loop (HITL), voltado ao design colaborativo, passo a passo, com o humano no comando. O segundo é um agente Autônomo (Auto), que executa um ciclo de otimização totalmente automatizado guiado por métricas e traces. O terceiro é uma Busca Autônoma Baseada em Grafos (Graph-Based Autonomous Search), que escala o agente Auto para exploração global do espaço de design.

Os três paradigmas compartilham um mesmo pool de sub-agentes especializados. Esses sub-agentes cuidam de planejamento, implementação, auto-depuração (self-debugging), testes e profiling de hardware. O código do MaxKernel foi aberto no repositório AI-Hypercomputer no GitHub, dentro do projeto accelerator-agents.

Contexto

Escrever kernels customizados de alta performance para aceleradores é uma tarefa complexa que exige expertise profunda em nível de hardware. É o tipo de trabalho reservado a poucos engenheiros no mundo, e um gargalo real para quem treina e roda modelos em TPUs.

A proposta do artigo é usar Large Language Models (LLMs) combinados com feedback de compilador em tempo real para construir sistemas agênticos capazes de fazer esse trabalho. Em vez de substituir o compilador, o agente o usa como oráculo: cada tentativa de código recebe retorno real do compilador, o que permite corrigir erros e refinar a implementação em ciclos sucessivos.

A avaliação foi feita no JaxBench, uma suíte abrangente com 50 tarefas de kernel diversas para TPUs, além de workloads complexos e reais de modelos open-source de ponta. Os resultados mostram que o MaxKernel gera consistentemente implementações altamente otimizadas, alcançando baselines ajustados à mão por especialistas e entregando ganhos de performance significativos no benchmark.

Por que importa

O resultado central é que um sistema agêntico alcança o nível de kernels escritos por especialistas humanos. Isso reduz a dependência de um talento técnico raro e caro. Times que rodam cargas de trabalho em TPUs, hoje em grande parte associadas ao ecossistema JAX e à infraestrutura do Google Cloud, podem gerar kernels otimizados sem contratar especialistas em compiladores e arquitetura de aceleradores.

O fato de o MaxKernel estar open-sourced no GitHub muda o jogo na prática. Qualquer equipe pode baixar o agente, rodá-lo contra seus próprios workloads e comparar com suas implementações manuais. O JaxBench, com suas 50 tarefas, também serve de referência pública para medir progresso futuro na área.

Impacto

No curto prazo, o efeito mais direto é em equipes de engenharia de ML que usam TPUs. Workloads de modelos open-source de estado da arte, citados no artigo como parte da avaliação, são exatamente o tipo de carga em que um kernel mal otimizado custa tempo e dinheiro de computação.

No médio prazo, a abordagem de três paradigmas aponta para um padrão de trabalho híbrido. O agente HITL serve para engenheiros que querem colaborar passo a passo. O agente Auto e a busca baseada em grafos servem para exploração autônoma do espaço de design, algo inviável manualmente dado o tamanho do espaço de possíveis implementações de um kernel.

A combinação de LLM com feedback de compilador em tempo real também estabelece uma receita replicável. O mesmo esquema de sub-agentes para planejamento, implementação, self-debugging, testes e profiling pode ser adaptado a outros tipos de acelerador.

O que muda

Para o mercado brasileiro, onde acesso a hardware especializado é caro e escasso, ferramentas open-source que automatizam otimização de baixo nível diminuem a barreira de entrada. Um time com orçamento limitado pode extrair mais performance da mesma infraestrutura de TPU sem contratar especialistas em kernels.

Para a pesquisa em sistemas agênticos, o MaxKernel é mais uma evidência de que agentes especializados com ferramentas reais (compiladores, profilers) superam abordagens de geração de código pura. O pool compartilhado de sub-agentes entre os três paradigmas sugere uma arquitetura modular que outros grupos devem copiar.

O que vem agora

O artigo foi submetido ao arXiv em 3 de setembro de 2026 e o código já está disponível publicamente no GitHub, no repositório AI-Hypercomputer/accelerator-agents, na pasta MaxKernel. O próximo passo natural é a adoção pela comunidade: contribuições externas, extensões do JaxBench e adaptações do sistema a novos workloads devem mostrar se os resultados do benchmark se sustentam em produção.