Kog quer extrair mais inferência de GPUs com software

Startup francesa aposta em software para acelerar modelos grandes em GPUs que empresas já possuem, mirando agentes de IA.

Por Marcos Guimarães14 ago 2026
Kog quer extrair mais inferência de GPUs com software

O que aconteceu

A Kog, startup francesa criada pelo fundador único Gaël Delalleau, demonstrou que é possível obter "decodificação de requisições extremamente rápida em GPUs de datacenter padrão que as empresas já possuem", segundo o TechCrunch. No teste, feito em maio com GPUs AMD MI300X e NVIDIA H200, a empresa registrou 3.000 tokens por segundo (TPS) por requisição — usando, porém, o modelo aberto Laneformer 2B, de cerca de 2 bilhões de parâmetros. A meta declarada é chegar a uma inferência de LLMs 30 vezes mais rápida.

O teste virou destaque na primeira página do Hacker News e, segundo Delalleau, gerou "200 leads comerciais concretos".

Contexto

A corrida por inferência mais rápida ganhou força em maio com a estreia da Cerebras na bolsa, recebida com entusiasmo pelo mercado por seus chips dedicados. A Kog segue o caminho oposto: em vez de hardware novo, quer extrair mais das GPUs existentes. A tese é que o gargalo de memória deixou de ser o limite que era — GPUs mais novas têm cada vez mais largura de banda de memória "que só pede para ser liberada".

A startup também percebeu que o mercado ainda não está maduro para ajuste fino de modelos pequenos. "Desde o lançamento, estamos totalmente focados em acelerar o desenvolvimento de modelos maiores para atender à demanda que vimos", disse o CEO.

Por que importa

Velocidade de inferência virou custo e experiência do usuário. A Anthropic, dona do Claude, cobra um múltiplo de preço pelo modo rápido (Fast Mode) — sinal claro de que tempo vale dinheiro. Usuários de Claude Code, ferramenta de codificação com agente de IA, às vezes esperam horas por um resultado. Se a Kog conseguir aplicar a mesma técnica em modelos grandes rodando em GPUs comuns, empresas ganham velocidade sem trocar de infraestrutura.

Impacto

No curto prazo, o primeiro caso de uso deve ser engenharia de software, área em que a espera por agentes atrapalha o trabalho profissional. A Kog também tem design partners que geram games e aplicativos a partir de um prompt e para quem uma resposta mais rápida, via Kog Inference Engine (KIE), significa mais receita.

Se a abordagem funcionar em LLMs grandes, a ideia de que GPUs são mal adaptadas a fluxos agênticos (agentic workflows) perde força. E o mercado de chips dedicados ganha um concorrente inesperado: software.

O que muda

A narrativa de que o futuro da inferência pertence apenas a hardware especializado. "As GPUs têm um futuro brilhante", afirma Delalleau, para quem a noção de que elas não servem para decodificação virou um equívoco. Para empresas que já investiram pesado em infraestrutura, isso muda o cálculo: otimização de software pode adiar a troca de hardware.

O que vem agora

O desafio da Kog é grande. A demonstração impressionante veio de um modelo de 2 bilhões de parâmetros; falta provar que a técnica escala para LLMs de dezenas ou centenas de bilhões de parâmetros, exatamente o tipo de modelo que costuma travar chips de inferência. Os próximos benchmarks da startup em modelos grandes vão dizer se a promessa de 30x se sustenta.

Fontes