Kog quer extrair mais inferência de GPUs com software
Startup francesa aposta em software para acelerar modelos grandes em GPUs que empresas já possuem, mirando agentes de IA.
O que aconteceu
A Kog, startup francesa criada pelo fundador único Gaël Delalleau, demonstrou que é possível obter "decodificação de requisições extremamente rápida em GPUs de datacenter padrão que as empresas já possuem", segundo o TechCrunch. No teste, feito em maio com GPUs AMD MI300X e NVIDIA H200, a empresa registrou 3.000 tokens por segundo (TPS) por requisição — usando, porém, o modelo aberto Laneformer 2B, de cerca de 2 bilhões de parâmetros. A meta declarada é chegar a uma inferência de LLMs 30 vezes mais rápida.
O teste virou destaque na primeira página do Hacker News e, segundo Delalleau, gerou "200 leads comerciais concretos".
Contexto
A corrida por inferência mais rápida ganhou força em maio com a estreia da Cerebras na bolsa, recebida com entusiasmo pelo mercado por seus chips dedicados. A Kog segue o caminho oposto: em vez de hardware novo, quer extrair mais das GPUs existentes. A tese é que o gargalo de memória deixou de ser o limite que era — GPUs mais novas têm cada vez mais largura de banda de memória "que só pede para ser liberada".
A startup também percebeu que o mercado ainda não está maduro para ajuste fino de modelos pequenos. "Desde o lançamento, estamos totalmente focados em acelerar o desenvolvimento de modelos maiores para atender à demanda que vimos", disse o CEO.
Por que importa
Velocidade de inferência virou custo e experiência do usuário. A Anthropic, dona do Claude, cobra um múltiplo de preço pelo modo rápido (Fast Mode) — sinal claro de que tempo vale dinheiro. Usuários de Claude Code, ferramenta de codificação com agente de IA, às vezes esperam horas por um resultado. Se a Kog conseguir aplicar a mesma técnica em modelos grandes rodando em GPUs comuns, empresas ganham velocidade sem trocar de infraestrutura.
Impacto
No curto prazo, o primeiro caso de uso deve ser engenharia de software, área em que a espera por agentes atrapalha o trabalho profissional. A Kog também tem design partners que geram games e aplicativos a partir de um prompt e para quem uma resposta mais rápida, via Kog Inference Engine (KIE), significa mais receita.
Se a abordagem funcionar em LLMs grandes, a ideia de que GPUs são mal adaptadas a fluxos agênticos (agentic workflows) perde força. E o mercado de chips dedicados ganha um concorrente inesperado: software.
O que muda
A narrativa de que o futuro da inferência pertence apenas a hardware especializado. "As GPUs têm um futuro brilhante", afirma Delalleau, para quem a noção de que elas não servem para decodificação virou um equívoco. Para empresas que já investiram pesado em infraestrutura, isso muda o cálculo: otimização de software pode adiar a troca de hardware.
O que vem agora
O desafio da Kog é grande. A demonstração impressionante veio de um modelo de 2 bilhões de parâmetros; falta provar que a técnica escala para LLMs de dezenas ou centenas de bilhões de parâmetros, exatamente o tipo de modelo que costuma travar chips de inferência. Os próximos benchmarks da startup em modelos grandes vão dizer se a promessa de 30x se sustenta.
Fontes
- TechCrunch: "Kog is going deeper to squeeze more inference out of GPUs" — https://techcrunch.com/2026/08/14/kog-is-going-deeper-to-squeeze-more-inference-out-of-gpus/
