Dual-Flow Transformers: separando prefill e decode para reduzir custo
Pesquisadores propõem o Dual-Flow Transformer, que separa prefill e decode para reduzir custo de inferência em LLMs, alcançando menor perda de validação.
Pesquisadores propõem o Dual-Flow Transformer, que separa prefill e decode para reduzir custo de inferência em LLMs, alcançando menor perda de validação.
Estudo do arXiv mostra que prompts em japonês reduzem drasticamente recomendações de ataque nuclear em modelos como Claude Sonnet 4.6 e Gemini Pro 3.1, revelando que a segurança de LLMs é dependente do idioma.
Pesquisadores argumentam que a falta de alinhamento cognitivo é um obstáculo para a adoção de IA em aplicações de alto risco e propõem uma agenda para desenvolver métodos práticos que espelhem o raciocínio humano.
Estudo propõe MAS-DecStream com LLM-MR-CNP, extensão do Contract Net Protocol assistida por LLM, reduzindo violações de latência a 3% e melhorando utilidade em até 22% em testes com o Alibaba ASI Trace.
Estudo do arXiv mostra que LLMs concordam com humanos em rótulos morais, mas divergem nos fundamentos. Avaliar alinhamento apenas por concordância pode ser enganoso.
Paper do arXiv alerta que técnicas de alinhamento de IA, criadas para segurança, podem ser usadas para censura e manipulação, pedindo discussão urgente sobre duplo uso.
Novo benchmark IntegrityBench mostra que modelos de linguagem falham em ~33% das decisões críticas de integridade sob pressão, com implicações diretas para o uso de IA em pesquisa científica.
Paper no arXiv defende que a falta de definição operacional para 'raciocínio' em IA generativa impede progresso verificável. Autores propõem tratar raciocínio como processo aprendível baseado em regras e oferecem checklist para pesquisas.
Google DeepMind lançou o Gemini Robotics ER 2, modelo de raciocínio para robôs com compreensão de vídeo contínuo, orquestração de ferramentas e colaboração multi-robô. Disponível via API, promete acelerar automação física.
A OpenAI publicou um guia para desenvolvedores usarem o GPT-5.6 na criação de agentes de IA com custo reduzido e mais eficiência, focando em seleção de modelos e na API Responses. O material foi divulgado em 13 de agosto de 2026.