Guixu: valoração de dados on-chain para agentes de IA
Pesquisa publicada no arXiv descreve o Guixu, sistema que combina valoração de dados, orçamento e atestação on-chain para agentes de IA autônomos comprarem datasets de forma verificável.
Pesquisa publicada no arXiv descreve o Guixu, sistema que combina valoração de dados, orçamento e atestação on-chain para agentes de IA autônomos comprarem datasets de forma verificável.
OpenAI expande o Daybreak com o GPT-5.6-Cyber, modelo especializado em cibersegurança para pesquisa autorizada de vulnerabilidades, validação de exploits e testes de segurança.
Pesquisa divulgada no arXiv propõe o primeiro benchmark para direção autônoma cooperativa com modelos VLA, além de um modelo que integra planejamento, raciocínio em linguagem natural e comunicação entre veículos conectados em uma única passagem.
Pesquisadores apresentam um solver GPU que torna o soft top-k exato e diferenciável em escala de milhões, com overhead de milissegundos e aceleração de uma ordem de grandeza em aplicações esparsas.
Novo benchmark com 10.130 perguntas mostra que LLMs de ponta erram cadeias de raciocínio contrafactual e variam respostas conforme a ordem dos dados; método de treinamento ORLF reduz o problema.
Position paper submetido ao arXiv propõe a argumentação computacional como base formal para a Evaluative AI, abordagem que apresenta hipóteses concorrentes com evidências em vez de recomendações únicas.
Paper submetido ao arXiv em 8 de agosto de 2026 apresenta um pipeline que gera benchmarks automáticos para avaliar LLMs na criação de fórmulas, gráficos, tabelas dinâmicas e formatação condicional em planilhas.
Preprint submetido ao arXiv propõe o Data-Centric Parallel, método que ajusta configurações de treinamento distribuído com base no comprimento das sequências de cada lote. Resultados preliminares indicam speedup de até 2,88x em 32 GPUs H200, com integração de cerca de 10 linhas de código.
O NL2SHACL-Bench, novo benchmark para tradução de linguagem natural para SHACL, mostra que LLMs de ponta produzem sintaxe válida, mas erram a semântica em padrões complexos. A suíte foi apresentada em artigo submetido ao arXiv em 24 de julho de 2026.
A OpenAI classificou como infundado o processo movido pela Apple, corrigiu alegações sobre seus funcionários e divulgou mensagens para documentar sua versão do caso.