MAPA PAPER
  • IA
  • Tech
  • Negócios
  • Startups
  • Games
Newsletter
  • IA
  • Tech
  • Negócios
  • Startups
  • Games
  • Sobre
  • Metodologia
  • Newsletter
  • Home
  • Categoria
  • IA
Limitar o juiz de IA supera voto majoritário em pipelines

Limitar o juiz de IA supera voto majoritário em pipelines

Estudo do arXiv mostra que, em pipelines de raciocínio, a regra de decisão importa mais que a acurácia do LLM judge. Limitar o poder do juiz com certificados de evidência superou voto majoritário e juiz livre em GSM8K e HotpotQA.

Por Redação Mapa Paper11 ago
GRACE: clustering de dados mistos com semântica de LLMs

GRACE: clustering de dados mistos com semântica de LLMs

Pesquisadores apresentaram o GRACE, um framework que usa LLMs para clusterizar dados tabulares mistos com custo computacional reduzido. O método superou 11 concorrentes em precisão e interpretabilidade, mantendo a escalabilidade das abordagens estatísticas.

Por Redação Mapa Paper11 ago
Reason Wide, Not Deep: como amortizar o custo do raciocínio em IA

Reason Wide, Not Deep: como amortizar o custo do raciocínio em IA

Pesquisa do arXiv propõe destilar skills de trajetórias existentes para recuperar até 100% da vantagem do modo de raciocínio do GPT-5.4-mini com até 6x menos tokens. A técnica foi validada em quatro benchmarks de agentes.

Por Redação Mapa Paper11 ago
GraphThink: grafos reduzem alucinações em agentes incorporados

GraphThink: grafos reduzem alucinações em agentes incorporados

Framework GraphThink integra grafos de tarefa e de cena ao raciocínio de LLMs e alcança desempenho de última geração no benchmark ALFRED, superando modelos comerciais por API em tarefas de horizonte longo.

Por Redação Mapa Paper11 ago
CliniCARE-Bench: benchmark testa IA em auditoria de prontuários

CliniCARE-Bench: benchmark testa IA em auditoria de prontuários

Pesquisadores lançam na arXiv o CliniCARE-Bench, benchmark que avalia agentes de IA em 750 casos baseados em prontuários reais e indica que acurácia bruta esconde falhas de processo.

Por Redação Mapa Paper11 ago
Telemetria de agentes de IA detecta falhas, mas não a origem delas

Telemetria de agentes de IA detecta falhas, mas não a origem delas

Benchmark lançado no arXiv mostra que LLMs detectam falhas em agentes de IA com até 100% de F1, mas localizar a origem do defeito com telemetria padrão fica perto de zero.

Por Redação Mapa Paper11 ago
KGCache: cache para acelerar consultas a knowledge graphs em LLMs

KGCache: cache para acelerar consultas a knowledge graphs em LLMs

Pesquisadores propõem o KGCache, um cache em memória para vizinhanças de knowledge graphs que acelera a recuperação de grafos em até 1,91x em workloads de perguntas e respostas com LLMs.

Por Redação Mapa Paper11 ago
Contaminação em benchmarks: estudo define quando é detectável

Contaminação em benchmarks: estudo define quando é detectável

Estudo submetido ao arXiv formaliza quando a contaminação de benchmarks de IA é detectável e mostra que 'sem evidência' pode refletir apenas uma auditoria sem poder estatístico. A eficácia dos detectores pode ser estimada antes da auditoria, mas orçamentos simples falham em amostras pequenas.

Por Redação Mapa Paper11 ago
TongGuOCR: framework de IA melhora leitura de documentos históricos chineses

TongGuOCR: framework de IA melhora leitura de documentos históricos chineses

Pesquisadores submetem ao arXiv o TongGuOCR, framework que combina consciência de layout e aumento de tokens para transcrever documentos históricos chineses. No benchmark M5HisDoc, o sistema supera modelos de OCR tradicionais e MLLMs, com redução expressiva de erros.

Por Redação Mapa Paper11 ago
AndroidReality: agentes móveis de IA falham no mundo real

AndroidReality: agentes móveis de IA falham no mundo real

Pesquisadores apresentam o AndroidReality, framework que mede a robustez de agentes móveis de IA sob perturbações realistas de interface. O estudo mostra que o desempenho em benchmarks limpos não se mantém no mundo real e propõe um mecanismo de correção sem treinamento.

Por Redação Mapa Paper11 ago
  • 4
  • 5
  • 6
  • 7
  • 8
  • →

Mais Lidas

Google propõe algoritmos para agendamento com capacidade variável

Google propõe algoritmos para agendamento com capacidade variável

Por Redação Mapa Paper11 ago
OpenAI lança GPT-5.6-Cyber com recusas reduzidas

OpenAI lança GPT-5.6-Cyber com recusas reduzidas

Por Redação Mapa Paper11 ago
AWS integra Continuum ao Codex e Claude Code em aposta pela camada de segurança

AWS integra Continuum ao Codex e Claude Code em aposta pela camada de segurança

Por Redação Mapa Paper11 ago
Google pesquisa IA para ajudar leigos a entender condições de pele

Google pesquisa IA para ajudar leigos a entender condições de pele

Por Redação Mapa Paper11 ago
Por que a intenção de compra gerada por IA raramente vira venda

Por que a intenção de compra gerada por IA raramente vira venda

Por Redação Mapa Paper11 ago
MAPA PAPER

Redação autônoma especializada em inteligência artificial, tecnologia, negócios, startups e games.

Categorias

  • IA
  • Tech
  • Negócios
  • Startups
  • Games

Institucional

  • Sobre
  • Metodologia
  • Política Editorial
  • Correções
  • Fontes
  • Contato

Assine a Newsletter

Receba o melhor do Mapa Paper no seu email.

© 2026 The Mapa Paper. Todos os direitos reservados.

PrivacidadeTermos