Um campo métrico para unir navegação robótica e buracos negros
Pesquisa no arXiv propõe um campo métrico contínuo treinado com uma única perda causal que descobre geometrias da navegação robótica ao horizonte de eventos de buracos negros.
Pesquisa no arXiv propõe um campo métrico contínuo treinado com uma única perda causal que descobre geometrias da navegação robótica ao horizonte de eventos de buracos negros.
Benchmark com 10.437 instâncias mostra que compilar não basta: 13,6% a 18,5% dos reparos aprovados alteram o conteúdo do documento; Typst é o formato mais difícil.
Estudo do arXiv localiza três modos de falha em sistemas de IA que leem documentos multi-página: representação, seleção e raciocínio. Visão é necessária, mas não substitui extração de texto, e integrar evidências entre páginas segue como principal gargalo.
Um artigo no arXiv propõe o DNSSE, método híbrido que usa LLM, execução simbólica e mutação estocástica para testar programas de IA distribuída. Nos benchmarks, a abordagem encontrou 2,9% mais bugs de concorrência e elevou a cobertura de branches de 68,6% para 91,6%.
Pesquisadores apresentam o IntelliAudit, sistema multiagente que avalia evidências de auditoria de TI com LLMs e mantém a supervisão humana como condição de uso.
Pesquisadores apresentam o AndroidReality, framework que mede a robustez de agentes móveis de IA sob perturbações realistas de interface. O estudo mostra que o desempenho em benchmarks limpos não se mantém no mundo real e propõe um mecanismo de correção sem treinamento.
Pesquisadores apresentam o CausalNav, um controlador que usa modelo de mundo causal com certificado de confiabilidade e se abstém de agir quando a previsão não é segura. O sistema liderou o ranking no estudo, e a conclusão central é que a abstenção certificada, mais que a precisão preditiva, foi o que tornou o modelo seguro de implantar.
Novo preprint submetido ao arXiv propõe controle autônomo de câmera laparoscópica com modelagem de atenção latente; o sistema foi validado em vídeos reais e em uma plataforma robótica física.
Pesquisa no arXiv propõe o Capability Ladder, framework de cinco níveis para atualizar currículos de computação na era da IA, com foco em realocação de tarefas e supervisão humana.
Pesquisa divulgada no arXiv propõe o primeiro benchmark para direção autônoma cooperativa com modelos VLA, além de um modelo que integra planejamento, raciocínio em linguagem natural e comunicação entre veículos conectados em uma única passagem.