SBCO: método auto-supervisionado otimiza agentes de planejamento
Novo método self-supervised para otimizar agentes de planejamento reduz custo computacional em até 5,5 vezes, dispensando rótulos humanos.
Novo método self-supervised para otimizar agentes de planejamento reduz custo computacional em até 5,5 vezes, dispensando rótulos humanos.
Pesquisadores apresentam o CHORUS, framework que pós-treina um modelo de 4B para gerar estímulos de testbench com 88% de acerto, superando o DeepSeek-R1 de 671B em verificação de hardware.
Pesquisadores criaram o AEROBAT, primeiro sistema multiagente a automatizar a pesquisa comportamental sobre agentes de IA. O estudo em preprint no arXiv testou 79 hipóteses por meio de 1.240 experimentos controlados.
Pesquisadores propõem o ReCBM, um framework que usa incerteza para guiar o raciocínio relacional em Concept Bottleneck Models, melhorando a confiabilidade quando conceitos estão ausentes ou invertidos.
O framework SPOT usa amostragem e simulação para explicar decisões de agentes de deep reinforcement learning, com demonstração no controle de semáforos via SUMO-RL.
A OpenAI enviou uma carta pública ao governador do Texas defendendo infraestrutura de IA responsável e crescimento transparente no estado. O documento, publicado no blog oficial, já repercute em comunidades de tecnologia.
A SpaceXAI lançou o Grok Bot, um agente de IA persistente que opera aplicativos por US$ 120 mensais, transformando assistentes em colegas digitais que trabalham continuamente.
A OpenAI divulgou um guia com casos de uso do ChatGPT Work para times de ciência de dados, incluindo briefs de causa raiz, memorandos de KPI e especificações de dashboards. O material mostra como gerar documentos estruturados a partir de entradas reais de trabalho.
OpenAI detalha GPT-Live, sistema de voz contínua sem turnos com baixa latência, construído em seis meses. Tecnologia promete conversas mais naturais com IA.
Benchmark SEE mostra que o melhor modelo multimodal acerta só 48,7% em questões científicas; ferramentas elevam para 52,7%, mas ainda insuficiente para uso real em laboratório.