IB-RL: novo método de RL para agentes de diálogo estratégico
Pesquisa propõe treinar os dois lados de um diálogo estratégico com reinforcement learning isolado. O método atingiu 98,4% de acordo contra o DeepSeek V4 Pro em Deal-or-NoDeal, ante 86,4% do melhor baseline unilateral.
