Evaluation-Conditioned Training: treinar IA para supervisão imperfeita
Um framework de pós-treinamento apresentado na arXiv ensina LLMs a compensar feedback imperfeito; em testes, reduziu sycophancy e melhorou a imparcialidade na geração de notícias.
