DyRIS: LLM prevê grupos espaciais em perovskitas duplas

Framework usa aprendizado dinâmico com poucos exemplos para prever classes minoritárias em dados desbalanceados.

Por Redação Mapa Paper
DyRIS: LLM prevê grupos espaciais em perovskitas duplas

O que aconteceu

Em 11 de agosto de 2026, pesquisadores submeteram ao arXiv, na categoria de Inteligência Artificial (cs.AI), o artigo "Predicting Space Groups of Double Perovskites by LLM with Dynamic Few-Shot Learning" (arXiv:2608.10483). O trabalho apresenta o DyRIS (Dynamic and Diversity-enhanced Few-shot Retrieval and Rule-Guided Inference for Space-Group Prediction), um framework baseado em agentes LLM que prevê e ranqueia candidatos de grupos espaciais (SGs) de perovskitas duplas a partir da composição química. O método usa few-shot prompting dinâmico com diversidade — recupera exemplos relevantes e limita a dominância dos grupos espaciais frequentes — e combina isso com inferência guiada por regras, baseada na ordenação de cátions B/B', indicadores quantitativos e controle do viés das classes majoritárias. Avaliado em 3.528 entradas termodinamicamente filtradas, com proporção de dados de treino de 0,5, o DyRIS obteve acurácia geral competitiva e o melhor macro-F1 Top-1 geral. Nas classes minoritárias, a precisão Top-1 subiu 3,26 pontos percentuais em relação ao CrabNet, com Top-3 superior ao baseline mais forte baseado em PyCaret (fonte: arXiv).

Contexto

Perovskitas duplas atraem interesse pela ampla variação composicional que oferecem. O obstáculo é prever o grupo espacial de estruturas estáveis — informação fundamental sobre a simetria de um cristal — porque os conjuntos de dados disponíveis são fortemente desbalanceados. Poucas classes dominantes (major SGs) concentram a maior parte dos exemplos, enquanto a maioria das classes (minor SGs) é sub-representada. Modelos treinados nesses dados favorecem as classes dominantes e erram justamente nas raras. O DyRIS ataca o problema onde ele aparece: na seleção dos exemplos apresentados ao LLM no prompt.

Por que importa

O grupo espacial define a simetria do cristal e, em grande medida, suas propriedades. Para a descoberta de materiais, prever essa informação a partir da composição é etapa crítica. Um método que melhora a previsão de classes minoritárias sem sacrificar a acurácia geral tem aplicação direta na triagem computacional de compostos e na exploração da variação composicional das perovskitas duplas. O estudo também mostra que o raciocínio de LLMs pode ser combinado com conhecimento cristalográfico para enfrentar um problema que classificadores convencionais não resolvem bem — uma estratégia transferível para outros bancos de dados desbalanceados de materiais.

Impacto

Os estudos de ablação indicam que cada componente contribui para o resultado: a recuperação com diversidade, os indicadores quantitativos, o controle do viés das classes majoritárias e a informação de ordenação B/B'. Os autores mostram ainda que a etapa final de inferência guiada por regras não é facilmente substituída por modelos convencionais de classificação ou ranqueamento — sinal de que o conhecimento de domínio ocupa um papel específico no pipeline. No médio prazo, a abordagem pode ser adaptada a outras tarefas de classificação desbalanceada e a outras famílias de compostos.

O que muda

O DyRIS propõe um desenho alternativo ao usual: em vez de tratar o LLM como substituto de modelos físicos, o framework o usa como componente que combina exemplos relevantes e regras do domínio. Para quem trabalha com descoberta de materiais assistida por IA, o ponto novo é tratar os dados raros de forma ativa, com um prompt construído dinamicamente para equilibrar a representação das classes na inferência, em vez de aceitar o viés das classes dominantes.

O que vem agora

O preprint está disponível no arXiv (arXiv:2608.10483) e não detalha os próximos passos. O desdobramento esperado é a extensão do framework para outros conjuntos de dados, a integração com tarefas de previsão de propriedades e a validação experimental das previsões. Por ora, o resultado sustenta uma conclusão específica: a recuperação de exemplos com diversidade, somada a regras cristalográficas, melhora a previsão de grupos espaciais em dados desbalanceados.

Fontes

  • arXiv — "Predicting Space Groups of Double Perovskites by LLM with Dynamic Few-Shot Learning" (arXiv:2608.10483). Disponível em: https://arxiv.org/abs/2608.10483