2D-FET-Bench V2 testa IA no design de transistores em flakes 2D
Estudo no arXiv avalia GPT5.6-Luna na construção geométrica de FETs sobre flakes exfoliados, tarefa hoje feita à mão.
O que aconteceu
O paper 2D-FET-Bench V2, disponível em arXiv:2610.07423v1, foi submetido em 5 de outubro de 2026 e introduz um benchmark executável para testar se agentes de modelo de linguagem conseguem realizar a construção de layouts de FET específicos para cada flake. O conjunto reúne 128 tarefas de layout criadas a partir de contornos de flakes derivados de microscopia. A versão V2 inclui flakes com buracos e tarefas que envolvem múltiplos flakes.
Cada tarefa fornece uma especificação textual do dispositivo e as coordenadas do contorno. O agente gera operações tipadas de polígono e caminho, que são renderizadas no formato GDSII. Um verificador determinístico checa requisitos geométricos e estruturais, e uma verificação de integridade separada confirma que os contornos fornecidos permanecem inalterados. Layouts de referência roteirizados passam em todas as 128 tarefas, o que demonstra que cada uma é solucionável.
Contexto
Layouts de transistores de efeito de campo em flakes bidimensionais exfoliados costumam ser desenhados à mão para cada flake. O projetista posiciona contatos e gates de acordo com a posição e o contorno vistos em micrografias ópticas. O paper afirma que, até onde os autores sabem, nenhum benchmark executável testava se agentes de modelo de linguagem podiam realizar essa construção específica de forma confiável.
Por que importa
A automação do desenho de layout para flakes 2D pode reduzir o esforço manual e permitir que a fabricação de dispositivos escale. O benchmark fornece uma medida objetiva de quão perto os modelos de linguagem estão dessa tarefa. Quem trabalha com eletrônica de materiais bidimensionais ganha uma referência para avaliar agentes, e quem desenvolve modelos de linguagem obtém um teste de raciocínio espacial aplicado.
Impacto
O estudo avaliou seis modelos e sete variantes de workflow e scaffold do GPT5.6-Luna, com cinco tentativas por tarefa. A configuração ReAct-3 superou o Plan-and-Execute de uma passada em 27,0 pontos pass@1, mas consumiu 2,46 vezes mais tokens. Uma auditoria especializada de um layout amostrado que passou no verificador por tarefa coberta, em cinco configurações ReAct-3, aceitou entre 56,4% e 63,5% deles. Isso indica que parte dos layouts aprovados pelo verificador ainda é rejeitada por especialistas humanos.
O que muda
O 2D-FET-Bench V2 estabelece uma métrica executável para a construção geométrica e estrutural de layouts de FET. A diferença entre cobertura e consistência mostra que os modelos acertam em algumas tentativas, mas ainda não entregam resultados repetíveis. A auditoria humana revela que o verificador determinístico não captura todos os critérios de qualidade. Para laboratórios e empresas que fabricam dispositivos em flakes 2D, a adoção de agentes de layout exige camadas adicionais de validação.
O que vem agora
O paper não detalha cronograma de expansão do benchmark nem planos de incorporar novos modelos além dos seis avaliados. A versão V2 já cobre flakes com buracos e tarefas multi-flake. A avaliação de consistência com cinco tentativas por tarefa deve continuar sendo o principal gargalo para uso prático.
Fontes
- arXiv: 2d-fet-bench: from spatial reasoning to fet design on flakes. arXiv:2610.07423v1. https://arxiv.org/abs/2610.07423
