Baszta: classificador polonês de segurança e micro F1 enganoso
Paper no arXiv mostra que micro F1 de 0,910 pode ser atingido por estratégia degenerada no benchmark Gadzi Język
O que aconteceu
O arXiv publicou em 24 de setembro de 2026 o paper Baszta: Data-Centric Fine-Tuning of a Polish Multi-Label Safety Classifier. O trabalho descreve um classificador multirrótulo de segurança de conteúdo em polonês criado a partir do modelo allegro/herbert-base-cased, de 124 milhões de parâmetros, ajustado com objetivo Focal + R-Drop para cinco categorias: ódio, vulgaridade, conteúdo sexual, crime e automutilação.
A avaliação colocou o Baszta contra o Bielik Guard (Sójka) no benchmark out-of-distribution Gadzi Język. Os dois sistemas receberam ajuste de threshold por categoria no mesmo split de calibração. Com esse protocolo igualado, o modelo do paper mantém uma liderança pequena, mas estatisticamente significativa, em micro F1. A aparente vantagem em macro F1 não resiste ao controle: era artefato de comparar um modelo ajustado com outro sem ajuste. A Seção 4 do paper traz os números por categoria e por protocolo.
Contexto
O Gadzi Język é um benchmark compartilhado com 97% de exemplos crime-positivos. Esse desequilíbrio é o centro da crítica metodológica. Um classificador que marca crime em toda entrada e nada mais já alcança 0,910 de micro F1 no mesmo test split. A métrica micro, portanto, não separa o Baszta nem o Bielik Guard de uma estratégia degenerada. Macro F1 é a coluna que faz essa distinção.
O Baszta usa fine-tuning data-centric sobre um modelo de 124M. A comparação com Bielik Guard (Sójka) ocorre sob o mesmo ajuste de threshold por categoria, o que reduz a chance de vitória artificial. O paper também analisa o que acontece quando o conjunto de calibração não representa o mundo real.
Por que importa
Para equipes que implantam moderação de conteúdo em polonês, a escolha da métrica define qual sistema chega à produção. O caso do Gadzi Język mostra que micro F1 pode premiar um sistema que marca crime em todo texto. Se 97% do benchmark é crime, acertar crime em tudo parece bom no papel e falha em qualquer entrada segura.
A calibração é o ponto crítico. Thresholds ajustados no Gadzi Język marcam crime em toda entrada segura, porque o benchmark quase não contém texto seguro. Um refit balanceado entrega um ponto operacional implantável, mas cobra recall adversarial. O paper relata os dois pontos operacionais, não só o número favorável.
Impacto
O gap residual out-of-distribution é de calibração, não de discriminação. A qualidade de ranking permanece alta, enquanto as probabilidades positivas colapsam. Temperature scaling por categoria recupera a perda onde Platt scaling e isotonic regression não conseguem. Essa recuperação depende de o conjunto de calibração conter texto seguro.
Duas práticas comuns, ponderação sensível a custo por classe e mean pooling, aumentam macro F1 in-distribution e reduzem a métrica out-of-distribution. O resultado indica que robustez precisa ser selecionada diretamente. Ela não é herdada da acurácia in-distribution.
O que muda
O paper desloca a discussão de qual modelo vence para qual protocolo de avaliação é válido. A liderança em micro F1 do Baszta existe sob threshold tuning por categoria, mas não distingue o sistema de um classificador que só marca crime. A liderança em macro F1 não sobrevive quando os dois modelos são ajustados.
Para quem compra ou constrói classificadores de segurança, a lição prática é separar métricas de ranking, calibração e operação. O material não anuncia código, dataset ou cronograma de implantação. A contribuição está no protocolo e nos números da Seção 4.
O que vem agora
O abstract não detalha próximos passos, datas de revisão ou planos de deploy. O que está público é o ponto de operação com refit balanceado e o ponto sem ele, com trocas explícitas entre recall adversarial e falsos positivos. Os números por categoria e por protocolo estão na Seção 4.
A pesquisa também deixa uma agenda para benchmarks de segurança em polonês: incluir texto seguro na calibração e reportar macro F1 ao lado de micro F1. Sem isso, a avaliação continua sujeita a conclusões infladas.
