Busca semântica do LinkedIn ganha novo framework com GPU e sobe precisão

Arquitetura de dois estágios com FP8 e FP16 eleva recall e corta custo computacional

Por Marcos Guimarães1 set 2026
Busca semântica do LinkedIn ganha novo framework com GPU e sobe precisão

O que aconteceu

O LinkedIn divulgou em 29 de agosto de 2026 o artigo técnico Efficient GPU Retrieval for Semantic Search (arXiv:2608.28968), descrevendo um framework de recuperação de informação alinhado à sua política de relevância. O sistema particiona os embeddings em oito segmentos supervisionados por categoria e aplica a mesma regra de agregação min/mediana usada pelo julgador LLM Graded Relevance (GR). Para multi-vector retrieval, a pontuação é calculada por slot e maximizada entre slots.

Em um teste A/B com membros randomizados, a precisão em consultas exploratórias (Precision@10) subiu de 63,7% para 79,0%. Em buscas navegacionais, o Precision@1 passou de 65,5% para 74,7%. Uma avaliação humana cega confirmou o ganho de Precision@10. Os números estão no resumo do artigo.

Contexto

A busca semântica do LinkedIn precisa encontrar perfis relevantes em um corpus de centenas de milhões de perfis a partir de perguntas em linguagem natural, como "a fintech founder in Berlin who worked in payments". A política de relevância adotada pela empresa é do tipo bottleneck: toda faceta ativa não negociável precisa ser satisfeita. O julgador LLM Graded Relevance, já existente, opera com agregação fixa de min/mediana sobre as notas das facetas.

O problema, segundo os autores, é que a similaridade de cosseno, usada tradicionalmente no primeiro estágio de recuperação (L0), tira a média das evidências. Isso permite que uma correspondência forte em uma faceta esconda uma falha em outra. O resultado era um limite na capacidade de recall do retrievador inicial.

Por que importa

Para quem usa o LinkedIn, a mudança significa respostas mais precisas em buscas complexas, do tipo que combina cargo, setor, localização e experiência. Para o mercado de tecnologia, o artigo mostra como uma empresa de grande escala está levando FP8 para produção. O ranker grosseiro em FP8 pontua o corpus inteiro e aumenta a capacidade por shard em 71%, além de elevar o throughput de matmul do Estágio 1 em 36%. Um estágio seguinte em FP16 reordena um conjunto de candidatos superamostrado e recupera 99,6% a 99,8% do recall obtido com FP16 puro, a mais de 500 consultas por segundo por réplica.

Impacto

O ganho de precisão veio sem trocar o julgador GR. O framework apenas alinha o retrievador à política de relevância. Em termos práticos, a melhoria aparece em combinações de facetas variadas, como mostram os 21 mil queries de validação. A empresa não divulgou custos, mas a capacidade extra por shard indica que o sistema consegue atender mais tráfego com o mesmo hardware.

Outro efeito relevante: a avaliação humana cega independente reforça que a alta de 63,7% para 79,0% não é ruído estatístico ou overfitting de métrica. Isso costuma ser o que falta em muitos papers de busca.

O que vem agora

O artigo foi submetido ao arXiv em 29 de agosto de 2026 e ainda não há versão publicada em conferência, nem indicação de liberação de código. O teste A/B com membros randomizados sugere que a solução já roda na infraestrutura do LinkedIn. O próximo passo esperado é a expansão da arquitetura para outros fluxos de busca, além de possíveis apresentações em conferências de recuperação de informação e sistemas.

Fonte: arXiv (arXiv:2608.28968)