XKV acelera comunicação entre LLMs heterogêneos com cache latente
Técnica traduz caches key-value entre modelos e treina 76% menos parâmetros
O que aconteceu
Pesquisadores submeteram ao arXiv, em 20 de agosto de 2026, o artigo "Dual-Cache Latent Space Communication between Heterogeneous Language Models" (arXiv:2608.20617). O trabalho apresenta o XKV, um protocolo de comunicação latente que permite que dois grandes modelos de linguagem (LLMs) de famílias diferentes troquem informações sem gerar texto.
O XKV, técnica criada para sistemas multi-agente, opera sobre o cache key-value (KV) dos dois modelos. Em vez de converter o conhecimento do modelo que detém a resposta (o Sharer) em palavras, o protocolo traduz esse cache diretamente para o espaço interno do modelo que precisa da informação (o Receiver). Os testes cobriram 45 configurações de pares de modelos e datasets: seis pares heterogêneos e três pares do mesmo modelo em ordens diferentes, avaliados em cinco bases de dados.
Os resultados, descritos no resumo do artigo, mostram o XKV com a maior macro score e o melhor rank médio entre os métodos comparados. Sobre o ROPES, o XKV superou o LCF-X em 4,6 pontos de exact-match e 4,2 pontos de F1. Na comparação com a comunicação por texto, o XKV venceu em quatro dos cinco datasets. A tradução de um par de caches leva 5,8 ms, contra 59,9 ms do LCF-X, um ganho de 10,3 vezes. De ponta a ponta, o processo completo é 26% mais rápido que o LCF-X e 6,8 vezes mais rápido que a comunicação textual.
Contexto
Sistemas multi-agente com LLMs dividem tarefas entre modelos especializados. Nesse arranjo, o conhecimento necessário para concluir uma resposta muitas vezes está no contexto de outro agente. Tradicionalmente, esses agentes se comunicam por texto, o que coloca a decodificação autoregressiva no caminho crítico da operação. Além disso, a mensagem é discreta e é escrita sem que o remetente veja o estado atual do receptor.
Protocolos latentes foram criados para contornar isso. O C2C, citado no artigo, já suporta modelos heterogêneos, mas exige que ambos leiam a mesma entrada. O LCF-X eliminou essa exigência com um pooling do cache do sharer independente de posição. Mesmo assim, o LCF-X tinha três limitações, segundo os autores: comprimia apenas o cache do sharer, fornecia o mesmo resumo local de camada para todas as posições do receptor e não criava memória conjunta entre camadas. Ele também assumia que os dois modelos tinham o mesmo número de camadas e a mesma geometria de KV.
O XKV, protocolo introduzido pelo novo artigo, remove essas três restrições. Entre as inovações estão a atenção com queries aprendidas que faz pooling dos dois caches, a self-attention sobre tokens de camadas alinhados ao receptor com um mapa de camadas treinável, e um decoder de posição compartilhado que permite a cada posição do cache do receptor recuperar seu próprio resíduo, com gate por cabeça de atenção.
Por que importa
A comunicação entre LLMs heterogêneos é um gargalo prático para quem constrói sistemas multi-agente. O XKV ataca esse gargalo de duas frentes: velocidade e custo de treinamento. O protocolo mantém os dois modelos congelados e treina apenas o tradutor, o que reduz em 76% a quantidade de parâmetros treinados em relação ao LCF-X.
A técnica também permite combinar modelos de famílias, profundidades, números de cabeças KV, dimensões de cabeça e tokenizers diferentes. Isso significa que uma empresa pode ligar um modelo pequeno e rápido a um modelo grande e especializado sem precisar reescrever nada nos pesos. O ganho de latência é mensurável: os 5,8 ms do XKV contra 59,9 ms do LCF-X por tradução de par de caches.
Impacto
No curto prazo, o XKV pode acelerar arquiteturas de agentes que hoje dependem de geração de texto para passar contextos entre etapas. Em uma aplicação de pergunta e resposta sobre documentos, por exemplo, o modelo que leu o texto pode transferir o conhecimento relevante diretamente para o modelo que precisa formular a resposta, sem resumos em linguagem natural.
O ganho sobre o LCF-X em todos os datasets, incluindo o ROPES, sugere que a memória conjunta dos dois caches é mais informativa do que a compressão isolada. Resta saber qual o desempenho do XKV em modelos maiores e em cenários de produção com requisitos de segurança e latência. O artigo não traz esses dados.
O que vem agora
O artigo está disponível em acesso aberto no arXiv. Os autores não divulgaram prazos para liberação do código ou para validação em ambientes reais. O próximo passo esperado é a revisão por pares e a reprodução dos experimentos por outros grupos de pesquisa. Se os resultados se confirmarem, o XKV entra no grupo de técnicas que podem tornar a comunicação latente o padrão em sistemas multi-agente.
Fonte: arXiv (arXiv:2608.20617).
