TurboQuant: Google apresenta compressão extrema para IA
O Google Research apresentou o TurboQuant, um conjunto de algoritmos de quantização que reduz o custo de memória em LLMs e busca vetorial sem perda de precisão. A técnica será apresentada no ICLR 2026.
