Gemini 3.5 Transcribe: Google lança modelo de transcrição de fala com IA
Novo modelo do Google DeepMind converte áudio em texto formatado e lida com ruído, jargões e hesitações.
O que aconteceu
O Google DeepMind introduziu o Gemini 3.5 Transcribe no dia 26 de agosto de 2026, em seu blog oficial. O modelo é descrito como o mais preciso da companhia em reconhecimento de fala, projetado para conversões inteligentes de voz. Ao contrário de sistemas tradicionais, que têm dificuldade com ruído de fundo, jargões e hesitações, o Gemini 3.5 Transcribe transforma áudio bruto em texto polido e formatado.
A disponibilidade acontece em duas frentes. A Live API, chamada gemini-3.5-transcribe-live, é voltada para streaming contínuo e bidirecional, com latência abaixo de um segundo. A Interactions API, chamada gemini-3.5-transcribe, processa áudios pré-gravados, como reuniões e registros de chamadas, com atribuição de falante e timestamps por palavra. O modelo já está presente no Gemini app, no Android e no macOS, incluindo o recurso Rambler, e desenvolvedores podem acessá-lo pela Gemini API no Google AI Studio e na plataforma Gemini Enterprise Agent.
O Gemini 3.5 Transcribe, modelo do Google DeepMind, foi apresentado com duas APIs distintas, ambas integradas aos fluxos de trabalho de desenvolvedores que criam agentes de voz, ferramentas de legendagem em tempo real e pipelines de análise pós-chamada.
Contexto
A chegada do Gemini 3.5 Transcribe ocorre em um momento de expansão de assistentes de voz e de análise de conversas. Modelos anteriores de reconhecimento de fala cometiam erros em ambientes ruidosos e não limpavam expressões de hesitação. O novo modelo foi construído para capturar o estilo natural de fala, incluindo autocorreções: se o usuário diz 'vamos nos encontrar na terça, não, quarta', o sistema entende a correção e transcreve apenas a decisão final.
O modelo também aceita vocabulário customizado, o que permite reconhecer jargões de áreas específicas, como termos técnicos de engenharia ou siglas de empresas, e adaptar a grafia conforme a necessidade do cliente.
Por que importa
Para desenvolvedores, a integração é direta. O Gemini 3.5 Transcribe vem com recursos como remoção de 'ums' e 'ahs' e formatação automática de texto. Outro destaque é o function calling, que delega tarefas como geração de imagem e análise de arquivos para outros modelos Gemini. Esse recurso já está ativo no aplicativo macOS.
A precisão é medida pela Artificial Analysis, que aponta um WER médio de 4,0% para streaming e 2,6% para não-streaming. O Gemini 3.5 Transcribe alcança esse WER de 2,6% em não-streaming, segundo a mesma fonte. Em ambientes com ruído, o modelo consegue capturar corretamente códigos postais e IDs de pedidos, essenciais em logística e atendimento ao cliente.
Impacto
O Gemini 3.5 Transcribe suporta mais de 85 línguas com detecção automática. Mais de 85 línguas são suportadas pelo modelo, o que permite aplicações globais. Além disso, a baixa latência no streaming possibilita legendagem em tempo real e agentes de voz interativos. No curto prazo, quem usa o Gemini app e o Android já experimenta melhorias nos comandos por voz. No médio prazo, aplicações de terceiros devem incorporar a transcrição inteligente em call centers, reuniões remotas e ferramentas de acessibilidade.
O que muda
A principal mudança é a capacidade de lidar com a fala natural sem exigir pré-processamento. O usuário pode falar com hesitações e correções, e o modelo devolve um texto limpo, reduzindo a dependência de pós-edição em fluxos de produção. A disponibilização em APIs separadas permite escolher entre streaming e processamento em lote, conforme a necessidade do projeto.
O que vem agora
O Google deve expandir a disponibilidade do function calling para outras plataformas, já que hoje está restrito ao macOS. Não há prazos divulgados, mas a tendência é que o modelo seja integrado a mais produtos da companhia. Também fica o acompanhamento de testes independentes para validar a robustez do WER em cenários reais. Enquanto isso, o Gemini 3.5 Transcribe fica disponível para desenvolvedores interessados em adotar transcrição inteligente em seus sistemas.
