Google lança transcrição que remove 'ums' e 'ahs'
Gemini 3.5 Transcribe chega com suporte a 85+ idiomas e edição por voz
O que aconteceu
O Google anunciou em 26 de agosto o Gemini 3.5 Transcribe, novo modelo de transcrição integrado ao Gemini Audio. O modelo, segundo a empresa, "representa um avanço significativo em relação ao nosso modelo anterior, Chirp 3", com melhorias na performance multilíngue e na taxa de erro de palavras. A informação foi divulgada pelo The Verge, que recebeu o comunicado da empresa.
O Gemini 3.5 Transcribe automatiza a formatação de texto e remove palavras de preenchimento como "um" e "uh". O modelo também permite que usuários forneçam um vocabulário customizado, adaptando a transcrição a requisitos ortográficos específicos e jargões técnicos, evitando edição manual. Ele atribui fala a até três interlocutores em áudio pré-gravado e fornece timestamps em nível de palavra.
Além do Transcribe, o Google havia mencionado atualizações para os modelos Gemini 3.5 Live e 3.5 Live Experimental, que melhorariam o reconhecimento de fala no modo de voz do Gemini. Porém, após a publicação da notícia, a empresa esclareceu que esses modelos ainda não serão lançados, sem nova data prevista.
Contexto
O Gemini 3.5 Transcribe é o mais novo modelo da família de áudio do Google, que já inclui o 3.5 Live Translate, lançado anteriormente. O anúncio ocorre em um momento de atraso: o Gemini 3.5 Pro, que a Google prometeu lançar em junho, ainda não foi disponibilizado ao público. O novo modelo de transcrição surge como um complemento à linha de áudio, enquanto a empresa busca consolidar sua infraestrutura de IA.
O Chrome, que já havia sido indicado como plataforma para o Gemini Audio, deve receber suporte em breve, segundo o Google, mas sem prazo definido.
Por que importa
Para usuários do macOS e Android, o Gemini 3.5 Transcribe elimina a necessidade de revisar transcrições para remover hesitações. Em contextos profissionais, como reuniões gravadas ou gravações de entrevistas, a edição por voz integrada reduz o tempo de pós-edição. O suporte a mais de 85 idiomas e a customização de vocabulário são diferenciais para quem trabalha com termos técnicos ou nomes próprios.
Desenvolvedores podem acessar o modelo via API do Gemini, em prévia pública no AI Studio e no Antigravity. Isso significa que aplicativos de terceiros podem integrar transcrição limpa sem depender de ferramentas externas.
Impacto
O lançamento do 3.5 Transcribe pressiona concorrentes como a OpenAI, que oferece transcrições via Whisper, a melhorarem a remoção de ruídos e a precisão em idiomas menos comuns. A atribuição de fala para três pessoas, antes limitada a dois, amplia casos de uso em diários de bordo e gravações de reuniões. No curto prazo, usuários de Android com o recurso Rambler em alguns países poderão testar a função em ditados. A ausência do 3.5 Live e do 3.5 Live Experimental, por outro lado, pode frustrar quem esperava melhorias na interação por voz em tempo real.
O que muda
O Gemini 3.5 Transcribe está disponível a partir de hoje em inglês para todos os usuários do aplicativo Gemini no macOS. No Android, o recurso Rambler está sendo liberado gradualmente em países e idiomas selecionados. Para desenvolvedores, o modelo está em prévia pública via API do Gemini, com acesso através do AI Studio e do Antigravity. O suporte ao Chrome está previsto, mas ainda sem data.
O que vem agora
O Google não informou quando os modelos 3.5 Live e 3.5 Live Experimental serão lançados, nem detalhou o cronograma do 3.5 Pro. O foco imediato do 3.5 Transcribe será expandir a disponibilidade para mais idiomas no Android e ampliar o suporte a navegadores. Desenvolvedores que adotarem a API devem aguardar ajustes de documentação, enquanto usuários do macOS já podem testar a remoção automática de hesitações.
