O Gemini 3.5 Transcribe é o novo modelo de speech-to-text do Google DeepMind, lançado em 26 de agosto de 2026. Diferente dos modelos convencionais de transcrição, o Gemini 3.5 Transcribe entende o contexto da conversa: remove vícios de linguagem automaticamente, trata autocorreções do falante e reconhece vocabulário técnico personalizado sem necessidade de retreinamento. O preview público já está disponível no Google AI Studio para desenvolvedores.
Os números que separam o Gemini 3.5 Transcribe da concorrência
A performance é medida pelo WER (Word Error Rate, ou taxa de erro por palavra). Veja o que o Gemini 3.5 Transcribe entrega:
- WER de 4,0% no modo streaming em tempo real
- WER de 2,6% no modo de áudio pré-gravado
- 70% mais rápido para finalizar transcrições em relação ao predecessor Chirp 3
- Suporte a mais de 85 idiomas com detecção automática de idioma, incluindo português
Para referência: o mercado costumava considerar WER de 5–8% como boa qualidade. Um WER de 2,6% significa que, em 1.000 palavras transcritas, apenas 26 estão erradas. Um WER de 5% dobra esse número. Em contratos, laudos médicos ou reuniões de negócios, essa diferença tem custo real.
Duas APIs para contextos diferentes
O Gemini 3.5 Transcribe está disponível em dois modos via API:
Live API (gemini-3.5-transcribe-live) — Transcrição em tempo real com latência abaixo de 1 segundo. Ideal para atendimento ao cliente ao vivo, videoconferências, legendas automáticas e assistentes de voz. Suporta troca de idioma ao vivo (live language switching).
Interactions API (gemini-3.5-transcribe) — Para áudio pré-gravado. Entrega atribuição de falante com timestamps por palavra e identificação de múltiplos falantes (até 3 com alta precisão; modo experimental para mais de 3 participantes).
Por que isso importa para o seu negócio
Se o seu negócio gera áudio — reuniões, atendimentos, podcasts, gravações de vendas — o Gemini 3.5 Transcribe muda o custo e a qualidade da documentação desses momentos.
Veja aplicações práticas:
- Atendimento ao cliente: transcrição automática de chamadas com separação agente/cliente — sem revisão manual.
- Conteúdo e marketing: podcasts e webinars transformados em artigos e relatórios sem terceirização de transcrição.
- Medicina e direito: vocabulário técnico customizável reduz erros em relatórios que exigem terminologia especializada.
- Processos internos: reuniões indexadas com busca por timestamp, eliminando a necessidade de atas manuais.
O modelo também suporta function calling — o que permite configurar ações automáticas quando certas frases são detectadas, como acionar um fluxo de CRM quando o cliente menciona interesse em cancelamento.
Onde já está disponível
O Gemini 3.5 Transcribe já roda em produção em produtos do Google:
- Gboard no Android (funcionalidade Rambler de ditado inteligente)
- Aplicativo Gemini no macOS
- Google Antigravity (plataforma enterprise)
- Em breve: Google Chrome
Para desenvolvedores: acesse o preview público pelo Google AI Studio ou pelo Google Antigravity. Acesso enterprise é via Gemini Enterprise Agent Platform.
Conteúdo reescrito e traduzido para PT pela redação luiscortex, revisado por humano.
Fonte: DeepMind Blog





