O Gemini 3.5 Transcribe é o novo modelo de speech-to-text do Google DeepMind, lançado em 26 de agosto de 2026. Diferente dos modelos convencionais de transcrição, o Gemini 3.5 Transcribe entende o contexto da conversa: remove vícios de linguagem automaticamente, trata autocorreções do falante e reconhece vocabulário técnico personalizado sem necessidade de retreinamento. O preview público já está disponível no Google AI Studio para desenvolvedores.

Os números que separam o Gemini 3.5 Transcribe da concorrência

A performance é medida pelo WER (Word Error Rate, ou taxa de erro por palavra). Veja o que o Gemini 3.5 Transcribe entrega:

  • WER de 4,0% no modo streaming em tempo real
  • WER de 2,6% no modo de áudio pré-gravado
  • 70% mais rápido para finalizar transcrições em relação ao predecessor Chirp 3
  • Suporte a mais de 85 idiomas com detecção automática de idioma, incluindo português

Para referência: o mercado costumava considerar WER de 5–8% como boa qualidade. Um WER de 2,6% significa que, em 1.000 palavras transcritas, apenas 26 estão erradas. Um WER de 5% dobra esse número. Em contratos, laudos médicos ou reuniões de negócios, essa diferença tem custo real.

Duas APIs para contextos diferentes

O Gemini 3.5 Transcribe está disponível em dois modos via API:

Live API (gemini-3.5-transcribe-live) — Transcrição em tempo real com latência abaixo de 1 segundo. Ideal para atendimento ao cliente ao vivo, videoconferências, legendas automáticas e assistentes de voz. Suporta troca de idioma ao vivo (live language switching).

Interactions API (gemini-3.5-transcribe) — Para áudio pré-gravado. Entrega atribuição de falante com timestamps por palavra e identificação de múltiplos falantes (até 3 com alta precisão; modo experimental para mais de 3 participantes).

Por que isso importa para o seu negócio

Se o seu negócio gera áudio — reuniões, atendimentos, podcasts, gravações de vendas — o Gemini 3.5 Transcribe muda o custo e a qualidade da documentação desses momentos.

Veja aplicações práticas:

  1. Atendimento ao cliente: transcrição automática de chamadas com separação agente/cliente — sem revisão manual.
  2. Conteúdo e marketing: podcasts e webinars transformados em artigos e relatórios sem terceirização de transcrição.
  3. Medicina e direito: vocabulário técnico customizável reduz erros em relatórios que exigem terminologia especializada.
  4. Processos internos: reuniões indexadas com busca por timestamp, eliminando a necessidade de atas manuais.

O modelo também suporta function calling — o que permite configurar ações automáticas quando certas frases são detectadas, como acionar um fluxo de CRM quando o cliente menciona interesse em cancelamento.

Onde já está disponível

O Gemini 3.5 Transcribe já roda em produção em produtos do Google:

  • Gboard no Android (funcionalidade Rambler de ditado inteligente)
  • Aplicativo Gemini no macOS
  • Google Antigravity (plataforma enterprise)
  • Em breve: Google Chrome

Para desenvolvedores: acesse o preview público pelo Google AI Studio ou pelo Google Antigravity. Acesso enterprise é via Gemini Enterprise Agent Platform.


Conteúdo reescrito e traduzido para PT pela redação luiscortex, revisado por humano.

Fonte: DeepMind Blog