Whisper da OpenAI pra transcrição: setup e casos de uso em marketing
Whisper é a API de transcrição de áudio da OpenAI. Precisa, barata e integrável com qualquer stack. Veja o setup completo e 6 casos de uso reais pra times de marketing.
Nathan Máximo
Máximo do Marketing
A maioria dos insights de marketing está presa em áudio.
Call de venda gravada que ninguém transcreve. Reunião com cliente que virou só uma nota de papel. Podcast do CEO que nunca virou texto indexável. Entrevista de pesquisa qualitativa que morreu em arquivo MP3.
O Whisper resolve isso. É a API de transcrição de áudio da OpenAI — precisa, barata e fácil de integrar. Esse artigo é o guia prático: o que é, como funciona, quanto custa, como integrar e onde usar em marketing.
O que é o Whisper
Whisper é um modelo de reconhecimento de fala (speech-to-text) desenvolvido pela OpenAI e lançado em setembro de 2022. O diferencial em relação a concorrentes como Google Speech-to-Text ou AWS Transcribe: foi treinado com 680 mil horas de áudio da internet, o que o torna excepcionalmente bom em sotaques, ruído de fundo e vocabulário técnico.
Você envia um arquivo de áudio (MP3, MP4, WAV, WebM, etc.) e recebe de volta:
- Transcrição em texto puro
- Timestamps por segmento (quando cada fala acontece)
- Detecção automática de idioma
Suporta 99 idiomas. O português brasileiro é bem atendido — melhor que boa parte das alternativas do mercado.
Existe em duas formas:
- Open source (peso do modelo pra rodar localmente)
- API paga (endpoint gerenciado pela OpenAI, o que a maioria usa)
Esse artigo foca na API, que é o que faz sentido pra maioria dos times de marketing.
Como funciona tecnicamente
O processo é simples:
- Você envia um arquivo de áudio (até 25 MB por requisição na API padrão)
- O Whisper processa
- Devolve JSON com transcrição
Chamada básica em Python:
from openai import OpenAI
client = OpenAI(api_key="sua-chave-aqui")
with open("call_venda.mp3", "rb") as audio_file:
transcript = client.audio.transcriptions.create(
model="whisper-1",
file=audio_file,
response_format="verbose_json",
timestamp_granularities=["segment"]
)
print(transcript.text)
O response_format="verbose_json" retorna timestamps por segmento — útil pra criar legendas ou identificar momentos específicos da conversa.
Se o arquivo for maior que 25 MB, você quebra em partes com pydub (Python) ou ffmpeg antes de enviar.
Setup completo em 30 minutos
Passo 1: Chave de API
Acessa plataforma.openai.com → API Keys → Create new secret key. Guarda em variável de ambiente.
Passo 2: Instala biblioteca
pip install openai
Ou via npm se for Node:
npm install openai
Passo 3: Primeiro teste
Pega qualquer MP3 de 1-2 minutos, roda o script acima. Em menos de 60 segundos você tem a transcrição.
Passo 4: Testa qualidade no seu caso de uso
Aqui mora a diferença. Coloca áudio real do seu contexto — call de vendas com ruído, podcast com sotaque específico, reunião com múltiplos falantes. Avalia se a qualidade é suficiente antes de escalar.
Dica: se qualidade estiver abaixo do esperado, tenta converter o áudio pra WAV 16 kHz mono antes de enviar. Melhora 15-25% em casos de ruído.
Custo: mais barato que você imagina
Modelo whisper-1 custa US$ 0,006 por minuto de áudio.
Traduzindo pra prática:
| Volume | Custo mensal |
|---|---|
| 60 min/mês (1h de calls) | US$ 0,36 = ~R$ 2 |
| 600 min/mês (10h de calls) | US$ 3,60 = ~R$ 20 |
| 3.000 min/mês (50h de calls) | US$ 18 = ~R$ 100 |
| 30.000 min/mês (500h de calls) | US$ 180 = ~R$ 1.000 |
Pra 99% das empresas, custo não é obstáculo. O gargalo é integração — que a gente cobre agora.
Como integrar via n8n (sem código)
A maioria dos casos de uso em marketing envolve um gatilho + transcrição + ação. O n8n é a ferramenta certa pra isso.
Fluxo básico:
- Trigger: novo arquivo de áudio chega (Google Drive, S3, Slack, WhatsApp Business)
- Download: n8n baixa o arquivo
- Whisper: chama a API via nó HTTP Request
- Ação: envia transcrição pro Notion, Google Docs, Slack, CRM
Configuração do nó HTTP Request no n8n:
URL: https://api.openai.com/v1/audio/transcriptions
Método: POST
Header: Authorization: Bearer {{ $env.OPENAI_API_KEY }}
Body: multipart/form-data
- model: whisper-1
- file: [binary do arquivo]
- language: pt (força português, melhora precisão)
- response_format: text
Tempo de setup pra primeiro fluxo funcional: 2-4 horas. Isso faz parte de uma lógica maior que cobrimos nos 8 fluxos de automação com IA.
6 casos de uso reais em marketing
1. Transcrição de calls de venda
Problema: call de 45 minutos, vendedor anota 5 itens. Boa parte do contexto se perde.
Solução: integra gravação automática de calls (Fireflies, Gong, ou até gravação manual do Zoom) com Whisper. Após a call, transcrição completa vai pro CRM como nota.
Stack: Zoom Cloud Recording → Google Drive → n8n → Whisper → HubSpot/Pipedrive
Extras que ficam possíveis:
- Manda transcrição pro Claude ou ChatGPT e pede resumo com “próximos passos”, “objeções levantadas” e “fit ICP”
- Identifica menções a concorrentes, preço e urgência
- Alimenta onboarding de cliente com tudo que foi prometido na venda
Economia real: gestor comercial que revisava calls manualmente = 3-5h/semana. Automatizado: 0.
2. Show notes e posts de podcast
Problema: podcast de 40 min. Produzir show notes, resumo e cortes de redes sociais leva 3-4h.
Solução: transcreve com Whisper → passa pro LLM → gera show notes estruturado, 5 trechos pra LinkedIn/Twitter, e sumário do episódio em 3 bullets.
Output automático em 10 minutos:
- Transcrição completa com timestamps
- Show notes de 400-600 palavras (H2 por bloco de assunto)
- 5 citações pra redes sociais
- Sumário de 3 bullets pra descrição do episódio no Spotify
Quem produce podcast sabe: o conteúdo das distribuições de redes sai de dentro do episódio, raramente é inventado do zero. Whisper abre esse processo.
3. Ata automática de reunião
Problema: toda reunião produz uma ata meia-boca escrita por quem estava mais cansado.
Solução: grava reunião via Zoom/Google Meet → Whisper transcreve → LLM estrutura em ata com decisões, responsáveis e prazos.
Prompt que funciona bem após transcrição:
Aqui está a transcrição de uma reunião interna.
Gera ata com:
1. Participantes identificados (por nome ou "Pessoa 1", "Pessoa 2")
2. Decisões tomadas (lista)
3. Próximas ações: quem faz o quê até quando
4. Pontos em aberto que precisam de mais discussão
Formato: Notion-ready markdown.
Economia: 1-2h por reunião, elimina esquecimento e ambiguidade nas ações combinadas.
4. Legendas automáticas pra vídeo
Problema: vídeo no LinkedIn, Instagram e YouTube sem legenda perde 60-70% do alcance (maioria assiste sem som).
Solução: Whisper transcreve com timestamps → converte pra formato SRT → adiciona no vídeo.
Conversão de output Whisper pra SRT é simples:
def whisper_to_srt(segments):
srt = ""
for i, segment in enumerate(segments, 1):
start = format_time(segment["start"])
end = format_time(segment["end"])
text = segment["text"].strip()
srt += f"{i}\n{start} --> {end}\n{text}\n\n"
return srt
def format_time(seconds):
h = int(seconds // 3600)
m = int((seconds % 3600) // 60)
s = int(seconds % 60)
ms = int((seconds % 1) * 1000)
return f"{h:02d}:{m:02d}:{s:02d},{ms:03d}"
Pra time que produz vídeo regularmente: sai de “legendas são um trabalho separado” pra processo automático embutido no pipeline de edição.
5. Análise de entrevistas de pesquisa qualitativa
Problema: 10 entrevistas de UX ou pesquisa de cliente, cada uma com 30-60 minutos. Transcrever manualmente leva dias. Frequentemente não é feito e fica só como impressão do pesquisador.
Solução: transcreve tudo com Whisper em minutos → usa prompt engineering adequado pra identificar padrões, objeções comuns, linguagem que o cliente usa pra descrever o problema.
Isso gera:
- Mapa de dores real (palavras dos clientes, não do time)
- Citações autênticas pra copy de landing page
- Clusters de objeções pro time de vendas
- Input pra persona/ICP mais preciso que pesquisa de formulário
A combinação Whisper + LLM consegue processar 10 entrevistas em 45 minutos e entregar insights que antes levavam semanas de análise manual.
6. Monitoramento de menções em vídeo (YouTube + podcasts)
Problema: saber o que concorrentes ou especialistas do setor falam em vídeo/podcast é praticamente impossível — áudio não é indexável por ferramenta de monitoramento padrão.
Solução: pipeline que:
- Monitora canais YouTube específicos (via RSS ou YouTube Data API)
- Baixa novos vídeos automaticamente
- Transcreve com Whisper
- Filtra menções a termos específicos (marca, concorrentes, temas)
- Alerta no Slack quando houver match
Inteligência de mercado que antes não existia por ser tecnicamente inviável.
Limitações que precisa saber
Diarização (quem falou quem): Whisper não identifica falantes. Sabe quando há troca de voz, mas não rotula “Pedro:”, “Ana:”. Pra isso você precisa combinar com diarização externa (pyannote.audio, AssemblyAI) antes de enviar pro Whisper, ou usa AssemblyAI direto que já traz os dois juntos.
Áudio de baixa qualidade: call via WhatsApp com ruído alto, gravação de ambiente com eco — qualidade cai. Pré-processamento de áudio (normalização, redução de ruído) ajuda mas não é mágica.
Arquivos grandes: limite de 25 MB por requisição. Áudio longo precisa ser fatiado. Com ffmpeg, é um comando:
ffmpeg -i input.mp3 -f segment -segment_time 600 -c copy output_%03d.mp3
Isso corta em segmentos de 10 min. Depois você concatena as transcrições.
Termos técnicos do nicho: Whisper generalista pode errar palavras muito específicas (nomes de produtos, siglas do setor). Revisão humana em pontos críticos ainda é necessária.
Comparativo com as principais alternativas
| Ferramenta | Preço/min | Idiomas | Diarização | Melhor pra |
|---|---|---|---|---|
| Whisper (OpenAI API) | US$ 0,006 | 99 | Não nativa | Integração própria, custo baixo |
| AssemblyAI | US$ 0,012 | 17 | Sim | Quem precisa de diarização fácil |
| Google Speech-to-Text | US$ 0,016 | 125 | Sim | Stack Google Cloud |
| AWS Transcribe | US$ 0,024 | 83 | Sim | Stack AWS |
| Rev AI | US$ 0,02 | 36 | Sim | Alta precisão em inglês |
| Deepgram | US$ 0,004 | 30 | Sim | Volume alto com diarização |
Quando usar o quê:
- Custo mais baixo + integração própria: Whisper
- Diarização nativa sem complicação: AssemblyAI
- Tudo já em AWS: AWS Transcribe
- Volume absurdo + diarização: Deepgram
Pra maioria dos casos de uso de marketing no Brasil, Whisper API é o ponto de partida certo.
Combinando Whisper com o restante do pipeline de IA
O Whisper resolve a camada de entrada: converte fala em texto. A partir daí, você usa qualquer LLM pra dar valor:
Áudio → Whisper → Texto → LLM → Insight/Ação
Isso é o mesmo padrão do agente de qualificação via WhatsApp — entrada de dado não estruturado, normalização, processamento por LLM, ação no sistema certo.
A diferença: mensagem de texto já é texto. Áudio precisava do Whisper no meio pra virar útil.
Quando você conecta essa cadeia, áudio vira dado tratável como qualquer outro. Calls viram registros de CRM. Podcasts viram artigos. Reuniões viram tarefas no Asana. Entrevistas viram personas atualizadas.
Por onde começar
Se você nunca usou Whisper:
- Cria conta OpenAI e chave de API (5 min)
- Roda teste com uma call real sua — avalia qualidade no seu contexto (30 min)
- Escolhe o caso de uso de maior dor hoje (calls de venda? reuniões? podcast?)
- Monta o fluxo no n8n — trigger → download → Whisper → ação (4-8h)
- Roda por 2 semanas e mede quanto tempo foi economizado
O ROI aparece rápido. A primeira transcrição automática de call já paga o investimento de tempo de setup.
Quer montar o pipeline de transcrição + análise pra seu time de marketing? Fala com a gente — estruturamos o fluxo completo pro seu contexto.
Quer aplicar isso na sua empresa?
A gente faz um diagnóstico gratuito e mostra o caminho mais curto pra você crescer com previsibilidade.
Quero meu diagnóstico