Pular para o conteúdo
IA 13 de julho de 2026 · 9 min

Whisper da OpenAI pra transcrição: setup e casos de uso em marketing

Whisper é a API de transcrição de áudio da OpenAI. Precisa, barata e integrável com qualquer stack. Veja o setup completo e 6 casos de uso reais pra times de marketing.

NM

Nathan Máximo

Máximo do Marketing

A maioria dos insights de marketing está presa em áudio.

Call de venda gravada que ninguém transcreve. Reunião com cliente que virou só uma nota de papel. Podcast do CEO que nunca virou texto indexável. Entrevista de pesquisa qualitativa que morreu em arquivo MP3.

O Whisper resolve isso. É a API de transcrição de áudio da OpenAI — precisa, barata e fácil de integrar. Esse artigo é o guia prático: o que é, como funciona, quanto custa, como integrar e onde usar em marketing.

O que é o Whisper

Whisper é um modelo de reconhecimento de fala (speech-to-text) desenvolvido pela OpenAI e lançado em setembro de 2022. O diferencial em relação a concorrentes como Google Speech-to-Text ou AWS Transcribe: foi treinado com 680 mil horas de áudio da internet, o que o torna excepcionalmente bom em sotaques, ruído de fundo e vocabulário técnico.

Você envia um arquivo de áudio (MP3, MP4, WAV, WebM, etc.) e recebe de volta:

  • Transcrição em texto puro
  • Timestamps por segmento (quando cada fala acontece)
  • Detecção automática de idioma

Suporta 99 idiomas. O português brasileiro é bem atendido — melhor que boa parte das alternativas do mercado.

Existe em duas formas:

  1. Open source (peso do modelo pra rodar localmente)
  2. API paga (endpoint gerenciado pela OpenAI, o que a maioria usa)

Esse artigo foca na API, que é o que faz sentido pra maioria dos times de marketing.

Como funciona tecnicamente

O processo é simples:

  1. Você envia um arquivo de áudio (até 25 MB por requisição na API padrão)
  2. O Whisper processa
  3. Devolve JSON com transcrição

Chamada básica em Python:

from openai import OpenAI

client = OpenAI(api_key="sua-chave-aqui")

with open("call_venda.mp3", "rb") as audio_file:
    transcript = client.audio.transcriptions.create(
        model="whisper-1",
        file=audio_file,
        response_format="verbose_json",
        timestamp_granularities=["segment"]
    )

print(transcript.text)

O response_format="verbose_json" retorna timestamps por segmento — útil pra criar legendas ou identificar momentos específicos da conversa.

Se o arquivo for maior que 25 MB, você quebra em partes com pydub (Python) ou ffmpeg antes de enviar.

Setup completo em 30 minutos

Passo 1: Chave de API

Acessa plataforma.openai.com → API Keys → Create new secret key. Guarda em variável de ambiente.

Passo 2: Instala biblioteca

pip install openai

Ou via npm se for Node:

npm install openai

Passo 3: Primeiro teste

Pega qualquer MP3 de 1-2 minutos, roda o script acima. Em menos de 60 segundos você tem a transcrição.

Passo 4: Testa qualidade no seu caso de uso

Aqui mora a diferença. Coloca áudio real do seu contexto — call de vendas com ruído, podcast com sotaque específico, reunião com múltiplos falantes. Avalia se a qualidade é suficiente antes de escalar.

Dica: se qualidade estiver abaixo do esperado, tenta converter o áudio pra WAV 16 kHz mono antes de enviar. Melhora 15-25% em casos de ruído.

Custo: mais barato que você imagina

Modelo whisper-1 custa US$ 0,006 por minuto de áudio.

Traduzindo pra prática:

VolumeCusto mensal
60 min/mês (1h de calls)US$ 0,36 = ~R$ 2
600 min/mês (10h de calls)US$ 3,60 = ~R$ 20
3.000 min/mês (50h de calls)US$ 18 = ~R$ 100
30.000 min/mês (500h de calls)US$ 180 = ~R$ 1.000

Pra 99% das empresas, custo não é obstáculo. O gargalo é integração — que a gente cobre agora.

Como integrar via n8n (sem código)

A maioria dos casos de uso em marketing envolve um gatilho + transcrição + ação. O n8n é a ferramenta certa pra isso.

Fluxo básico:

  1. Trigger: novo arquivo de áudio chega (Google Drive, S3, Slack, WhatsApp Business)
  2. Download: n8n baixa o arquivo
  3. Whisper: chama a API via nó HTTP Request
  4. Ação: envia transcrição pro Notion, Google Docs, Slack, CRM

Configuração do nó HTTP Request no n8n:

URL: https://api.openai.com/v1/audio/transcriptions
Método: POST
Header: Authorization: Bearer {{ $env.OPENAI_API_KEY }}
Body: multipart/form-data
  - model: whisper-1
  - file: [binary do arquivo]
  - language: pt (força português, melhora precisão)
  - response_format: text

Tempo de setup pra primeiro fluxo funcional: 2-4 horas. Isso faz parte de uma lógica maior que cobrimos nos 8 fluxos de automação com IA.

6 casos de uso reais em marketing

1. Transcrição de calls de venda

Problema: call de 45 minutos, vendedor anota 5 itens. Boa parte do contexto se perde.

Solução: integra gravação automática de calls (Fireflies, Gong, ou até gravação manual do Zoom) com Whisper. Após a call, transcrição completa vai pro CRM como nota.

Stack: Zoom Cloud Recording → Google Drive → n8n → Whisper → HubSpot/Pipedrive

Extras que ficam possíveis:

  • Manda transcrição pro Claude ou ChatGPT e pede resumo com “próximos passos”, “objeções levantadas” e “fit ICP”
  • Identifica menções a concorrentes, preço e urgência
  • Alimenta onboarding de cliente com tudo que foi prometido na venda

Economia real: gestor comercial que revisava calls manualmente = 3-5h/semana. Automatizado: 0.

2. Show notes e posts de podcast

Problema: podcast de 40 min. Produzir show notes, resumo e cortes de redes sociais leva 3-4h.

Solução: transcreve com Whisper → passa pro LLM → gera show notes estruturado, 5 trechos pra LinkedIn/Twitter, e sumário do episódio em 3 bullets.

Output automático em 10 minutos:

  • Transcrição completa com timestamps
  • Show notes de 400-600 palavras (H2 por bloco de assunto)
  • 5 citações pra redes sociais
  • Sumário de 3 bullets pra descrição do episódio no Spotify

Quem produce podcast sabe: o conteúdo das distribuições de redes sai de dentro do episódio, raramente é inventado do zero. Whisper abre esse processo.

3. Ata automática de reunião

Problema: toda reunião produz uma ata meia-boca escrita por quem estava mais cansado.

Solução: grava reunião via Zoom/Google Meet → Whisper transcreve → LLM estrutura em ata com decisões, responsáveis e prazos.

Prompt que funciona bem após transcrição:

Aqui está a transcrição de uma reunião interna.
Gera ata com:
1. Participantes identificados (por nome ou "Pessoa 1", "Pessoa 2")
2. Decisões tomadas (lista)
3. Próximas ações: quem faz o quê até quando
4. Pontos em aberto que precisam de mais discussão

Formato: Notion-ready markdown.

Economia: 1-2h por reunião, elimina esquecimento e ambiguidade nas ações combinadas.

4. Legendas automáticas pra vídeo

Problema: vídeo no LinkedIn, Instagram e YouTube sem legenda perde 60-70% do alcance (maioria assiste sem som).

Solução: Whisper transcreve com timestamps → converte pra formato SRT → adiciona no vídeo.

Conversão de output Whisper pra SRT é simples:

def whisper_to_srt(segments):
    srt = ""
    for i, segment in enumerate(segments, 1):
        start = format_time(segment["start"])
        end = format_time(segment["end"])
        text = segment["text"].strip()
        srt += f"{i}\n{start} --> {end}\n{text}\n\n"
    return srt

def format_time(seconds):
    h = int(seconds // 3600)
    m = int((seconds % 3600) // 60)
    s = int(seconds % 60)
    ms = int((seconds % 1) * 1000)
    return f"{h:02d}:{m:02d}:{s:02d},{ms:03d}"

Pra time que produz vídeo regularmente: sai de “legendas são um trabalho separado” pra processo automático embutido no pipeline de edição.

5. Análise de entrevistas de pesquisa qualitativa

Problema: 10 entrevistas de UX ou pesquisa de cliente, cada uma com 30-60 minutos. Transcrever manualmente leva dias. Frequentemente não é feito e fica só como impressão do pesquisador.

Solução: transcreve tudo com Whisper em minutos → usa prompt engineering adequado pra identificar padrões, objeções comuns, linguagem que o cliente usa pra descrever o problema.

Isso gera:

  • Mapa de dores real (palavras dos clientes, não do time)
  • Citações autênticas pra copy de landing page
  • Clusters de objeções pro time de vendas
  • Input pra persona/ICP mais preciso que pesquisa de formulário

A combinação Whisper + LLM consegue processar 10 entrevistas em 45 minutos e entregar insights que antes levavam semanas de análise manual.

6. Monitoramento de menções em vídeo (YouTube + podcasts)

Problema: saber o que concorrentes ou especialistas do setor falam em vídeo/podcast é praticamente impossível — áudio não é indexável por ferramenta de monitoramento padrão.

Solução: pipeline que:

  1. Monitora canais YouTube específicos (via RSS ou YouTube Data API)
  2. Baixa novos vídeos automaticamente
  3. Transcreve com Whisper
  4. Filtra menções a termos específicos (marca, concorrentes, temas)
  5. Alerta no Slack quando houver match

Inteligência de mercado que antes não existia por ser tecnicamente inviável.

Limitações que precisa saber

Diarização (quem falou quem): Whisper não identifica falantes. Sabe quando há troca de voz, mas não rotula “Pedro:”, “Ana:”. Pra isso você precisa combinar com diarização externa (pyannote.audio, AssemblyAI) antes de enviar pro Whisper, ou usa AssemblyAI direto que já traz os dois juntos.

Áudio de baixa qualidade: call via WhatsApp com ruído alto, gravação de ambiente com eco — qualidade cai. Pré-processamento de áudio (normalização, redução de ruído) ajuda mas não é mágica.

Arquivos grandes: limite de 25 MB por requisição. Áudio longo precisa ser fatiado. Com ffmpeg, é um comando:

ffmpeg -i input.mp3 -f segment -segment_time 600 -c copy output_%03d.mp3

Isso corta em segmentos de 10 min. Depois você concatena as transcrições.

Termos técnicos do nicho: Whisper generalista pode errar palavras muito específicas (nomes de produtos, siglas do setor). Revisão humana em pontos críticos ainda é necessária.

Comparativo com as principais alternativas

FerramentaPreço/minIdiomasDiarizaçãoMelhor pra
Whisper (OpenAI API)US$ 0,00699Não nativaIntegração própria, custo baixo
AssemblyAIUS$ 0,01217SimQuem precisa de diarização fácil
Google Speech-to-TextUS$ 0,016125SimStack Google Cloud
AWS TranscribeUS$ 0,02483SimStack AWS
Rev AIUS$ 0,0236SimAlta precisão em inglês
DeepgramUS$ 0,00430SimVolume alto com diarização

Quando usar o quê:

  • Custo mais baixo + integração própria: Whisper
  • Diarização nativa sem complicação: AssemblyAI
  • Tudo já em AWS: AWS Transcribe
  • Volume absurdo + diarização: Deepgram

Pra maioria dos casos de uso de marketing no Brasil, Whisper API é o ponto de partida certo.

Combinando Whisper com o restante do pipeline de IA

O Whisper resolve a camada de entrada: converte fala em texto. A partir daí, você usa qualquer LLM pra dar valor:

Áudio → Whisper → Texto → LLM → Insight/Ação

Isso é o mesmo padrão do agente de qualificação via WhatsApp — entrada de dado não estruturado, normalização, processamento por LLM, ação no sistema certo.

A diferença: mensagem de texto já é texto. Áudio precisava do Whisper no meio pra virar útil.

Quando você conecta essa cadeia, áudio vira dado tratável como qualquer outro. Calls viram registros de CRM. Podcasts viram artigos. Reuniões viram tarefas no Asana. Entrevistas viram personas atualizadas.

Por onde começar

Se você nunca usou Whisper:

  1. Cria conta OpenAI e chave de API (5 min)
  2. Roda teste com uma call real sua — avalia qualidade no seu contexto (30 min)
  3. Escolhe o caso de uso de maior dor hoje (calls de venda? reuniões? podcast?)
  4. Monta o fluxo no n8n — trigger → download → Whisper → ação (4-8h)
  5. Roda por 2 semanas e mede quanto tempo foi economizado

O ROI aparece rápido. A primeira transcrição automática de call já paga o investimento de tempo de setup.


Quer montar o pipeline de transcrição + análise pra seu time de marketing? Fala com a gente — estruturamos o fluxo completo pro seu contexto.

#whisper #transcricao #openai

Quer aplicar isso na sua empresa?

A gente faz um diagnóstico gratuito e mostra o caminho mais curto pra você crescer com previsibilidade.

Quero meu diagnóstico