Whisper: o que é e vale a pena rodar no seu computador?
Se você pesquisou transcrição automática nos últimos anos, esbarrou no nome Whisper. É o modelo de reconhecimento de fala aberto que está por trás de uma boa parte das ferramentas do mercado — inclusive da nossa.
Este texto explica o que ele é, o que muda entre os tamanhos, e responde a pergunta que mais aparece: se o modelo é gratuito, por que pagar alguém?
O que é
Whisper é um modelo treinado em uma quantidade enorme de áudio em dezenas de idiomas. Você entrega um arquivo de som, ele devolve o texto correspondente, com marcação de tempo.
Duas características explicam por que ele dominou:
É aberto. Os pesos do modelo podem ser baixados e executados por qualquer pessoa, sem pagar licença e sem depender da nuvem de ninguém.
É bom em português. Modelos anteriores eram treinados majoritariamente em inglês e desabavam em outras línguas. O Whisper foi treinado multilíngue desde o começo, e o resultado em português brasileiro é bem sólido.
Os tamanhos
O modelo vem em versões de tamanhos diferentes. Quanto maior, melhor a precisão e mais lento o processamento:
| Tamanho | Download | Qualidade | Velocidade |
|---|---|---|---|
tiny |
~75 MB | fraca, serve para rascunho | muito rápida |
base |
~140 MB | fraca a média | rápida |
small |
~480 MB | boa — o equilíbrio | média |
medium |
~1,5 GB | muito boa | lenta |
large-v3 |
~3 GB | a melhor | bem lenta |
large-v3-turbo |
~1,6 GB | quase a melhor | rápida em placa de vídeo |
Na prática, small resolve reunião e aula com áudio decente. Para material que
vai ser publicado ou citado, medium para cima compensa.
É exatamente essa escolha que aparece como "Padrão", "Alta" e "Máxima" na tela de envio — e trocar de degrau custa tempo de fila, não dinheiro, porque a cobrança é pelos minutos de áudio, não pelo processamento.
Rodando na sua máquina
É perfeitamente viável, e vamos dar o caminho em vez de esconder:
Você instala Python, instala uma implementação do Whisper (o faster-whisper é
o mais eficiente hoje), baixa o modelo do tamanho escolhido e roda pela linha de
comando. Existem também interfaces gráficas prontas para quem não quer terminal.
O custo em dinheiro é zero. O custo real está em outro lugar.
Tempo de configuração. Entre instalar, resolver conflito de versão e descobrir que falta uma biblioteca do sistema, some algumas horas na primeira vez. Em Windows sem placa NVIDIA configurada, some mais.
Velocidade. Aqui está o ponto que mais surpreende. Num notebook comum,
usando CPU, o modelo small roda perto de 0,8 a 1,5 vez o tempo real — ou
seja, uma hora de áudio leva de 40 minutos a mais de uma hora, com o computador
ocupado e o ventilador ligado. Medimos isso: no nosso servidor, com três núcleos
dedicados, o mesmo small dá 3,4x tempo real; num notebook com navegador aberto
disputando CPU, caiu para 0,8x.
Placa de vídeo muda tudo. Com uma GPU NVIDIA bem configurada, o
large-v3-turbo passa de dezenas de vezes o tempo real. Se você tem essa placa e
sabe configurar CUDA e cuDNN, rodar local é imbatível.
A conta honesta
Quando rodar local compensa:
- Você transcreve muitas horas por semana, todo mês.
- Tem placa de vídeo NVIDIA e disposição para configurar.
- O material é sigiloso a ponto de não poder sair da sua máquina — e aqui não existe serviço, nenhum, que dê a mesma garantia.
- Você gosta de mexer nisso.
Quando pagar compensa:
- Você transcreve de vez em quando, e não quer manter ambiente configurado.
- Não tem placa dedicada, e não quer o notebook travado por uma hora.
- Precisa de fila, histórico, download em vários formatos e acesso de qualquer lugar sem instalar nada.
- Seu tempo vale mais que a diferença. Duas horas configurando já custaram mais que muitos meses de crédito.
Não temos interesse em fingir que a opção gratuita não existe. Ela existe, é legítima, e para parte das pessoas é a escolha certa. O que vendemos é não ter que lidar com nada disso — mais fila, histórico e formatos prontos.
O que o Whisper não faz
Independentemente de onde você rode, o modelo tem limites que nenhuma interface resolve:
- Não separa quem falou. Isso exige outra tecnologia, chamada diarização, que é um passo separado.
- Não traduz de verdade. Existe um modo de traduzir para inglês, mas é limitado; para legenda em outro idioma o caminho é transcrever e traduzir depois.
- Erra nome próprio e sigla, sempre. É característica do funcionamento.
- Pode alucinar em silêncio. Em trechos longos sem fala, o modelo às vezes inventa frases — normalmente coisas genéricas tipo "obrigado por assistir". Um filtro de silêncio reduz isso, e é por isso que ele vem ligado por padrão aqui.
Esse último ponto vale conhecer: se você vir uma frase estranha no meio de um silêncio, não é erro de digitação de ninguém, é o modelo preenchendo vazio.
Se você decidir não configurar nada: crie sua conta, suba um arquivo e veja o resultado em minutos. São 15 minutos grátis, sem cartão — o suficiente para comparar com o que você conseguiria em casa.