🎙️ Transcritor

· 4 min de leitura · entenda

Whisper: o que é e vale a pena rodar no seu computador?

Se você pesquisou transcrição automática nos últimos anos, esbarrou no nome Whisper. É o modelo de reconhecimento de fala aberto que está por trás de uma boa parte das ferramentas do mercado — inclusive da nossa.

Este texto explica o que ele é, o que muda entre os tamanhos, e responde a pergunta que mais aparece: se o modelo é gratuito, por que pagar alguém?

O que é

Whisper é um modelo treinado em uma quantidade enorme de áudio em dezenas de idiomas. Você entrega um arquivo de som, ele devolve o texto correspondente, com marcação de tempo.

Duas características explicam por que ele dominou:

É aberto. Os pesos do modelo podem ser baixados e executados por qualquer pessoa, sem pagar licença e sem depender da nuvem de ninguém.

É bom em português. Modelos anteriores eram treinados majoritariamente em inglês e desabavam em outras línguas. O Whisper foi treinado multilíngue desde o começo, e o resultado em português brasileiro é bem sólido.

Os tamanhos

O modelo vem em versões de tamanhos diferentes. Quanto maior, melhor a precisão e mais lento o processamento:

Tamanho Download Qualidade Velocidade
tiny ~75 MB fraca, serve para rascunho muito rápida
base ~140 MB fraca a média rápida
small ~480 MB boa — o equilíbrio média
medium ~1,5 GB muito boa lenta
large-v3 ~3 GB a melhor bem lenta
large-v3-turbo ~1,6 GB quase a melhor rápida em placa de vídeo

Na prática, small resolve reunião e aula com áudio decente. Para material que vai ser publicado ou citado, medium para cima compensa.

É exatamente essa escolha que aparece como "Padrão", "Alta" e "Máxima" na tela de envio — e trocar de degrau custa tempo de fila, não dinheiro, porque a cobrança é pelos minutos de áudio, não pelo processamento.

Rodando na sua máquina

É perfeitamente viável, e vamos dar o caminho em vez de esconder:

Você instala Python, instala uma implementação do Whisper (o faster-whisper é o mais eficiente hoje), baixa o modelo do tamanho escolhido e roda pela linha de comando. Existem também interfaces gráficas prontas para quem não quer terminal.

O custo em dinheiro é zero. O custo real está em outro lugar.

Tempo de configuração. Entre instalar, resolver conflito de versão e descobrir que falta uma biblioteca do sistema, some algumas horas na primeira vez. Em Windows sem placa NVIDIA configurada, some mais.

Velocidade. Aqui está o ponto que mais surpreende. Num notebook comum, usando CPU, o modelo small roda perto de 0,8 a 1,5 vez o tempo real — ou seja, uma hora de áudio leva de 40 minutos a mais de uma hora, com o computador ocupado e o ventilador ligado. Medimos isso: no nosso servidor, com três núcleos dedicados, o mesmo small dá 3,4x tempo real; num notebook com navegador aberto disputando CPU, caiu para 0,8x.

Placa de vídeo muda tudo. Com uma GPU NVIDIA bem configurada, o large-v3-turbo passa de dezenas de vezes o tempo real. Se você tem essa placa e sabe configurar CUDA e cuDNN, rodar local é imbatível.

A conta honesta

Quando rodar local compensa:

Quando pagar compensa:

Não temos interesse em fingir que a opção gratuita não existe. Ela existe, é legítima, e para parte das pessoas é a escolha certa. O que vendemos é não ter que lidar com nada disso — mais fila, histórico e formatos prontos.

O que o Whisper não faz

Independentemente de onde você rode, o modelo tem limites que nenhuma interface resolve:

Esse último ponto vale conhecer: se você vir uma frase estranha no meio de um silêncio, não é erro de digitação de ninguém, é o modelo preenchendo vazio.


Se você decidir não configurar nada: crie sua conta, suba um arquivo e veja o resultado em minutos. São 15 minutos grátis, sem cartão — o suficiente para comparar com o que você conseguiria em casa.

Continue lendo