Comparativo de precisão
Em ligação de verdade, a Nous erra menos.
Cinco serviços, os mesmos 305 trechos de ligações reais de atendimento, em linha telefônica. É o áudio mais difícil que existe: todo mundo erra bastante. A diferença está em quanto.
No mesmo áudio de ligação
- que o Whisper large-v3, da OpenAI
- 13% menos erros
- que o Deepgram Nova-3, com a lista de termos
- 21% menos erros
Erro por palavra em ligação real.
Menor é melhor. Cada serviço na melhor configuração que testamos, com a lista de termos quando ele aceita.
- Nous modelo próprio, com a lista de termos do cliente 20,8% 21 a cada 100 palavras
- Whisper large-v3 OpenAI, modelo aberto 24,0% 24 a cada 100 palavras
- Speechmatics Enhanced, português, com vocabulário adicional 24,1% 24 a cada 100 palavras
- Deepgram Nova-3 pt-BR, com a lista de termos 26,5% 27 a cada 100 palavras
- Distil-Whisper versão reduzida do Whisper 29,4% 29 a cada 100 palavras
| Serviço | Erro por palavra | Erro por letra | A Nous erra |
|---|---|---|---|
| Nous | 20,8% | 14,9% | |
| Whisper large-v3 | 24,0% | 17,3% | 13% menos |
| Speechmatics | 24,1% | 17,8% | 13% menos |
| Deepgram Nova-3 | 26,5% | 19,9% | 21% menos |
| Distil-Whisper | 29,4% | 19,3% | 29% menos |
Medido em 24/08/2026, com o modelo da Nous daquela data; o de hoje fica na mesma faixa nas nossas medições internas. As ligações são de clientes reais, por isso o áudio não é público.
"Mas por aí dizem 5% de erro."
Os números de 4% a 10% que aparecem em propaganda são de fala lida: alguém lendo um texto em voz alta, num microfone bom, sem barulho. Nesse áudio, quase todo serviço moderno acerta quase tudo.
Ligação é outra coisa: linha telefônica que corta o som pela metade, gente falando junto, palavra engolida, barulho de rua. Aqui o erro de todo mundo sobe umas quatro vezes. Por isso um número de ligação não se compara com um número de estúdio, e é por isso que medimos no áudio difícil.
Em gravação limpa (aula, podcast, reunião com bom microfone), espere bem menos erro do que nesta tabela. Teste com um áudio seu: é de graça e leva segundos.
E-mail e CPF ditados, escritos como se escreve.
O erro por palavra não enxerga isso, e é o que mais dá trabalho de corrigir. Nos testes de agosto, os outros serviços devolveram os e-mails como foram falados, em palavras.
-
22 de 22
CPFs ditados na referência humana, escritos com pontos e traço. Só vira CPF o que fecha os dígitos verificadores.
-
97%
dos 29 e-mails ditados em ligação real saíram com o provedor certo (gmail.com, hotmail.com...).
-
62%
saíram idênticos, letra por letra. Sobrenome soletrado ao telefone é difícil até para quem escuta; quando fica a dúvida, o editor mostra o que foi dito.
Texto em segundos.
Medido do lado de quem envia, contando o tempo de enviar o arquivo.
1,4 s
para 5 minutos de áudio em MP3 virarem texto.
5,3 s
de processamento para 1 hora de áudio, mais o tempo de enviar o arquivo.
Veja no seu áudio, que é o que importa.
Teste sem cadastro com até 2 minutos, ou crie a conta e ganhe 30 minutos.