Pular para o conteúdo

Comparativo de precisão

Em ligação de verdade, a Nous erra menos.

Cinco serviços, os mesmos 305 trechos de ligações reais de atendimento, em linha telefônica. É o áudio mais difícil que existe: todo mundo erra bastante. A diferença está em quanto.

No mesmo áudio de ligação

que o Whisper large-v3, da OpenAI
13% menos erros
que o Deepgram Nova-3, com a lista de termos
21% menos erros

Erro por palavra em ligação real.

Menor é melhor. Cada serviço na melhor configuração que testamos, com a lista de termos quando ele aceita.

  • Nous modelo próprio, com a lista de termos do cliente 20,8% 21 a cada 100 palavras
  • Whisper large-v3 OpenAI, modelo aberto 24,0% 24 a cada 100 palavras
  • Speechmatics Enhanced, português, com vocabulário adicional 24,1% 24 a cada 100 palavras
  • Deepgram Nova-3 pt-BR, com a lista de termos 26,5% 27 a cada 100 palavras
  • Distil-Whisper versão reduzida do Whisper 29,4% 29 a cada 100 palavras
Erro por palavra e por letra de cada serviço, no mesmo conjunto de ligações
Serviço Erro por palavra Erro por letra A Nous erra
Nous 20,8% 14,9%
Whisper large-v3 24,0% 17,3% 13% menos
Speechmatics 24,1% 17,8% 13% menos
Deepgram Nova-3 26,5% 19,9% 21% menos
Distil-Whisper 29,4% 19,3% 29% menos

Medido em 24/08/2026, com o modelo da Nous daquela data; o de hoje fica na mesma faixa nas nossas medições internas. As ligações são de clientes reais, por isso o áudio não é público.

"Mas por aí dizem 5% de erro."

Os números de 4% a 10% que aparecem em propaganda são de fala lida: alguém lendo um texto em voz alta, num microfone bom, sem barulho. Nesse áudio, quase todo serviço moderno acerta quase tudo.

Ligação é outra coisa: linha telefônica que corta o som pela metade, gente falando junto, palavra engolida, barulho de rua. Aqui o erro de todo mundo sobe umas quatro vezes. Por isso um número de ligação não se compara com um número de estúdio, e é por isso que medimos no áudio difícil.

Em gravação limpa (aula, podcast, reunião com bom microfone), espere bem menos erro do que nesta tabela. Teste com um áudio seu: é de graça e leva segundos.

E-mail e CPF ditados, escritos como se escreve.

O erro por palavra não enxerga isso, e é o que mais dá trabalho de corrigir. Nos testes de agosto, os outros serviços devolveram os e-mails como foram falados, em palavras.

  • 22 de 22

    CPFs ditados na referência humana, escritos com pontos e traço. Só vira CPF o que fecha os dígitos verificadores.

  • 97%

    dos 29 e-mails ditados em ligação real saíram com o provedor certo (gmail.com, hotmail.com...).

  • 62%

    saíram idênticos, letra por letra. Sobrenome soletrado ao telefone é difícil até para quem escuta; quando fica a dúvida, o editor mostra o que foi dito.

Texto em segundos.

Medido do lado de quem envia, contando o tempo de enviar o arquivo.

1,4 s

para 5 minutos de áudio em MP3 virarem texto.

5,3 s

de processamento para 1 hora de áudio, mais o tempo de enviar o arquivo.

Veja no seu áudio, que é o que importa.

Teste sem cadastro com até 2 minutos, ou crie a conta e ganhe 30 minutos.