Principal CREDENCIAIS ENTENDENDO OS MODELOS DEEPGRAM NO TOOLZZ VOICE!

ENTENDENDO OS MODELOS DEEPGRAM NO TOOLZZ VOICE!

Última atualização em Mar 26, 2026

Sobre

Os modelos do Deepgram são variações de algoritmos de reconhecimento automático de fala (ASR) treinados para converter áudio em texto. Cada modelo é otimizado para cenários específicos.

De forma prática, escolher um modelo do Deepgram é escolher como a IA vai ouvir e interpretar o áudio. Você pode escolher o modelo com base no tipo de áudio, latência desejada e nível de precisão necessário. As diferenças normalmente envolvem:

Precisão vs. velocidade

  • Alguns modelos priorizam latência baixa (quase tempo real)

  • Outros priorizam máxima precisão (mesmo que mais lentos)

Tipo de áudio

  • Conversas (call center, WhatsApp, reuniões)

  • Áudio limpo (podcasts, gravações profissionais)

  • Áudio ruidoso (rua, carros, ambiente aberto)

Idioma e sotaque

  • Modelos podem ser mais ou menos treinados para determinados idiomas ou variações

Recursos adicionais

  • Pontuação automática

  • Identificação de falantes (diarization)

  • Detecção de palavras-chave

  • Formatação inteligente (ex: números, datas)

Escolhendo o modelo de transcrição ideal

1. Base

Modelo mais simples e direto. Foi o primeiro grande modelo que a Deepgram lançou e em alguns casos, pode capturar melhor informações exatas como números e códigos, pois faz menos interpretação do áudio.

  • O que é: Um modelo de reconhecimento de fala (STT) de primeira geração.

  • Uso: É recomendado para volumes massivos de transcrição onde o custo é o fator mais crítico e onde a precisão de timestamps (marcas de tempo) é mais importante do que a legibilidade perfeita do texto.

  • Vantagem: Baixo custo e estabilidade.

  • Desvantagem: Possui uma taxa de erro (WER - Word Error Rate) significativamente maior que os modelos mais recentes.

✨ Dica: Devido a sua melhor transcrição literal, o modelo base pode ter melhor comportamento para transcrição de valores numéricos.

2. Nova-2 e Nova-2-general

Modelo de segunda geração da Deepgram, projetado para oferecer um equilíbrio consistente entre precisão, velocidade e custo, com melhorias relevantes em relação aos modelos mais básicos.

  • Nova-2: Um modelo treinado com um conjunto de dados gigante e variado, focado na melhor relação entre velocidade e precisão do mercado.

  • Nova-2-general: É o modelo otimizado para uso geral. Ele foi treinado numa vasta gama de dados (conversas, chamadas, vídeos, reuniões) para ser o mais versátil possível.

  • Características:

    • Precisão: Teve uma melhoria de cerca de 18% na precisão em relação ao Nova original.

    • Custo-Benefício: Oferece o melhor equilíbrio entre preço e desempenho para a maioria das empresas.

    • Indicado para:

      • Atendimento ao cliente (voz ou WhatsApp);

      • Reuniões e conversas operacionais

      • Aplicações que precisam de resposta rápida com boa qualidade

    • Limitações:

      • Inferior ao Nova-3 em entendimento semântico mais profundo

      • Pode ter menor desempenho em áudios muito complexos ou críticos

      • Não é o mais indicado quando a máxima precisão é requisito

3. Nova-3 e Nova-3-general

Modelos mais avançado, com melhor entendimento de frases e contexto. Pode interpretar o áudio, o que melhora a leitura geral, mas pode alterar levemente informações muito específicas como números isolados pois são otimizados para entendimento semântico da linguagem

  • Nova-3-general: Tal como no antecessor, esta é a versão "generalista" da nova arquitetura.

  • Principais Evoluções:

    • Precisão em Streaming: O Nova-3 foi desenhado para reduzir drasticamente os erros em transcrições em tempo real (streaming), sendo cerca de 50% mais preciso que o Nova-2 neste aspecto.

    • São melhores para: Frases completas, Texto fluido, Intenção da fala

    • Robustez ao Ruído: Lida muito melhor com áudios de baixa qualidade ou com muito ruído de fundo.

    • Multilingue: Tem um suporte superior para múltiplos idiomas e detecção automática de língua.

  • Desvantagem na interpretação de:

    • Telefones

    • Códigos

    • Valores numéricos