Sobre
Os modelos do Deepgram são variações de algoritmos de reconhecimento automático de fala (ASR) treinados para converter áudio em texto. Cada modelo é otimizado para cenários específicos.
De forma prática, escolher um modelo do Deepgram é escolher como a IA vai ouvir e interpretar o áudio. Você pode escolher o modelo com base no tipo de áudio, latência desejada e nível de precisão necessário. As diferenças normalmente envolvem:
Precisão vs. velocidade
-
Alguns modelos priorizam latência baixa (quase tempo real)
-
Outros priorizam máxima precisão (mesmo que mais lentos)
Tipo de áudio
-
Conversas (call center, WhatsApp, reuniões)
-
Áudio limpo (podcasts, gravações profissionais)
-
Áudio ruidoso (rua, carros, ambiente aberto)
Idioma e sotaque
- Modelos podem ser mais ou menos treinados para determinados idiomas ou variações
Recursos adicionais
-
Pontuação automática
-
Identificação de falantes (diarization)
-
Detecção de palavras-chave
-
Formatação inteligente (ex: números, datas)
Escolhendo o modelo de transcrição ideal
1. Base
Modelo mais simples e direto. Foi o primeiro grande modelo que a Deepgram lançou e em alguns casos, pode capturar melhor informações exatas como números e códigos, pois faz menos interpretação do áudio.
-
O que é: Um modelo de reconhecimento de fala (STT) de primeira geração.
-
Uso: É recomendado para volumes massivos de transcrição onde o custo é o fator mais crítico e onde a precisão de timestamps (marcas de tempo) é mais importante do que a legibilidade perfeita do texto.
-
Vantagem: Baixo custo e estabilidade.
-
Desvantagem: Possui uma taxa de erro (WER - Word Error Rate) significativamente maior que os modelos mais recentes.
✨ Dica: Devido a sua melhor transcrição literal, o modelo base pode ter melhor comportamento para transcrição de valores numéricos.
2. Nova-2 e Nova-2-general
Modelo de segunda geração da Deepgram, projetado para oferecer um equilíbrio consistente entre precisão, velocidade e custo, com melhorias relevantes em relação aos modelos mais básicos.
-
Nova-2: Um modelo treinado com um conjunto de dados gigante e variado, focado na melhor relação entre velocidade e precisão do mercado.
-
Nova-2-general: É o modelo otimizado para uso geral. Ele foi treinado numa vasta gama de dados (conversas, chamadas, vídeos, reuniões) para ser o mais versátil possível.
-
Características:
-
Precisão: Teve uma melhoria de cerca de 18% na precisão em relação ao Nova original.
-
Custo-Benefício: Oferece o melhor equilíbrio entre preço e desempenho para a maioria das empresas.
-
Indicado para:
-
Atendimento ao cliente (voz ou WhatsApp);
-
Reuniões e conversas operacionais
-
Aplicações que precisam de resposta rápida com boa qualidade
-
-
Limitações:
-
Inferior ao Nova-3 em entendimento semântico mais profundo
-
Pode ter menor desempenho em áudios muito complexos ou críticos
-
Não é o mais indicado quando a máxima precisão é requisito
-
-
3. Nova-3 e Nova-3-general
Modelos mais avançado, com melhor entendimento de frases e contexto. Pode interpretar o áudio, o que melhora a leitura geral, mas pode alterar levemente informações muito específicas como números isolados pois são otimizados para entendimento semântico da linguagem
-
Nova-3-general: Tal como no antecessor, esta é a versão "generalista" da nova arquitetura.
-
Principais Evoluções:
-
Precisão em Streaming: O Nova-3 foi desenhado para reduzir drasticamente os erros em transcrições em tempo real (streaming), sendo cerca de 50% mais preciso que o Nova-2 neste aspecto.
-
São melhores para: Frases completas, Texto fluido, Intenção da fala
-
Robustez ao Ruído: Lida muito melhor com áudios de baixa qualidade ou com muito ruído de fundo.
-
Multilingue: Tem um suporte superior para múltiplos idiomas e detecção automática de língua.
-
-
Desvantagem na interpretação de:
-
Telefones
-
Códigos
-
Valores numéricos
-