Modelo de IA · requer integração técnica para uso
Whisper
OpenAI (EUA)
Modelo de transcrição de fala (áudio para texto) em ~99 idiomas, com o português entre os de melhor desempenho medido. Seis tamanhos, do tiny (roda em CPU) ao large-v3; o turbo transcreve ~8x mais rápido. Provável componente aberto mais implantado em transcrição no setor público.
Transcrição de áudio
Quando faz sentido usar
- Transcrição de reuniões, audiências e atendimentos em infraestrutura própria, sem enviar áudio a API externa
- Legendagem e degravação de acervos de áudio e vídeo em português
Para colocar em uso
- Integração técnica: PyTorch ou implementações otimizadas (faster-whisper, whisper.cpp)
- tiny a medium rodam em CPU; large-v3 pede ~10 GB de VRAM (turbo, ~6 GB)
Limitações e cuidados
- Alucina texto em trechos de silêncio ou áudio ruim — revisar transcrição usada em ato oficial
- Português medido entre os melhores idiomas (WER ~4% no FLEURS), mas o desempenho varia com sotaque e qualidade do áudio
- A variante turbo não faz tradução, só transcrição; para traduzir, usar medium ou large-v3
Acessar fonte oficial ↗ (abre em nova aba, fora do BBSIA)
Infraestrutura e variantes
Execução em infraestrutura própria: possível — computador local, servidor com gpu.
- tiny / base / small / medium (39M–769M) · porte pequeno · computador local
- large-v3 (1,55B) · porte pequeno · computador local, servidor com gpu
- large-v3-turbo (809M, ~8x mais rápido) · porte pequeno · computador local, servidor com gpu
Modalidades e idiomas
Entrada: áudio · Saída: texto
Português: Declarado na fonte
Licença e nível de abertura
Nível de abertura: Open source
Licença do modelo/pesos: MIT — licença OSI; o README oficial declara explicitamente que código E pesos estão sob MIT
A classificação resume as informações verificadas nas fontes oficiais. Confira os termos da licença antes da adoção.
Fontes
Informações verificadas em setembro de 2026.