Modelos abertos
Modelos de IA reutilizáveis para desenvolver novas soluções. Pesquise pelo que você precisa fazer, mesmo sem conhecer o nome do modelo. A disponibilidade de pesos não significa que o modelo seja open source — consulte a classificação e a licença de cada item.
13 modelos encontrados
- BERTimbauNeuralMind (pesquisa em parceria com a Unicamp) · Encoder BERT em português do Brasil para classificação de texto, reconhecimento de entidades, similaridade e busca semântica — não gera texto nem conversa. Leve, roda em CPU, e segue sendo o encoder pt-BR mais usado. · Busca semântica e embeddings · Leitura e extração de documentosOpen source
- BGE-M3BAAI — Beijing Academy of Artificial Intelligence (China) · Modelo de embeddings multilíngue (100+ idiomas, português medido nominalmente) para busca semântica e RAG: gera representação densa, esparsa e multi-vetor numa única passada, com entrada de até 8.192 tokens. Leve (569M), roda até em CPU. · Busca semântica e embeddingsOpen source
- BodeRecogna NLP (UNESP), treinado no supercomputador Santos Dumont (LNCC/MCTI) · Modelo de chat em português (7B e 13B) derivado do Llama 2 por ajuste fino com instruções traduzidas. Responde em português com menos erros que o Llama 2 puro; da geração 2023-2024 de LLMs nacionais. · Geração de texto e chat · Leitura e extração de documentosPesos abertos
- GAIACEIA-UFG, ABRIA, Nama, Amadeus AI e Google DeepMind · Modelo de chat e geração de texto em português do Brasil, para perguntas e respostas, resumo e redação de conteúdo — executável em infraestrutura própria de pequeno porte. · Geração de texto e chat · Leitura e extração de documentosPesos abertos
- Gemma 4Google DeepMind (EUA) · Família multimodal do Google (texto, imagem e vídeo; áudio em parte das variantes), do edge (E2B) à workstation (31B), desenhada para rodar em infraestrutura própria. Primeira geração Gemma sob Apache-2.0 — as anteriores seguem sob os Gemma Terms. · Geração de texto e chat · Leitura e extração de documentos · Análise de imagensOpen source
- Llama 4Meta Platforms (EUA) · Família multimodal de pesos abertos da Meta (entrada de texto e imagem, arquitetura de mistura de especialistas), com contexto muito longo. Porte de datacenter: nenhuma variante roda em computador comum. · Geração de texto e chat · Leitura e extração de documentos · Análise de imagensPesos abertos
- Manacá-1BLNCC — Instituto de IA, em cooperação com NII/LLM-jp (Japão) · Modelo base treinado do zero em português do Brasil, para ajuste fino, pesquisa e construção de aplicações em pt-BR sobre um alicerce nacional reprodutível. Não conversa nem segue instruções sem ajuste adicional. · Geração de texto e chatPesos abertos
- Ministral 3Mistral AI (França) · Família compacta da Mistral (3B, 8B e 14B, com variantes Base, Instruct e Reasoning), multimodal na entrada (texto e imagem) e com contexto de 256K, sob Apache-2.0 — a linha da Mistral desenhada para rodar em infraestrutura própria modesta. · Geração de texto e chat · Leitura e extração de documentos · Análise de imagensOpen source
- OLMo 3Allen Institute for AI — Ai2 (EUA, instituto sem fins lucrativos) · O modelo mais transparente do acervo: além dos pesos, os dados de treino (Dolma 3), o código e os checkpoints intermediários são públicos — todo o processo é auditável. Treinado em inglês; referência do que 'open source' significa por inteiro em um LLM. · Geração de texto e chat · Leitura e extração de documentosOpen source
- ptt5-v2unicamp-dl — Universidade Estadual de Campinas (Unicamp) · Família T5 adaptada ao português (60M a 3B) para tarefas texto-a-texto por ajuste fino: sumarização, reescrita, classificação e ranqueamento de busca. Não conversa nem segue instruções sem fine-tuning. · Leitura e extração de documentosOpen source
- Qwen3.8 27BQwen Team / Alibaba Cloud (China) · Modelo denso multimodal (texto, imagem e vídeo na entrada) com contexto de 262K tokens, sob Apache-2.0. É a variante aberta-OSI da família Qwen3.8 — os irmãos maiores (Flash-Next e 2.4T) têm licenças próprias com condições e ficaram fora da vitrine. · Geração de texto e chat · Leitura e extração de documentos · Análise de imagensOpen source
- Tucano 2Polygl0t — Universidade de Bonn (equipe do Tucano original; financiamento público alemão) · Família de modelos de chat e geração de texto em português (0,5B a 3,7B), com variantes Base, Instruct e Think (raciocínio passo a passo) — pequena o bastante para rodar em infraestrutura própria modesta, sob licença Apache-2.0 sem restrição de uso. · Geração de texto e chat · Leitura e extração de documentosOpen source
- WhisperOpenAI (EUA) · Modelo de transcrição de fala (áudio para texto) em ~99 idiomas, com o português entre os de melhor desempenho medido. Seis tamanhos, do tiny (roda em CPU) ao large-v3; o turbo transcreve ~8x mais rápido. Provável componente aberto mais implantado em transcrição no setor público. · Transcrição de áudioOpen source