Modelo de IA · requer integração técnica para uso
BGE-M3
BAAI — Beijing Academy of Artificial Intelligence (China)
Modelo de embeddings multilíngue (100+ idiomas, português medido nominalmente) para busca semântica e RAG: gera representação densa, esparsa e multi-vetor numa única passada, com entrada de até 8.192 tokens. Leve (569M), roda até em CPU.
Busca semântica e embeddings
Quando faz sentido usar
- Busca semântica e RAG multilíngues em acervos documentais, em infraestrutura própria
- Recuperação híbrida (denso + esparso) sem manter dois modelos separados
Para colocar em uso
- Integração técnica: FlagEmbedding ou sentence-transformers
- ~1,2 GB em fp16 — CPU para volume pequeno, GPU comum para produção
Limitações e cuidados
- Referência pela combinação única de capacidades e licença, não por liderar benchmark — rankings de 2026 já têm modelos superiores em score bruto
- A própria BAAI recomenda combinar denso + esparso na recuperação; desempenho varia com o volume de treino por idioma
Acessar fonte oficial ↗ (abre em nova aba, fora do BBSIA)
Infraestrutura e variantes
Execução em infraestrutura própria: possível — computador local, servidor com gpu.
- bge-m3 (569M, denso + esparso + multi-vetor) · porte pequeno · computador local, servidor com gpu
Modalidades e idiomas
Entrada: texto · Saída: vetores
Português: Declarado na fonte
Licença e nível de abertura
Nível de abertura: Open source
Licença do modelo/pesos: MIT — licença OSI, uso comercial e modificação livres (declarada no cartão do próprio modelo)
A classificação resume as informações verificadas nas fontes oficiais. Confira os termos da licença antes da adoção.
Fontes
Informações verificadas em setembro de 2026.