MiniMax M3 vs GLM-5.2 vs Kimi K3: qual modelo aberto escolher?
O cenário de modelos de linguência abertos mudou radicalmente em 2026. Três lançamentos — MiniMax M3, GLM-5.2 e Kimi K3 — trouxeram para o ecossistema open source capacidades que até pouco tempo existiam apenas em modelos proprietários fechados.
Todos os três oferecem janela de contexto de 1 milhão de tokens, suporte a tool use e performance competitiva em benchmarks de código e raciocínio. Mas têm diferenças importantes em arquitetura, preço, multimodalidade e foco de uso.
Este artigo compara os três modelos para ajudar empresas e desenvolvedores a escolher com base na necessidade real — não no hype.
Visão geral rápida
| Característica | MiniMax M3 | GLM-5.2 | Kimi K3 |
|---|---|---|---|
| Desenvolvedor | MiniMax | Z.ai (Zhipu AI) | Moonshot AI |
| Lançamento | 1º de junho de 2026 | 16 de junho de 2026 | 16 de julho de 2026 |
| Pesos abertos | Sim | Sim (Apache 2.0) | Sim (licença custom) |
| Parâmetros totais | ~428 bilhões | Não divulgado | 2,8 trilhões |
| Parâmetros ativos | MoE | MoE | 104 bilhões (896 experts, 16 ativos) |
| Contexto | 1 milhão de tokens | 1 milhão de tokens | 1 milhão de tokens |
| Multimodal | Sim (imagem e vídeo) | Não (texto) | Sim (imagem e vídeo) |
| Preço input (API) | $0,30/M tokens | $1,40/M tokens | $3,00/M tokens |
| Preço output (API) | $1,20/M tokens | $4,40/M tokens | $15,00/M tokens |
| Licença | MiniMax Community | Apache 2.0 | Kimi K3 License (custom) |
Já dá para notar um padrão: os três são MoE (Mixture of Experts), todos com contexto de 1M, mas com estratégias de preço e abertura muito diferentes.
MiniMax M3: o mais barato e multimodal
O M3 é o modelo mais acessível dos três. A $0,30 por milhão de tokens de entrada e $1,20 de saída, custa menos de um décimo do preço do Kimi K3.
O que faz o M3 se destacar:
- Arquitetura MSA (MiniMax Sparse Attention): atenção esparsa que reduz drasticamente o custo computacional em contextos longos. A 1 milhão de tokens, o compute por token é 20 vezes menor que o modelo anterior.
- Multimodalidade nativa: imagem e vídeo desde o treino inicial, não como plugin. O modelo entende formulários, capturas de tela, diagramas e frames de vídeo.
- Foco em código e agentes: benchmarks fortes em SWE-bench Pro (59,0%), Terminal-Bench 2.1 (66,0%) e MCP-Atlas (74,2%).
- GPQA 92,9%: raciocínio científico em nível de pós-graduação.
O M3 também tem capacidade de operar computador (desktop automation), o que o torna interessante para fluxos agentivos que envolvem interfaces gráficas.
Onde brilha: automação com custo baixo, análise de documentos visuais, agentes que precisam de visão e código ao mesmo tempo, operações de alto volume onde o preço por token é crítico.
GLM-5.2: agente robusto com licença permissiva
O GLM-5.2, da Z.ai (antiga Zhipu AI), é o modelo com a melhor relação qualidade/preço para tarefas agentivas. Custa $1,40/M de input e $4,40/M de output — mais caro que o M3, mas muito mais barato que o Kimi K3.
Destaques do GLM-5.2:
- Agentic Index no 93º percentil: em tarefas com tool use e automação multi-passo, é um dos modelos abertos mais capazes.
- τ²-bench 99,1%: confiabilidade quase perfeita em tarefas estruturadas com ferramentas.
- SWE-bench Verified 78,7%: resolve problemas reais do GitHub em nível competitivo.
- GPQA Diamond 91,9%: raciocínio científico excelente.
- WebDev Arena 1593: bom em geração de interfaces web.
- Apache 2.0: a licença mais permissiva entre os três. Permite uso comercial sem restrições significativas.
A principal limitação do GLM-5.2 é ser texto apenas. Não tem visão nativa, o que restringe uso em cenários que envolvem imagens, documentos digitalizados ou capturas de tela.
Onde brilha: agentes com tool use intenso, automação de processos estruturados, desenvolvimento de software backend, tarefas que exigem raciocínio longo sem necessidade de visão. A licença Apache 2.0 é um diferencial importantíssimo para quem quer construir produto em cima do modelo.
Kimi K3: o mais poderoso (e o mais caro)
O Kimi K3, da Moonshot AI, é o modelo aberto mais ambicioso já lançado. Com 2,8 trilhões de parâmetros (104 bilhões ativos por token), é o primeiro modelo aberto a chegar na classe de 3 trilhões.
O que faz o K3 se destacar:
- Intelligence Index 57 (Artificial Analysis): o maior índice entre todos os modelos abertos, à frente do GLM-5.2 (51).
- Arquitetura inovadora: Kimi Delta Attention (KDA) e Attention Residuals, com 896 experts e seleção de 16 por token.
- Multimodalidade nativa: texto, imagem e vídeo, com o vision encoder MoonViT-V2 integrado.
- Codificação avançada: o K3 construiu um compilador GPU do zero (MiniTriton), reproduziu papers científicos de forma autônoma e otimizou kernels CUDA em testes internos.
- Reasoning controlável: modos low, high e max de esforço de raciocínio.
- Pesos em MXFP4: quantização aplicada durante o treino, não pós-processamento. O download de 1,56 TB no Hugging Face já é o formato otimizado.
O preço é o ponto de atenção: $3,00/M input e $15,00/M output — o mesmo que Claude Sonnet 5. Não é um modelo para alto volume. É um modelo para tarefas complexas onde a qualidade da resposta justifica o custo.
A licença também merece atenção. Kimi K3 License é custom, não MIT nem Apache. Exige leitura cuidadosa antes de uso comercial.
Onde brilha: tarefas de alta complexidade que exigem raciocínio profundo, pesquisa científica automatizada, código de baixo nível (kernels, compiladores), sessões longas com contexto massivo, projetos onde a qualidade da resposta importa mais que o custo.
Comparativo de benchmarks
| Benchmark | MiniMax M3 | GLM-5.2 | Kimi K3 |
|---|---|---|---|
| SWE-bench Verified | 80,5% | 78,7% | — |
| SWE-bench Pro | 59,0% | — | — |
| GPQA Diamond | 92,9% | 91,9% | — |
| Terminal-Bench 2.1 | 66,0% | — | — |
| τ²-bench | — | 99,1% | — |
| MCP-Atlas | 74,2% | — | — |
| BrowseComp | 83,5% | — | — |
| AIME 2024/2025 | — | 86,4% | — |
| ARC-AGI | — | 77,0% | — |
| Humanity's Last Exam | — | 40,1% | — |
| Intelligence Index | — | 51 | 57 |
Vale destacar que nem todos os benchmarks foram reportados por todas as equipes. O MiniMax divulgou mais scores de código e agentes; a Z.ai focou em raciocínio e tool use; a Moonshot priorizou casos de uso reais e o índice agregado da Artificial Analysis.
Custo na prática: quanto sai cada resposta?
Para colocar os preços em perspectiva, vamos simular uma resposta típica de um agente que processa 10.000 tokens de entrada e gera 2.000 tokens de saída:
| Modelo | Custo por resposta |
|---|---|
| MiniMax M3 | $0,0054 |
| GLM-5.2 | $0,0228 |
| Kimi K3 | $0,0600 |
Em alto volume — digamos, 100.000 interações por mês — a diferença fica clara:
| Modelo | Custo mensal (100k interações) |
|---|---|
| MiniMax M3 | $540 |
| GLM-5.2 | $2.280 |
| Kimi K3 | $6.000 |
A diferença de preço não significa que o mais barato é sempre a melhor escolha. Significa que a escolha precisa considerar o trade-off entre custo e qualidade da resposta para o problema específico.
Quando escolher cada um?
Escolha MiniMax M3 se:
- precisa de visão (imagem, vídeo, capturas de tela, documentos digitalizados);
- o volume de uso é alto e o custo por token é crítico;
- o foco é código com automação de terminal e desktop;
- quer a melhor relação custo/benefício geral.
Escolha GLM-5.2 se:
- o foco é automação com ferramentas e agentes estruturados;
- precisa de uma licença permissiva (Apache 2.0) para produto comercial;
- não precisa de visão;
- quer o melhor índice agente/custo do grupo.
Escolha Kimi K3 se:
- a tarefa é complexa o suficiente para justificar o custo (pesquisa, código de kernel, ciência);
- precisa do modelo aberto com maior capacidade geral;
- o contexto é massivo e a sessão é longa;
- precisa de visão e raciocínio profundo no mesmo modelo.
Modelos abertos mudam o jogo
Até pouco tempo, a única forma de acessar performance de ponta era pagar para modelos fechados. MiniMax M3, GLM-5.2 e Kimi K3 mostram que o ecossistema aberto chegou a um novo patamar.
Cada um desses modelos tem uma proposta clara. O M3 é o eficiente e multimodal. O GLM-5.2 é o agente confiável com licença comercial amigável. O K3 é o pesado, para problemas difíceis onde o custo é secundário.
A escolha entre eles não é técnica apenas. É estratégica. Depende do problema, do volume, do orçamento, da necessidade de visão, da licença e do ecossistema de inferência disponível.
Como a Mira Sistemas pode ajudar
A Mira Sistemas avalia, implementa e integra modelos de IA em processos empresariais reais. Seja com modelos abertos ou proprietários, o trabalho inclui diagnóstico de necessidade, escolha do modelo, arquitetura, integração com sistemas, segurança e monitoramento contínuo.
Se a sua empresa quer entender qual modelo de IA faz sentido para o seu cenário, fale com a Mira Sistemas. Avaliamos o caso e desenhamos uma solução prática — sem hype, com foco em resultado.

