MiniMax M3 vs GLM-5.2 vs Kimi K3: qual modelo aberto escolher?

MiniMax M3 vs GLM-5.2 vs Kimi K3: qual modelo aberto escolher?

O cenário de modelos de linguência abertos mudou radicalmente em 2026. Três lançamentos — MiniMax M3, GLM-5.2 e Kimi K3 — trouxeram para o ecossistema open source capacidades que até pouco tempo existiam apenas em modelos proprietários fechados.

Todos os três oferecem janela de contexto de 1 milhão de tokens, suporte a tool use e performance competitiva em benchmarks de código e raciocínio. Mas têm diferenças importantes em arquitetura, preço, multimodalidade e foco de uso.

Este artigo compara os três modelos para ajudar empresas e desenvolvedores a escolher com base na necessidade real — não no hype.

Visão geral rápida

CaracterísticaMiniMax M3GLM-5.2Kimi K3
DesenvolvedorMiniMaxZ.ai (Zhipu AI)Moonshot AI
Lançamento1º de junho de 202616 de junho de 202616 de julho de 2026
Pesos abertosSimSim (Apache 2.0)Sim (licença custom)
Parâmetros totais~428 bilhõesNão divulgado2,8 trilhões
Parâmetros ativosMoEMoE104 bilhões (896 experts, 16 ativos)
Contexto1 milhão de tokens1 milhão de tokens1 milhão de tokens
MultimodalSim (imagem e vídeo)Não (texto)Sim (imagem e vídeo)
Preço input (API)$0,30/M tokens$1,40/M tokens$3,00/M tokens
Preço output (API)$1,20/M tokens$4,40/M tokens$15,00/M tokens
LicençaMiniMax CommunityApache 2.0Kimi K3 License (custom)

Já dá para notar um padrão: os três são MoE (Mixture of Experts), todos com contexto de 1M, mas com estratégias de preço e abertura muito diferentes.

MiniMax M3: o mais barato e multimodal

O M3 é o modelo mais acessível dos três. A $0,30 por milhão de tokens de entrada e $1,20 de saída, custa menos de um décimo do preço do Kimi K3.

O que faz o M3 se destacar:

  • Arquitetura MSA (MiniMax Sparse Attention): atenção esparsa que reduz drasticamente o custo computacional em contextos longos. A 1 milhão de tokens, o compute por token é 20 vezes menor que o modelo anterior.
  • Multimodalidade nativa: imagem e vídeo desde o treino inicial, não como plugin. O modelo entende formulários, capturas de tela, diagramas e frames de vídeo.
  • Foco em código e agentes: benchmarks fortes em SWE-bench Pro (59,0%), Terminal-Bench 2.1 (66,0%) e MCP-Atlas (74,2%).
  • GPQA 92,9%: raciocínio científico em nível de pós-graduação.

O M3 também tem capacidade de operar computador (desktop automation), o que o torna interessante para fluxos agentivos que envolvem interfaces gráficas.

Onde brilha: automação com custo baixo, análise de documentos visuais, agentes que precisam de visão e código ao mesmo tempo, operações de alto volume onde o preço por token é crítico.

GLM-5.2: agente robusto com licença permissiva

O GLM-5.2, da Z.ai (antiga Zhipu AI), é o modelo com a melhor relação qualidade/preço para tarefas agentivas. Custa $1,40/M de input e $4,40/M de output — mais caro que o M3, mas muito mais barato que o Kimi K3.

Destaques do GLM-5.2:

  • Agentic Index no 93º percentil: em tarefas com tool use e automação multi-passo, é um dos modelos abertos mais capazes.
  • τ²-bench 99,1%: confiabilidade quase perfeita em tarefas estruturadas com ferramentas.
  • SWE-bench Verified 78,7%: resolve problemas reais do GitHub em nível competitivo.
  • GPQA Diamond 91,9%: raciocínio científico excelente.
  • WebDev Arena 1593: bom em geração de interfaces web.
  • Apache 2.0: a licença mais permissiva entre os três. Permite uso comercial sem restrições significativas.

A principal limitação do GLM-5.2 é ser texto apenas. Não tem visão nativa, o que restringe uso em cenários que envolvem imagens, documentos digitalizados ou capturas de tela.

Onde brilha: agentes com tool use intenso, automação de processos estruturados, desenvolvimento de software backend, tarefas que exigem raciocínio longo sem necessidade de visão. A licença Apache 2.0 é um diferencial importantíssimo para quem quer construir produto em cima do modelo.

Kimi K3: o mais poderoso (e o mais caro)

O Kimi K3, da Moonshot AI, é o modelo aberto mais ambicioso já lançado. Com 2,8 trilhões de parâmetros (104 bilhões ativos por token), é o primeiro modelo aberto a chegar na classe de 3 trilhões.

O que faz o K3 se destacar:

  • Intelligence Index 57 (Artificial Analysis): o maior índice entre todos os modelos abertos, à frente do GLM-5.2 (51).
  • Arquitetura inovadora: Kimi Delta Attention (KDA) e Attention Residuals, com 896 experts e seleção de 16 por token.
  • Multimodalidade nativa: texto, imagem e vídeo, com o vision encoder MoonViT-V2 integrado.
  • Codificação avançada: o K3 construiu um compilador GPU do zero (MiniTriton), reproduziu papers científicos de forma autônoma e otimizou kernels CUDA em testes internos.
  • Reasoning controlável: modos low, high e max de esforço de raciocínio.
  • Pesos em MXFP4: quantização aplicada durante o treino, não pós-processamento. O download de 1,56 TB no Hugging Face já é o formato otimizado.

O preço é o ponto de atenção: $3,00/M input e $15,00/M output — o mesmo que Claude Sonnet 5. Não é um modelo para alto volume. É um modelo para tarefas complexas onde a qualidade da resposta justifica o custo.

A licença também merece atenção. Kimi K3 License é custom, não MIT nem Apache. Exige leitura cuidadosa antes de uso comercial.

Onde brilha: tarefas de alta complexidade que exigem raciocínio profundo, pesquisa científica automatizada, código de baixo nível (kernels, compiladores), sessões longas com contexto massivo, projetos onde a qualidade da resposta importa mais que o custo.

Comparativo de benchmarks

BenchmarkMiniMax M3GLM-5.2Kimi K3
SWE-bench Verified80,5%78,7%
SWE-bench Pro59,0%
GPQA Diamond92,9%91,9%
Terminal-Bench 2.166,0%
τ²-bench99,1%
MCP-Atlas74,2%
BrowseComp83,5%
AIME 2024/202586,4%
ARC-AGI77,0%
Humanity's Last Exam40,1%
Intelligence Index5157

Vale destacar que nem todos os benchmarks foram reportados por todas as equipes. O MiniMax divulgou mais scores de código e agentes; a Z.ai focou em raciocínio e tool use; a Moonshot priorizou casos de uso reais e o índice agregado da Artificial Analysis.

Custo na prática: quanto sai cada resposta?

Para colocar os preços em perspectiva, vamos simular uma resposta típica de um agente que processa 10.000 tokens de entrada e gera 2.000 tokens de saída:

ModeloCusto por resposta
MiniMax M3$0,0054
GLM-5.2$0,0228
Kimi K3$0,0600

Em alto volume — digamos, 100.000 interações por mês — a diferença fica clara:

ModeloCusto mensal (100k interações)
MiniMax M3$540
GLM-5.2$2.280
Kimi K3$6.000

A diferença de preço não significa que o mais barato é sempre a melhor escolha. Significa que a escolha precisa considerar o trade-off entre custo e qualidade da resposta para o problema específico.

Quando escolher cada um?

Escolha MiniMax M3 se:

  • precisa de visão (imagem, vídeo, capturas de tela, documentos digitalizados);
  • o volume de uso é alto e o custo por token é crítico;
  • o foco é código com automação de terminal e desktop;
  • quer a melhor relação custo/benefício geral.

Escolha GLM-5.2 se:

  • o foco é automação com ferramentas e agentes estruturados;
  • precisa de uma licença permissiva (Apache 2.0) para produto comercial;
  • não precisa de visão;
  • quer o melhor índice agente/custo do grupo.

Escolha Kimi K3 se:

  • a tarefa é complexa o suficiente para justificar o custo (pesquisa, código de kernel, ciência);
  • precisa do modelo aberto com maior capacidade geral;
  • o contexto é massivo e a sessão é longa;
  • precisa de visão e raciocínio profundo no mesmo modelo.

Modelos abertos mudam o jogo

Até pouco tempo, a única forma de acessar performance de ponta era pagar para modelos fechados. MiniMax M3, GLM-5.2 e Kimi K3 mostram que o ecossistema aberto chegou a um novo patamar.

Cada um desses modelos tem uma proposta clara. O M3 é o eficiente e multimodal. O GLM-5.2 é o agente confiável com licença comercial amigável. O K3 é o pesado, para problemas difíceis onde o custo é secundário.

A escolha entre eles não é técnica apenas. É estratégica. Depende do problema, do volume, do orçamento, da necessidade de visão, da licença e do ecossistema de inferência disponível.

Como a Mira Sistemas pode ajudar

A Mira Sistemas avalia, implementa e integra modelos de IA em processos empresariais reais. Seja com modelos abertos ou proprietários, o trabalho inclui diagnóstico de necessidade, escolha do modelo, arquitetura, integração com sistemas, segurança e monitoramento contínuo.

Se a sua empresa quer entender qual modelo de IA faz sentido para o seu cenário, fale com a Mira Sistemas. Avaliamos o caso e desenhamos uma solução prática — sem hype, com foco em resultado.

Leia também

Fable 5 voltou: é o mesmo modelo de antes?

6 de julho de 2026

Fable 5 voltou: é o mesmo modelo de antes?

Análise prática sobre o retorno do Claude Fable 5, a sensação de performance próxima ao Sonnet 4.8 e o impacto do consumo maior de tokens nos custos.