Navegação
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

AI BENCHY Compare

MoonshotAI: Kimi K2.5 vs xAI: Grok 4.20 Multi-Agent Beta

Benchmarks gerados a partir das suítes de teste do AI BENCHY em: 2026-03-12

Métrica Kimi K2.5 Kimi K2.5 none Lançamento: 2026-01-27 Grok 4.20 Multi-Agent Beta Grok 4.20 Multi-Agent Beta medium Lançamento: 2026-03-12
Posição #54 #47
Pontuação média 4.1 4.9
Consistência 8.6 7.1
Custo por resultado 0.295 97.178
Custo total $0.015 $4.859
Testes corretos
Taxa de acerto por tentativa 39.6% 52.1%
Testes instáveis 3 6
Execuções totais 48 48
Tokens de saída 2,000 293,634
Tokens de raciocínio 0 291,260
Tempo de resposta (médio) 11.91s 9.08s
Tempo de resposta (máx.) 42.13s 35.28s
Tempo de resposta (total) 107.16s 127.09s

Melhores modelos por pontuação

Pontuação vs custo total

Tempo de resposta (médio)

Pontuação média vs Tempo de resposta (médio)

Total de tokens de saída

Pontuação média vs Total de tokens de saída

Detalhamento por categoria

Truques anti-IA Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de saída Tokens de raciocínio
Kimi K2.5 2.7 7.9 11.1% 1 11.38s 363 0
Grok 4.20 Multi-Agent Beta 4.0 4.4 66.7% 2 3.77s 28,392 27,808
Combinado Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de saída Tokens de raciocínio
Kimi K2.5 10.0 2.1 33.3% 1 19.16s 748 0
Grok 4.20 Multi-Agent Beta 10.0 10.0 0.0% 0 0ms 0 0
Análise e extração de dados Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de saída Tokens de raciocínio
Kimi K2.5 5.4 5.8 83.3% 1 42.13s 187 0
Grok 4.20 Multi-Agent Beta 9.9 10.0 100.0% 0 5.54s 25,306 25,051
Específico do domínio Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de saída Tokens de raciocínio
Kimi K2.5 4.0 10.0 33.3% 0 4.38s 29 0
Grok 4.20 Multi-Agent Beta 10.0 7.2 11.1% 1 24.67s 164,609 163,647
Inteligência geral Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de saída Tokens de raciocínio
Kimi K2.5 10.0 10.0 100.0% 0 4.00s 76 0
Grok 4.20 Multi-Agent Beta 4.0 2.8 66.7% 1 6.40s 15,848 15,746
Seguimento de instruções Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de saída Tokens de raciocínio
Kimi K2.5 5.5 10.0 50.0% 0 2.67s 60 0
Grok 4.20 Multi-Agent Beta 9.0 10.0 50.0% 0 4.63s 25,457 25,322
Puzzle Solving Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de saída Tokens de raciocínio
Kimi K2.5 10.0 10.0 0.0% 0 4.73s 317 0
Grok 4.20 Multi-Agent Beta 6.3 5.1 77.8% 2 5.01s 34,022 33,686
Chamada de ferramentas Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de saída Tokens de raciocínio
Kimi K2.5 10.0 10.0 100.0% 0 13.99s 220 0
Grok 4.20 Multi-Agent Beta 10.0 10.0 0.0% 0 0ms 0 0

Comparação rápida

Trocar par de comparação