AI BENCHY Compare

MoonshotAI: Kimi K2.5 vs xAI: Grok 4.20

Benchmarks gerados a partir das suítes de teste do AI BENCHY em: 2026-04-02

Métrica	Kimi K2.5 Kimi K2.5 medium Lançamento: 2026-01-27	Grok 4.20 Grok 4.20 medium Lançamento: 2026-03-31

Métrica	Kimi K2.5 Kimi K2.5 medium Lançamento: 2026-01-27	Grok 4.20 Grok 4.20 medium Lançamento: 2026-03-31
Pontuação	7.2	7.1
Posição	#39	#40
Consistência	7.2	8.2
Testes corretos
Taxa de acerto por tentativa	72.6%	66.7%
Testes instáveis	6	4
Execuções totais	51	51
Custo por resultado	2.232	7.358
Custo total	$0.201	$0.663
Preço de entrada	$0.383 / 1M	$2.000 / 1M
Preço de saída	$1.909 / 1M	$6.000 / 1M
Tokens de saída	40,907	1,494
Tokens de raciocínio	75,121	97,078
Tempo de resposta (médio)	64.59s	9.50s
Tempo de resposta (máx.)	137.29s	29.87s
Tempo de resposta (total)	645.93s	161.54s

Melhores modelos por pontuação

Pontuação vs custo total

Tempo de resposta (médio)

Pontuação vs Tempo de resposta (médio)

Total de tokens de saída

Pontuação vs Total de tokens de saída

Detalhamento por categoria

Truques anti-IA	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
Kimi K2.5	7.3	5.8	83.3%	2		51.38s	2,789	8,880
Grok 4.20	8.2	7.9	83.3%	1		3.36s	280	8,476

Combinado	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
Kimi K2.5	10.0	10.0	100.0%	0		71.37s	703	3,713
Grok 4.20	10.0	10.0	100.0%	0		17.40s	232	9,556

Análise e extração de dados	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
Kimi K2.5	10.0	10.0	100.0%	0		49.78s	563	7,940
Grok 4.20	10.0	10.0	100.0%	0		4.17s	180	5,333

Específico do domínio	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
Kimi K2.5	3.5	4.4	33.3%	2		137.29s	20,753	30,564
Grok 4.20	5.3	10.0	33.3%	0		27.03s	375	49,339

Inteligência geral	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
Kimi K2.5	6.5	3.4	66.7%	1		69.73s	3,815	4,262
Grok 4.20	5.8	2.8	66.7%	1		7.09s	47	4,252

Seguimento de instruções	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
Kimi K2.5	10.0	10.0	100.0%	0		92.47s	5,371	6,547
Grok 4.20	7.3	5.9	83.3%	1		4.42s	40	5,474

Puzzle Solving	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
Kimi K2.5	5.3	7.3	44.4%	1		45.40s	6,671	12,403
Grok 4.20	6.4	7.7	55.6%	1		3.89s	143	8,028

Chamada de ferramentas	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
Kimi K2.5	10.0	10.0	100.0%	0		31.74s	242	812
Grok 4.20	3.0	10.0	0.0%	0		13.68s	197	6,620

Comparação rápida

Trocar par de comparação

Claude Sonnet 4.6nonevsKimi K2.5medium Claude Sonnet 4.6nonevsGrok 4.20medium Qwen3.5 Plus 2026-02-15nonevsGrok 4.20medium Kimi K2.5mediumvsGPT-5.3 Chatnone Gemma 4 31BnonevsGrok 4.20medium Grok 4.20mediumvsGLM 5none Kimi K2.5mediumvsQwen3.5 Plus 2026-02-15none GPT-5.3 ChatnonevsGrok 4.20medium Gemma 4 31BnonevsKimi K2.5medium Kimi K2.5mediumvsGLM 5none Kimi K2.5mediumvsGPT-5.2 Chatnone Gemini 3.1 Flash Lite PreviewnonevsKimi K2.5medium