AI BENCHY Compare

MoonshotAI: Kimi K2.5 vs xAI: Grok Build 0.1

Benchmarks gerados a partir das suítes de teste do AI BENCHY em: 2026-05-22

Métrica	Kimi K2.5 Kimi K2.5 medium Lançamento: 2026-01-27	Grok Build 0.1 Grok Build 0.1 none Lançamento: 2026-05-21

Métrica	Kimi K2.5 Kimi K2.5 medium Lançamento: 2026-01-27	Grok Build 0.1 Grok Build 0.1 none Lançamento: 2026-05-21
Pontuação	6.7	6.6
Posição	#79	#82
Confiabilidade	10.0	10.0
Consistência	6.8	8.0
Testes corretos
Taxa de acerto por tentativa	66.7%	60.4%
Testes instáveis	8	4
Execuções totais	60	57
Custo por resultado	3.479	7.805
Custo total	$0.314	$0.547
Preço de entrada	$0.400 / 1M	$1.000 / 1M
Preço de saída	$1.900 / 1M	$2.000 / 1M
Tokens de saída	46,619	267,275
Tokens de raciocínio	128,184	0
Tempo de resposta (médio)	89.36s	28.69s
Tempo de resposta (máx.)	281.00s	138.35s
Tempo de resposta (total)	1161.65s	459.00s

Melhores modelos por pontuação

Pontuação vs custo total

Tempo de resposta (médio)

Pontuação vs Tempo de resposta (médio)

Total de tokens de saída

Pontuação vs Total de tokens de saída

Detalhamento por categoria

Truques anti-IA	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
Kimi K2.5	7.3	5.8	83.3%	2		51.38s	2,789	8,880
Grok Build 0.1	8.7	7.9	91.7%	1		6.30s	11,162	0

Programação	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
Kimi K2.5	4.1	1.9	50.0%	2		215.89s	5,700	45,419
Grok Build 0.1	10.0	10.0	100.0%	0		21.41s	16,568	0

Combinado	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
Kimi K2.5	10.0	10.0	100.0%	0		71.37s	703	3,713
Grok Build 0.1	0.0	0.0	0.0%	0		0ms	0	0

Análise e extração de dados	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
Kimi K2.5	10.0	10.0	100.0%	0		49.78s	563	7,940
Grok Build 0.1	4.7	1.6	66.7%	1		9.33s	6,359	0

Específico do domínio	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
Kimi K2.5	3.5	4.4	33.3%	2		137.29s	20,753	30,564
Grok Build 0.1	3.6	7.2	22.2%	1		103.71s	179,469	0

Inteligência geral	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
Kimi K2.5	6.5	3.4	66.7%	1		69.73s	3,815	4,262
Grok Build 0.1	4.3	10.0	0.0%	0		12.47s	6,647	0

Seguimento de instruções	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
Kimi K2.5	10.0	10.0	100.0%	0		92.47s	5,371	6,547
Grok Build 0.1	9.8	10.0	100.0%	0		7.36s	8,970	0

Resolução de quebra-cabeças	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
Kimi K2.5	5.3	7.3	44.4%	1		45.40s	6,671	12,403
Grok Build 0.1	6.4	7.7	55.6%	1		9.55s	14,982	0

Chamada de ferramentas	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
Kimi K2.5	10.0	10.0	100.0%	0		31.74s	242	812
Grok Build 0.1	0.0	0.0	0.0%	0		0ms	0	0

Conhecimentos gerais	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de saída	Tokens de raciocínio
Kimi K2.5	3.0	10.0	0.0%	0		83.95s	12	7,644
Grok Build 0.1	3.0	10.0	0.0%	0		36.09s	23,118	0

Comparação rápida

Trocar par de comparação

Gemini 3.1 Flash LiteminimalvsKimi K2.5medium DeepSeek V4 ProhighvsKimi K2.5medium Qwen3.6 27BmediumvsGrok Build 0.1none DeepSeek V4 ProhighvsGrok Build 0.1none Gemma 4 31BnoneDisponível grátisvsKimi K2.5medium Gemini 3.1 Flash LiteminimalvsGrok Build 0.1none Gemini 3.1 Flash LitenonevsKimi K2.5medium Kimi K2.5mediumvsGPT-5.5none Kimi K2.5mediumvsQwen3.5 Plus 2026-02-15none GPT-5 MinimediumvsGrok Build 0.1none Grok Build 0.1nonevsMiMo-V2-Omnimedium Mercury 2mediumvsGrok Build 0.1none