Comparar Gráficos

Idioma:

❤️ Made by XCS

AI BENCHY Compare

Google: Gemini 3.1 Flash Lite Preview vs MoonshotAI: Kimi K2.5

Comparar:

Benchmarks gerados a partir das suítes de teste do AI BENCHY em: 2026-03-03

Métrica	Google: Gemini 3.1 Flash Lite Preview none Lançamento: 2026-03-03	MoonshotAI: Kimi K2.5 medium Lançamento: 2026-01-27
Posição	#10	#25
Pontuação média	7.70	6.29
Consistência	9.54	7.69
Custo por resultado	0.116	2.335
Custo total	$0.011	$0.187
Testes corretos
Taxa de acerto por tentativa	69.1%	73.8%
Testes instáveis	1	4
Tokens de saída	4,307	30,504
Tokens de raciocínio	0	58,467

Melhores modelos por pontuação

Pontuação vs custo total

Detalhamento por categoria

Truques anti-IA	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tokens de saída	Tokens de raciocínio
Google: Gemini 3.1 Flash Lite Preview	6.00	7.85	55.6%	1		1,086	0
MoonshotAI: Kimi K2.5	7.00	7.21	88.9%	1		335	6,255

Análise e extração de dados	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tokens de saída	Tokens de raciocínio
Google: Gemini 3.1 Flash Lite Preview	9.88	10.00	100.0%	0		399	0
MoonshotAI: Kimi K2.5	10.00	10.00	100.0%	0		1,181	6,049

Específico do domínio	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tokens de saída	Tokens de raciocínio
Google: Gemini 3.1 Flash Lite Preview	4.00	10.00	33.3%	0		568	0
MoonshotAI: Kimi K2.5	1.00	4.41	33.3%	2		20,696	30,894

Seguimento de instruções	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tokens de saída	Tokens de raciocínio
Google: Gemini 3.1 Flash Lite Preview	9.00	10.00	50.0%	0		574	0
MoonshotAI: Kimi K2.5	9.50	10.00	100.0%	0		3,777	4,967

Puzzle Solving	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tokens de saída	Tokens de raciocínio
Google: Gemini 3.1 Flash Lite Preview	10.00	10.00	100.0%	0		898	0
MoonshotAI: Kimi K2.5	5.00	7.61	55.6%	1		4,273	9,490

Chamada de ferramentas	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tokens de saída	Tokens de raciocínio
Google: Gemini 3.1 Flash Lite Preview	10.00	10.00	100.0%	0		782	0
MoonshotAI: Kimi K2.5	10.00	10.00	100.0%	0		242	812

Comparação rápida

Trocar par de comparação

Kimi K2.5mediumvsQwen3.5 Plus 2026-02-15none Claude Sonnet 4.6nonevsKimi K2.5medium Kimi K2.5mediumvsGLM 5none Gemini 3.1 Flash Lite PreviewnonevsGPT-5.3-Codexmedium Claude Sonnet 4.6mediumvsGemini 3.1 Flash Lite Previewnone Gemini 3.1 Flash Lite PreviewnonevsGLM 5medium Gemini 3.1 Flash Lite PreviewnonevsStep 3.5 FlashmediumDisponível grátis DeepSeek V3.2mediumvsGemini 3.1 Flash Lite Previewnone Gemini 3.1 Flash Lite PreviewnonevsGPT-5.2medium Gemini 3.1 Flash Lite PreviewnonevsQwen3.5-27Bmedium Gemini 3 Flash PreviewnonevsKimi K2.5medium Gemini 3.1 Flash Lite PreviewnonevsQwen3.5-122B-A10Bmedium