Navegação
AI BENCHY
Advertise here

Modelos comparados

Comparação benchmark MiniMax M2.7 (medium) vs Kimi K2.5 (medium) vs GLM 5 (medium) vs Gemini 3.1 Flash Lite Preview (medium): GLM 5 (medium) lidera em Pontuação com 7.7. MiniMax M2.7 (medium) lidera em Confiabilidade com 10.0. Gemini 3.1 Flash Lite Preview (medium) tem o menor Custo total em $0.115. Gemini 3.1 Flash Lite Preview (medium) é o mais rápido com 4.61s.

Benchmarks gerados a partir das suítes de teste do AI BENCHY em: 2026-08-07

Posição
#205
Total de tokens de saída
137,594
Tempo de resposta (médio)
41.28s
Custo total
$0.176
Posição
#97
Total de tokens de saída
227,367
Tempo de resposta (médio)
99.00s
Custo total
$0.600
Posição
#59
Total de tokens de saída
124,566
Tempo de resposta (médio)
33.54s
Custo total
$0.307
Posição
#82
Total de tokens de saída
56,983
Tempo de resposta (médio)
4.61s
Custo total
$0.115
Modelo recomendado Gemini 3.1 Flash Lite Preview (medium)

A pontuação fica perto da melhor aqui (7.3 vs 7.7) e custa cerca de 3.1x menos que os outros modelos nesta comparação.

Comparação detalhada

Métrica MiniMax M2.7 MiniMax M2.7 medium Lançamento: 2026-03-18 Kimi K2.5 Kimi K2.5 medium Lançamento: 2026-01-27 GLM 5 GLM 5 medium Lançamento: 2026-02-12 Gemini 3.1 Flash Lite Preview Gemini 3.1 Flash Lite Preview medium Lançamento: 2026-03-03
Pontuação 5.0 7.0 7.7 7.3
Posição #205 #97 #59 #82
Confiabilidade 10.0 10.0 10.0 10.0
Consistência 6.6 7.0 8.1 9.9
Cobertura do benchmark 22/22 testes · 66/66 tentativas 22/22 testes · 66/66 tentativas 21/22 testes · 63/66 tentativas 22/22 testes · 66/66 tentativas
Testes corretos
Taxa de acerto por tentativa 45.5% 65.2% 78.8% 59.1%
Testes instáveis 9 8 4 0
Execuções totais 66 66 63 66
Custo por resultado 3.906 4.789 1.668 0.884
Custo total $0.176 $0.600 $0.307 $0.115
Preço de entrada $0.270 / 1M $0.571 / 1M $0.950 / 1M $0.250 / 1M
Preço de saída $1.080 / 1M $2.850 / 1M $2.551 / 1M $1.500 / 1M
Total de tokens de entrada 114,518 118,448 35,224 117,480
Tokens de saída 18,558 62,124 21,570 10,589
Tokens de raciocínio 119,036 165,243 102,996 46,394
Tempo de resposta (médio) 41.28s 99.00s 33.54s 4.61s
Tempo de resposta (máx.) 196.21s 281.00s 99.85s 18.34s
Tempo de resposta (total) 866.81s 1485.04s 435.99s 101.39s

Geração showcase de modelos

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#205 MiniMax M2.7

medium
Custo
$0.022
Tempo
22.8s
Tokens
9,250 tok

#97 MoonshotAI: Kimi K2.5

medium
Custo
$0.030
Tempo
58.6s
Tokens
8,683 tok

#59 GLM 5

medium
Custo
$0.005
Tempo
20.7s
Tokens
2,068 tok

#82 Gemini 3.1 Flash Lite Preview

medium
Custo
$0.003
Tempo
5.2s
Tokens
1,944 tok

Melhores modelos por pontuação

Pontuação vs custo total

Tempo de resposta (médio)

Pontuação vs Tempo de resposta (médio)

Total de tokens de saída

Pontuação vs Total de tokens de saída

Detalhamento por categoria

Programação Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de entrada Tokens de saída Tokens de raciocínio
MiniMax M2.7 5.7 9.1 33.3% 0 101.89s 2,961 1,231 38,841
Kimi K2.5 6.1 4.6 66.7% 2 217.49s 6,935 5,705 74,693
GLM 5 10.0 10.0 100.0% 0 74.30s 7,254 2,997 52,930
Gemini 3.1 Flash Lite Preview 5.5 10.0 33.3% 0 4.09s 8,126 461 8,597

Comparação rápida

Trocar par de comparação