Navegação
Advertise here

Modelos comparados

Comparação benchmark Kimi K2.6 (medium) vs Kimi K2.5 (medium) vs GLM 5 (medium) vs Claude Opus 4.7 (medium): Claude Opus 4.7 (medium) lidera em Pontuação com 8.7. Kimi K2.6 (medium) lidera em Confiabilidade com 10.0. GLM 5 (medium) tem o menor Custo total em $0.228. Claude Opus 4.7 (medium) é o mais rápido com 7.62s.

Benchmarks gerados a partir das suítes de teste do AI BENCHY em: 2026-09-10

Modelos comparados

Posição
#128
Total de tokens de saída
347,519
Tempo de resposta (médio)
115.89s
Custo total
$1.247
Posição
#147
Total de tokens de saída
220,942
Tempo de resposta (médio)
98.19s
Custo total
$0.479
Posição
#92
Total de tokens de saída
124,566
Tempo de resposta (médio)
33.54s
Custo total
$0.228
Posição
#43
Total de tokens de saída
29,990
Tempo de resposta (médio)
7.62s
Custo total
$1.476
Modelo recomendado Claude Opus 4.7 (medium)

Tem a melhor pontuação aqui (8.7) e responde cerca de 10.8x mais rápido que os outros modelos nesta comparação.

Comparação detalhada

Métrica Kimi K2.6 Kimi K2.6 medium Lançamento: 2026-04-20 Kimi K2.5 Kimi K2.5 medium Lançamento: 2026-01-27 GLM 5 GLM 5 medium Lançamento: 2026-02-12 Claude Opus 4.7 Claude Opus 4.7 medium Lançamento: 2026-04-16
Pontuação 7.2 7.0 7.7 8.7
Posição #128 #147 #92 #43
Confiabilidade 10.0 10.0 10.0 10.0
Consistência 8.3 7.0 8.1 9.6
Tentativas 66/66 66/66 63/66 66/66
Testes corretos
Taxa de acerto por tentativa 63.6% 63.6% 78.8% 83.3%
Testes instáveis 4 8 4 1
Execuções totais 66 66 63 66
Custo por resultado 10.029 4.849 1.668 8.200
Custo total $1.247 $0.479 $0.228 $1.476
Preço de entrada $0.950 / 1M $0.450 / 1M $0.600 / 1M $5.000 / 1M
Preço de saída $4.000 / 1M $2.250 / 1M $1.920 / 1M $25.000 / 1M
Total de tokens de entrada 68,913 118,496 35,224 145,249
Tokens de saída 64,654 53,522 21,570 24,948
Tokens de raciocínio 282,865 167,420 102,996 5,042
Tempo de resposta (médio) 115.89s 98.19s 33.54s 7.62s
Tempo de resposta (máx.) 876.20s 281.00s 99.85s 65.40s
Tempo de resposta (total) 2433.66s 1571.05s 435.99s 159.94s
Parâmetros 1T no total (32B ativos) 1T no total (32B ativos) 744B no total (40B ativos) ~5T no total (~500B ativos)
Disponibilidade Pesos disponíveis Pesos disponíveis Código aberto Código fechado

Geração showcase de modelos

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#128 MoonshotAI: Kimi K2.6

medium
Custo
$0.013
Tempo
103.4s
Tokens
3,620 tok

#147 MoonshotAI: Kimi K2.5

medium
Custo
$0.030
Tempo
58.6s
Tokens
8,683 tok

#92 GLM 5

medium
Custo
$0.005
Tempo
20.7s
Tokens
2,068 tok

#43 Claude Opus 4.7

medium
Custo
$0.059
Tempo
26.8s
Tokens
2,475 tok

Melhores modelos por pontuação

Pontuação vs custo total

Tempo de resposta (médio)

Pontuação vs Tempo de resposta (médio)

Total de tokens de saída

Pontuação vs Total de tokens de saída

Detalhamento por categoria

Programação Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de entrada Tokens de saída Tokens de raciocínio
Kimi K2.6 5.7 8.6 33.3% 0 214.42s 2,925 9,970 77,189
Kimi K2.5 6.1 4.6 66.7% 2 217.49s 6,935 5,705 74,693
GLM 5 10.0 10.0 100.0% 0 74.30s 7,254 2,997 52,930
Claude Opus 4.7 7.6 7.2 77.8% 1 12.96s 10,635 7,629 1,114

Comparação rápida

Trocar par de comparação