Navegação
AI BENCHY
Advertise here

AI BENCHY Compare

Anthropic: Claude Opus 4.8 vs MoonshotAI: Kimi K2.6

Resumo

Comparação benchmark Claude Opus 4.8 vs Kimi K2.6: A pontuação média está praticamente empatada em 7.7 vs 7.8. Kimi K2.6 tem menor custo de benchmark com $0.831 vs $1.270. Claude Opus 4.8 é mais rápido com 10.83s vs 71.67s, com taxas de acerto de 79.4% vs 65.1%.

Modelo recomendado: Claude Opus 4.8 - Tem a melhor pontuação aqui (7.7) e responde cerca de 6.6x mais rápido que Kimi K2.6.

Benchmarks gerados a partir das suítes de teste do AI BENCHY em: 2026-06-30

Métrica Claude Opus 4.8 Claude Opus 4.8 low Lançamento: 2026-05-28 Kimi K2.6 Kimi K2.6 medium Lançamento: 2026-04-20 Disponível grátis
Pontuação 7.7 7.8
Posição #38 #36
Confiabilidade 10.0 10.0
Consistência 8.8 8.6
Testes corretos
Taxa de acerto por tentativa 79.4% 65.1%
Testes instáveis 3 3
Execuções totais 63 63
Custo por resultado 8.466 8.358
Custo total $1.270 $0.831
Preço de entrada $5.000 / 1M $0.550 / 1M
Preço de saída $25.000 / 1M $3.200 / 1M
Total de tokens de entrada 60,946 29,450
Tokens de saída 31,771 102,923
Tokens de raciocínio 6,831 254,094
Tempo de resposta (médio) 10.83s 71.67s
Tempo de resposta (máx.) 127.97s 406.78s
Tempo de resposta (total) 227.39s 1433.36s

Geração showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#38 Claude Opus 4.8

low
Custo
$0.031
Tempo
14.1s
Tokens
1,345 tok

#36 MoonshotAI: Kimi K2.6

medium
Custo
$0.013
Tempo
103.4s
Tokens
3,620 tok

Melhores modelos por pontuação

Pontuação vs custo total

Tempo de resposta (médio)

Pontuação vs Tempo de resposta (médio)

Total de tokens de saída

Pontuação vs Total de tokens de saída

Detalhamento por categoria

Truques anti-IA Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de entrada Tokens de saída Tokens de raciocínio
Claude Opus 4.8 10.0 10.0 100.0% 0 3.30s 834 793 371
Kimi K2.6 7.0 8.0 66.7% 1 11.59s 618 7,115 8,934
Programação Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de entrada Tokens de saída Tokens de raciocínio
Claude Opus 4.8 6.6 4.6 77.8% 2 7.58s 10,590 3,637 809
Kimi K2.6 5.7 8.6 33.3% 0 214.42s 2,925 9,970 77,189
Combinado Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de entrada Tokens de saída Tokens de raciocínio
Claude Opus 4.8 9.8 10.0 100.0% 0 20.84s 23,500 2,216 1,081
Kimi K2.6 10.0 10.0 100.0% 0 40.96s 11,271 711 13,876
Análise e extração de dados Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de entrada Tokens de saída Tokens de raciocínio
Claude Opus 4.8 6.3 5.8 66.7% 1 2.27s 10,503 310 0
Kimi K2.6 10.0 10.0 100.0% 0 20.38s 7,014 316 11,305
Específico do domínio Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de entrada Tokens de saída Tokens de raciocínio
Claude Opus 4.8 5.3 10.0 33.3% 0 45.53s 975 23,311 3,908
Kimi K2.6 5.3 7.2 44.4% 1 202.38s 326 47,035 98,262
Inteligência geral Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de entrada Tokens de saída Tokens de raciocínio
Claude Opus 4.8 10.0 10.0 100.0% 0 2.55s 708 231 0
Kimi K2.6 10.0 10.0 100.0% 0 17.83s 477 3,981 4,472
Seguimento de instruções Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de entrada Tokens de saída Tokens de raciocínio
Claude Opus 4.8 9.8 10.0 100.0% 0 2.78s 909 111 221
Kimi K2.6 10.0 10.0 100.0% 0 12.53s 669 3,977 5,269
Resolução de quebra-cabeças Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de entrada Tokens de saída Tokens de raciocínio
Claude Opus 4.8 10.0 10.0 100.0% 0 3.01s 894 592 184
Kimi K2.6 6.0 7.4 55.6% 1 25.06s 651 13,860 17,599
Chamada de ferramentas Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de entrada Tokens de saída Tokens de raciocínio
Claude Opus 4.8 10.0 10.0 100.0% 0 6.85s 11,775 370 35
Kimi K2.6 10.0 10.0 100.0% 0 8.92s 5,286 248 1,011
Conhecimentos gerais Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de entrada Tokens de saída Tokens de raciocínio
Claude Opus 4.8 3.0 10.0 0.0% 0 5.48s 258 200 222
Kimi K2.6 3.0 10.0 0.0% 0 130.27s 213 15,710 16,177

Comparação rápida

Trocar par de comparação