Navegação
AI BENCHY
Advertise here

Modelos comparados

Comparação benchmark Claude Opus 5 (high) vs GPT-5.6 Sol (high) vs Kimi K3 (max) vs Gemini 3.6 Flash (medium)Gemini 3.6 Flash (medium) lidera em Pontuação com 9.9. Claude Opus 5 (high) lidera em Confiabilidade com 10.0. Gemini 3.6 Flash (medium) tem o menor Custo total em $0.831. Gemini 3.6 Flash (medium) é o mais rápido com 10.11s.

Modelo recomendadoGemini 3.6 Flash (medium)Tem a melhor pontuação aqui (9.9) e custa cerca de 2.9x menos que os outros modelos nesta comparação.

Benchmarks gerados a partir das suítes de teste do AI BENCHY em: 2026-07-25

Métrica Claude Opus 5 Claude Opus 5 high Lançamento: 2026-07-25 GPT-5.6 Sol GPT-5.6 Sol high Lançamento: 2026-07-09 Kimi K3 Kimi K3 max Lançamento: 2026-07-16 Gemini 3.6 Flash Gemini 3.6 Flash medium Lançamento: 2026-07-21
Pontuação 9.2 9.4 8.0 9.9
Posição #11 #8 #40 #1
Confiabilidade 10.0 10.0 9.1 10.0
Consistência 9.6 8.9 9.5 9.6
Testes corretos
Taxa de acerto por tentativa 84.9% 89.4% 75.8% 98.5%
Testes instáveis 1 3 1 1
Execuções totais 66 66 66 66
Custo por resultado 15.747 6.852 19.446 3.955
Custo total $2.835 $1.234 $3.112 $0.831
Preço de entrada $5.000 / 1M $5.000 / 1M $3.000 / 1M $1.500 / 1M
Preço de saída $25.000 / 1M $30.000 / 1M $15.000 / 1M $7.500 / 1M
Total de tokens de entrada 135,959 79,249 34,916 66,293
Tokens de saída 67,066 4,855 2,910 2,000
Tokens de raciocínio 19,114 23,044 197,529 95,464
Tempo de resposta (médio) 20.44s 11.73s 122.48s 10.11s
Tempo de resposta (máx.) 159.01s 54.79s 766.58s 68.03s
Tempo de resposta (total) 449.68s 257.99s 2327.06s 222.33s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#11 Claude Opus 5

high
Custo
$0.265
Tempo
144.5s
Tokens
10,741 tok

#8 GPT-5.6 Sol

high
Custo
$0.151
Tempo
201.9s
Tokens
5,100 tok

#40 MoonshotAI: Kimi K3

max
Custo
$0.281
Tempo
506.9s
Tokens
18,863 tok

#1 Gemini 3.6 Flash

medium
Custo
$0.079
Tempo
47.9s
Tokens
10,532 tok

Melhores modelos por pontuação

Pontuação vs custo total

Tempo de resposta (médio)

Pontuação vs Tempo de resposta (médio)

Total de tokens de saída

Pontuação vs Total de tokens de saída

Detalhamento por categoria

Programação Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de entrada Tokens de saída Tokens de raciocínio
Claude Opus 5 10.0 10.0 100.0% 0 12.73s 10,590 7,547 1,721
GPT-5.6 Sol 10.0 10.0 100.0% 0 12.52s 7,302 404 5,656
Kimi K3 10.0 10.0 100.0% 0 325.79s 8,061 460 84,012
Gemini 3.6 Flash 10.0 10.0 100.0% 0 17.49s 8,136 474 40,157

Comparação rápida

Trocar par de comparação