Navegação
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

AI BENCHY Compare

Anthropic: Claude Opus 4.7 vs Google: Gemini 3.5 Flash

Benchmarks gerados a partir das suítes de teste do AI BENCHY em: 2026-05-19

Métrica Claude Opus 4.7 Claude Opus 4.7 medium Lançamento: 2026-04-16 Gemini 3.5 Flash Gemini 3.5 Flash low Lançamento: 2026-05-19
Pontuação 8.9 9.6
Posição #7 #2
Confiabilidade 10.0 10.0
Consistência 10.0 10.0
Testes corretos
Taxa de acerto por tentativa 84.2% 94.7%
Testes instáveis 0 0
Execuções totais 57 57
Custo por resultado 2.802 1.359
Custo total $0.449 $0.245
Preço de entrada $5.000 / 1M $1.500 / 1M
Preço de saída $25.000 / 1M $9.000 / 1M
Tokens de saída 5,399 2,003
Tokens de raciocínio 1,341 20,245
Tempo de resposta (médio) 3.46s 2.84s
Tempo de resposta (máx.) 21.45s 6.44s
Tempo de resposta (total) 62.29s 54.00s

Melhores modelos por pontuação

Pontuação vs custo total

Tempo de resposta (médio)

Pontuação vs Tempo de resposta (médio)

Total de tokens de saída

Pontuação vs Total de tokens de saída

Detalhamento por categoria

Truques anti-IA Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de saída Tokens de raciocínio
Claude Opus 4.7 8.3 10.0 75.0% 0 1.85s 348 0
Gemini 3.5 Flash 10.0 10.0 100.0% 0 2.52s 209 2,536
Programação Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de saída Tokens de raciocínio
Claude Opus 4.7 10.0 10.0 100.0% 0 6.41s 1,141 257
Gemini 3.5 Flash 10.0 10.0 100.0% 0 5.49s 428 3,146
Combinado Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de saída Tokens de raciocínio
Claude Opus 4.7 10.0 10.0 100.0% 0 21.45s 2,369 1,084
Gemini 3.5 Flash 10.0 10.0 100.0% 0 6.44s 351 3,050
Análise e extração de dados Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de saída Tokens de raciocínio
Claude Opus 4.7 10.0 10.0 100.0% 0 2.37s 324 0
Gemini 3.5 Flash 10.0 10.0 100.0% 0 1.81s 279 1,164
Específico do domínio Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de saída Tokens de raciocínio
Claude Opus 4.7 7.7 10.0 66.7% 0 1.17s 51 0
Gemini 3.5 Flash 7.7 10.0 66.7% 0 3.39s 12 4,538
Inteligência geral Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de saída Tokens de raciocínio
Claude Opus 4.7 10.0 10.0 100.0% 0 2.87s 256 0
Gemini 3.5 Flash 10.0 10.0 100.0% 0 2.27s 119 916
Seguimento de instruções Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de saída Tokens de raciocínio
Claude Opus 4.7 10.0 10.0 100.0% 0 1.57s 114 0
Gemini 3.5 Flash 9.9 10.0 100.0% 0 1.86s 71 1,652
Resolução de quebra-cabeças Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de saída Tokens de raciocínio
Claude Opus 4.7 10.0 10.0 100.0% 0 2.51s 399 0
Gemini 3.5 Flash 10.0 10.0 100.0% 0 2.35s 288 2,150
Chamada de ferramentas Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de saída Tokens de raciocínio
Claude Opus 4.7 10.0 10.0 100.0% 0 4.17s 373 0
Gemini 3.5 Flash 10.0 10.0 100.0% 0 3.27s 234 403
Conhecimentos gerais Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de saída Tokens de raciocínio
Claude Opus 4.7 3.0 10.0 0.0% 0 2.25s 24 0
Gemini 3.5 Flash 10.0 10.0 100.0% 0 1.88s 12 690

Comparação rápida

Trocar par de comparação