Navegação
AI BENCHY
Advertise here

AI BENCHY Compare

Anthropic: Claude Sonnet 4.6 vs Google: Gemini 3.1 Flash Lite

Resumo

Comparação benchmark Claude Sonnet 4.6 vs Gemini 3.1 Flash Lite: Claude Sonnet 4.6 lidera na pontuação média com 7.8 vs 6.4. Gemini 3.1 Flash Lite tem menor custo de benchmark com $0.028 vs $1.418. Gemini 3.1 Flash Lite é mais rápido com 1.89s vs 17.06s, com taxas de acerto de 65.1% vs 61.9%.

Modelo recomendado: Gemini 3.1 Flash Lite - Oferece o melhor compromisso geral: pontuação competitiva (6.4), custo menor que Claude Sonnet 4.6 e tempo de resposta equilibrado.

Benchmarks gerados a partir das suítes de teste do AI BENCHY em: 2026-06-18

Métrica Claude Sonnet 4.6 Claude Sonnet 4.6 medium Lançamento: 2026-02-17 Gemini 3.1 Flash Lite Gemini 3.1 Flash Lite low Lançamento: 2026-05-08
Pontuação 7.8 6.4
Posição #31 #85
Confiabilidade 10.0 10.0
Consistência 9.1 9.3
Testes corretos
Taxa de acerto por tentativa 65.1% 61.9%
Testes instáveis 2 2
Execuções totais 63 63
Custo por resultado 10.904 0.227
Custo total $1.418 $0.028
Preço de entrada $3.000 / 1M $0.250 / 1M
Preço de saída $15.000 / 1M $1.500 / 1M
Total de tokens de entrada 49,112 36,892
Tokens de saída 54,703 2,732
Tokens de raciocínio 29,970 9,260
Tempo de resposta (médio) 17.06s 1.89s
Tempo de resposta (máx.) 46.35s 5.66s
Tempo de resposta (total) 221.83s 39.62s

Geração showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#31 Claude Sonnet 4.6

medium
SVG inválido
Custo
$0.000
Tempo
300.0s
Tokens
0 tok

#85 Gemini 3.1 Flash Lite

low
Custo
$0.003
Tempo
4.0s
Tokens
1,479 tok

Melhores modelos por pontuação

Pontuação vs custo total

Tempo de resposta (médio)

Pontuação vs Tempo de resposta (médio)

Total de tokens de saída

Pontuação vs Total de tokens de saída

Detalhamento por categoria

Truques anti-IA Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de entrada Tokens de saída Tokens de raciocínio
Claude Sonnet 4.6 6.5 10.0 50.0% 0 2.98s 789 1,046 1,093
Gemini 3.1 Flash Lite 7.3 6.2 75.0% 2 1.84s 500 1,013 1,548
Programação Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de entrada Tokens de saída Tokens de raciocínio
Claude Sonnet 4.6 5.7 6.6 44.4% 1 33.29s 6,995 16,089 3,686
Gemini 3.1 Flash Lite 5.5 10.0 33.3% 0 1.53s 8,132 471 1,072
Combinado Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de entrada Tokens de saída Tokens de raciocínio
Claude Sonnet 4.6 10.0 10.0 100.0% 0 46.35s 18,351 5,871 3,962
Gemini 3.1 Flash Lite 3.0 10.0 0.0% 0 4.48s 12,870 348 975
Análise e extração de dados Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de entrada Tokens de saída Tokens de raciocínio
Claude Sonnet 4.6 10.0 10.0 100.0% 0 13.90s 8,676 649 742
Gemini 3.1 Flash Lite 10.0 10.0 100.0% 0 1.44s 7,453 291 697
Específico do domínio Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de entrada Tokens de saída Tokens de raciocínio
Claude Sonnet 4.6 2.9 7.2 11.1% 1 0ms 471 25,790 16,919
Gemini 3.1 Flash Lite 5.3 10.0 33.3% 0 1.52s 639 15 1,214
Inteligência geral Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de entrada Tokens de saída Tokens de raciocínio
Claude Sonnet 4.6 10.0 10.0 100.0% 0 4.94s 564 256 433
Gemini 3.1 Flash Lite 4.0 10.0 0.0% 0 1.37s 492 69 438
Seguimento de instruções Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de entrada Tokens de saída Tokens de raciocínio
Claude Sonnet 4.6 10.0 10.0 100.0% 0 2.61s 792 318 552
Gemini 3.1 Flash Lite 10.0 10.0 100.0% 0 1.52s 619 72 760
Resolução de quebra-cabeças Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de entrada Tokens de saída Tokens de raciocínio
Claude Sonnet 4.6 10.0 10.0 100.0% 0 5.31s 816 592 646
Gemini 3.1 Flash Lite 10.0 10.0 100.0% 0 1.40s 570 210 1,191
Chamada de ferramentas Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de entrada Tokens de saída Tokens de raciocínio
Claude Sonnet 4.6 10.0 10.0 100.0% 0 7.48s 11,454 655 351
Gemini 3.1 Flash Lite 10.0 10.0 100.0% 0 5.66s 5,457 234 945
Conhecimentos gerais Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de entrada Tokens de saída Tokens de raciocínio
Claude Sonnet 4.6 3.0 10.0 0.0% 0 30.09s 204 3,437 1,586
Gemini 3.1 Flash Lite 3.0 10.0 0.0% 0 1.46s 160 9 420

Comparação rápida

Trocar par de comparação