Navegação
Advertise here

Claude Opus 4.8 vs Gemini 3.1 Flash Lite Preview (medium)

Gemini 3.1 Flash Lite Preview (medium) lidera na pontuação média com 7.0 vs 6.9. Gemini 3.1 Flash Lite Preview (medium) tem menor custo de benchmark com $0.158 vs $2.334. Gemini 3.1 Flash Lite Preview (medium) é mais rápido com 6.78s vs 7.54s, com taxas de acerto de 60.9% vs 60.9%.

Benchmarks gerados a partir das suítes de teste do AI BENCHY em: 2026-10-01

Modelos comparados

Posição
#167
Total de tokens de saída
24,343
Tempo de resposta (médio)
7.54s
Custo total
$2.334
Posição
#155
Total de tokens de saída
59,534
Tempo de resposta (médio)
6.78s
Custo total
$0.158
Modelo recomendado Gemini 3.1 Flash Lite Preview (medium)

Tem a melhor pontuação aqui (7.0) e custa cerca de 14.8x menos que Claude Opus 4.8.

Comparação detalhada

Métrica Claude Opus 4.8 Claude Opus 4.8 none Lançamento: 2026-05-28 Gemini 3.1 Flash Lite Preview Gemini 3.1 Flash Lite Preview medium Lançamento: 2026-03-03
Pontuação 6.9 7.0
Posição #167 #155
Confiabilidade 10.0 10.0
Consistência 9.3 9.9
Tentativas 69/69 69/69
Testes corretos
Taxa de acerto por tentativa 60.9% 60.9%
Testes instáveis 2 0
Execuções totais 69 69
Custo por resultado 17.953 1.124
Custo total $2.334 $0.158
Preço de entrada $5.000 / 1M $0.250 / 1M
Preço de saída $25.000 / 1M $1.500 / 1M
Total de tokens de entrada 345,059 272,221
Tokens de saída 24,343 12,345
Tokens de raciocínio 0 47,189
Tempo de resposta (médio) 7.54s 6.78s
Tempo de resposta (máx.) 65.07s 54.91s
Tempo de resposta (total) 173.31s 155.96s
Parâmetros ~5T no total (~500B ativos) ~150B no total (~10B ativos)
Disponibilidade Código fechado Código fechado

Geração showcase de modelos

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#167 Claude Opus 4.8

none
Custo
$0.053
Tempo
22.0s
Tokens
2,253 tok

#155 Gemini 3.1 Flash Lite Preview

medium
Custo
$0.003
Tempo
5.2s
Tokens
1,944 tok

Melhores modelos por pontuação

Pontuação vs custo total

Tempo de resposta (médio)

Pontuação vs Tempo de resposta (médio)

Total de tokens de saída

Pontuação vs Total de tokens de saída

Detalhamento por categoria

Programação Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de entrada Tokens de saída Tokens de raciocínio
Claude Opus 4.8 5.5 10.0 33.3% 0 3.29s 10,590 1,332 0
Gemini 3.1 Flash Lite Preview 5.5 10.0 33.3% 0 4.09s 8,126 461 8,597

Comparação rápida

Trocar par de comparação