Navegação
AI BENCHY
Advertise here

AI BENCHY Compare

ByteDance Seed: Seed-2.0-Mini vs Google: Gemini 2.5 Flash

Benchmarks gerados a partir das suítes de teste do AI BENCHY em: 2026-06-01

Métrica Seed-2.0-Mini Seed-2.0-Mini medium Lançamento: 2026-02-14 Gemini 2.5 Flash Gemini 2.5 Flash none Lançamento: 2025-06-17
Pontuação 7.1 6.4
Posição #77 #95
Confiabilidade 10.0 10.0
Consistência 9.2 9.6
Testes corretos
Taxa de acerto por tentativa 60.0% 48.3%
Testes instáveis 2 1
Execuções totais 60 60
Custo por resultado 0.397 0.159
Custo total $0.044 $0.015
Preço de entrada $0.100 / 1M $0.300 / 1M
Preço de saída $0.400 / 1M $2.500 / 1M
Tokens de saída 2,555 1,764
Tokens de raciocínio 95,974 0
Tempo de resposta (médio) 80.22s 889ms
Tempo de resposta (máx.) 262.83s 4.39s
Tempo de resposta (total) 1363.72s 17.79s

Melhores modelos por pontuação

Pontuação vs custo total

Tempo de resposta (médio)

Pontuação vs Tempo de resposta (médio)

Total de tokens de saída

Pontuação vs Total de tokens de saída

Detalhamento por categoria

Truques anti-IA Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de saída Tokens de raciocínio
Seed-2.0-Mini 6.6 10.0 50.0% 0 74.75s 360 9,520
Gemini 2.5 Flash 3.0 10.0 0.0% 0 582ms 102 0
Programação Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de saída Tokens de raciocínio
Seed-2.0-Mini 6.8 9.8 50.0% 0 220.48s 464 34,964
Gemini 2.5 Flash 6.8 10.0 50.0% 0 810ms 477 0
Combinado Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de saída Tokens de raciocínio
Seed-2.0-Mini 10.0 10.0 100.0% 0 262.83s 404 29,806
Gemini 2.5 Flash 3.0 10.0 0.0% 0 4.39s 366 0
Análise e extração de dados Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de saída Tokens de raciocínio
Seed-2.0-Mini 10.0 10.0 100.0% 0 24.27s 246 2,743
Gemini 2.5 Flash 10.0 10.0 100.0% 0 652ms 279 0
Específico do domínio Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de saída Tokens de raciocínio
Seed-2.0-Mini 3.0 10.0 0.0% 0 0ms 0 0
Gemini 2.5 Flash 5.9 7.2 55.6% 1 495ms 12 0
Inteligência geral Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de saída Tokens de raciocínio
Seed-2.0-Mini 5.1 3.4 33.3% 1 36.65s 213 4,210
Gemini 2.5 Flash 5.0 10.0 0.0% 0 615ms 78 0
Seguimento de instruções Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de saída Tokens de raciocínio
Seed-2.0-Mini 10.0 10.0 100.0% 0 17.47s 69 2,050
Gemini 2.5 Flash 10.0 10.0 100.0% 0 590ms 72 0
Resolução de quebra-cabeças Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de saída Tokens de raciocínio
Seed-2.0-Mini 8.2 7.2 88.9% 1 31.79s 527 5,667
Gemini 2.5 Flash 7.7 10.0 66.7% 0 604ms 132 0
Chamada de ferramentas Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de saída Tokens de raciocínio
Seed-2.0-Mini 10.0 10.0 100.0% 0 88.68s 222 5,235
Gemini 2.5 Flash 10.0 10.0 100.0% 0 1.91s 234 0
Conhecimentos gerais Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de saída Tokens de raciocínio
Seed-2.0-Mini 3.0 10.0 0.0% 0 56.76s 50 1,779
Gemini 2.5 Flash 3.0 10.0 0.0% 0 1.15s 12 0

Comparação rápida

Trocar par de comparação