Navegação
AI BENCHY
Advertise here

AI BENCHY Compare

Trinity Large Preview vs Owl Alpha

Benchmarks gerados a partir das suítes de teste do AI BENCHY em: 2026-06-03

Métrica Trinity Large Preview Trinity Large Preview none Lançamento: 2026-01-27 Owl Alpha Owl Alpha medium Lançamento: 2026-04-30
Pontuação 4.7 5.8
Posição #148 #107
Confiabilidade 10.0 10.0
Consistência 9.3 9.6
Testes corretos
Taxa de acerto por tentativa 23.3% 41.7%
Testes instáveis 2 1
Execuções totais 60 60
Custo por resultado 0.017 0.000
Custo total $0.008 $0.000
Preço de entrada $0.243 / 1M $0.000 / 1M
Preço de saída $0.243 / 1M $0.000 / 1M
Total de tokens de entrada 29,828 40,601
Tokens de saída 2,169 2,965
Tokens de raciocínio 0 0
Tempo de resposta (médio) 2.98s 11.64s
Tempo de resposta (máx.) 14.34s 58.63s
Tempo de resposta (total) 56.57s 232.83s

Melhores modelos por pontuação

Pontuação vs custo total

Tempo de resposta (médio)

Pontuação vs Tempo de resposta (médio)

Total de tokens de saída

Pontuação vs Total de tokens de saída

Detalhamento por categoria

Truques anti-IA Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de entrada Tokens de saída Tokens de raciocínio
Trinity Large Preview 3.1 10.0 0.0% 0 2.07s 651 550 0
Owl Alpha 4.8 10.0 25.0% 0 3.97s 1,596 87 0
Programação Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de entrada Tokens de saída Tokens de raciocínio
Trinity Large Preview 4.0 6.6 16.7% 1 14.34s 738 397 0
Owl Alpha 6.6 10.0 50.0% 0 19.08s 3,872 1,754 0
Combinado Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de entrada Tokens de saída Tokens de raciocínio
Trinity Large Preview 3.0 10.0 0.0% 0 8.91s 12,053 294 0
Owl Alpha 3.0 10.0 0.0% 0 10.01s 14,259 315 0
Análise e extração de dados Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de entrada Tokens de saída Tokens de raciocínio
Trinity Large Preview 10.0 10.0 100.0% 0 3.26s 6,900 186 0
Owl Alpha 10.0 10.0 100.0% 0 21.64s 8,157 246 0
Específico do domínio Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de entrada Tokens de saída Tokens de raciocínio
Trinity Large Preview 5.3 10.0 33.3% 0 877ms 738 25 0
Owl Alpha 5.3 10.0 33.3% 0 8.58s 1,458 28 0
Inteligência geral Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de entrada Tokens de saída Tokens de raciocínio
Trinity Large Preview 4.5 10.0 0.0% 0 873ms 498 104 0
Owl Alpha 4.3 10.0 0.0% 0 58.63s 732 98 0
Seguimento de instruções Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de entrada Tokens de saída Tokens de raciocínio
Trinity Large Preview 3.5 10.0 0.0% 0 822ms 678 63 0
Owl Alpha 6.5 10.0 50.0% 0 10.15s 1,161 57 0
Resolução de quebra-cabeças Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de entrada Tokens de saída Tokens de raciocínio
Trinity Large Preview 3.6 7.7 11.1% 1 1.97s 669 265 0
Owl Alpha 5.3 7.2 44.4% 1 3.40s 1,392 135 0
Chamada de ferramentas Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de entrada Tokens de saída Tokens de raciocínio
Trinity Large Preview 10.0 10.0 100.0% 0 6.67s 6,699 267 0
Owl Alpha 10.0 10.0 100.0% 0 8.26s 7,524 228 0
Conhecimentos gerais Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de entrada Tokens de saída Tokens de raciocínio
Trinity Large Preview 3.0 10.0 0.0% 0 777ms 204 18 0
Owl Alpha 3.0 10.0 0.0% 0 2.38s 450 17 0

Comparação rápida

Trocar par de comparação