Jev 1.13 lidera na pontuação média com 3.2 vs 3.0. Command A+ tem menor custo de benchmark com $0.000 vs $0.003. Jev 1.13 é mais rápido com 698ms vs 81.36s, com taxas de acerto de 0.0% vs 27.3%.
Benchmarks gerados a partir das suítes de teste do AI BENCHY em:
2026-09-23
Modelos comparados
Posição
#356
Total de tokens de saída
0
Tempo de resposta (médio)
81.36s
Custo total
$0.000
Posição
#352
Total de tokens de saída
18,927
Tempo de resposta (médio)
698ms
Custo total
$0.003
Modelo recomendadoJev 1.13
Tem a melhor pontuação aqui (3.2) e responde cerca de 116.5x mais rápido que Command A+.
Jev 1.13Jev 1.13none36/66 tentativas. Os adaptadores fornecem as opções. Suporta 12/22 testes. Os demais não são compatíveis, não são falhas. A pontuação usa a bateria completa.Lançamento: 2026-09-18
Jev 1.13Jev 1.13none36/66 tentativas. Os adaptadores fornecem as opções. Suporta 12/22 testes. Os demais não são compatíveis, não são falhas. A pontuação usa a bateria completa.Lançamento: 2026-09-18
Pontuação
3.0Pontuação média em todos os testes de benchmark.…
3.2Pontuação média em todos os testes de benchmark.…
Posição
#356
#352
Confiabilidade
0.0Pontuação de sucesso na primeira tentativa: 10.0 significa nenhum erro reexecutável da API alvo ou de limite de taxa antes de chamadas bem-sucedidas; falhas registradas reduzem a pontuação.…
10.0Pontuação de sucesso na primeira tentativa: 10.0 significa nenhum erro reexecutável da API alvo ou de limite de taxa antes de chamadas bem-sucedidas; falhas registradas reduzem a pontuação.…
Consistência
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
5.5A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
Tentativas
66/66
36/66
Testes corretos
Um teste é totalmente aprovado apenas quando todas as execuções passam.Erro de API: 22Tempo de resposta (médio)81.36sTempo de resposta (máx.)106.37sTempo de resposta (total)1789.98sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 6Tempo de resposta (médio)698msTempo de resposta (máx.)1.08sTempo de resposta (total)8.38sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
Taxa de acerto por tentativa
0.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
27.3%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
Testes instáveis
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Execuções totais
66Execuções totais…
36Execuções totais…
Custo por resultado
0.000
0.047
Custo total
$0.000
$0.003
Preço de entrada
$0.300 / 1MPreço de entrada…
$0.042 / 1MPreço de entrada…
Preço de saída
$1.500 / 1MPreço de saída…
$0.000 / 1MPreço de saída…
Total de tokens de entrada
0Total de tokens de entrada…
67,092Total de tokens de entrada…
Tokens de saída
0Tokens de saída…
18,927Tokens de saída…
Tokens de raciocínio
0Tokens de raciocínio…
0Tokens de raciocínio…
Tempo de resposta (médio)
81.36sTempo de resposta (médio)…
698msTempo de resposta (médio)…
Tempo de resposta (máx.)
106.37sTempo de resposta (máx.)…
1.08sTempo de resposta (máx.)…
Tempo de resposta (total)
1789.98sTempo de resposta (total)…
8.38sTempo de resposta (total)…
Parâmetros
218B no total (25B ativos)
-
Disponibilidade
Código aberto
Código fechado
Geração showcase de modelos
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#356 Command A+
none
Provider returned error
Custo
$0.000
Tempo
0.2s
Tokens
0 tok
#352 Jev 1.13
none
Nenhum resultado showcase foi gerado para este modelo ainda.
3.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
0.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Erro de API: 4Tempo de resposta (médio)90.54sTempo de resposta (máx.)106.21sTempo de resposta (total)362.18sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
4.0Pontuação média em todos os testes de benchmark.…
7.5A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
25.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 2Tempo de resposta (médio)853msTempo de resposta (máx.)1.08sTempo de resposta (total)2.56sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
3.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
0.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Erro de API: 3Tempo de resposta (médio)80.82sTempo de resposta (máx.)92.50sTempo de resposta (total)242.45sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
2.2Pontuação média em todos os testes de benchmark.…
6.7A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
0.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 2Tempo de resposta (médio)598msTempo de resposta (máx.)658msTempo de resposta (total)1.20sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
3.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
0.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Erro de API: 2Tempo de resposta (médio)46.61sTempo de resposta (máx.)51.89sTempo de resposta (total)93.22sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
0.0Pontuação média em todos os testes de benchmark.…
0.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
0.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)0msTempo de resposta (máx.)0msTempo de resposta (total)0msUm teste é totalmente aprovado apenas quando todas as execuções passam.…
3.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
0.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Erro de API: 2Tempo de resposta (médio)62.59sTempo de resposta (máx.)88.50sTempo de resposta (total)125.18sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
10.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
100.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)799msTempo de resposta (máx.)844msTempo de resposta (total)1.60sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
3.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
0.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Erro de API: 3Tempo de resposta (médio)90.26sTempo de resposta (máx.)106.37sTempo de resposta (total)270.78sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
7.7Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
66.7%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 1Tempo de resposta (médio)632msTempo de resposta (máx.)681msTempo de resposta (total)1.90sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
3.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
0.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Erro de API: 1Tempo de resposta (médio)84.05sTempo de resposta (máx.)84.05sTempo de resposta (total)84.05sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
0.0Pontuação média em todos os testes de benchmark.…
0.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
0.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)0msTempo de resposta (máx.)0msTempo de resposta (total)0msUm teste é totalmente aprovado apenas quando todas as execuções passam.…
3.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
0.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Erro de API: 2Tempo de resposta (médio)95.73sTempo de resposta (máx.)97.43sTempo de resposta (total)191.46sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
1.5Pontuação média em todos os testes de benchmark.…
5.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
0.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 1Tempo de resposta (médio)557msTempo de resposta (máx.)557msTempo de resposta (total)557msUm teste é totalmente aprovado apenas quando todas as execuções passam.…
3.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
0.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Erro de API: 3Tempo de resposta (médio)88.10sTempo de resposta (máx.)94.19sTempo de resposta (total)264.30sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
3.3Pontuação média em todos os testes de benchmark.…
3.3A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
33.3%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)573msTempo de resposta (máx.)573msTempo de resposta (total)573msUm teste é totalmente aprovado apenas quando todas as execuções passam.…
3.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
0.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Erro de API: 1Tempo de resposta (médio)81.86sTempo de resposta (máx.)81.86sTempo de resposta (total)81.86sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
0.0Pontuação média em todos os testes de benchmark.…
0.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
0.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)0msTempo de resposta (máx.)0msTempo de resposta (total)0msUm teste é totalmente aprovado apenas quando todas as execuções passam.…
3.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
0.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Erro de API: 1Tempo de resposta (médio)74.52sTempo de resposta (máx.)74.52sTempo de resposta (total)74.52sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
0.0Pontuação média em todos os testes de benchmark.…
0.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
0.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)0msTempo de resposta (máx.)0msTempo de resposta (total)0msUm teste é totalmente aprovado apenas quando todas as execuções passam.…