A pontuação média está praticamente empatada em 6.9 vs 6.9. Seed-2.0-Code (high) tem menor custo de benchmark com $1.273 vs $2.565. Claude Fable 5.1 (low) é mais rápido com 10.33s vs 124.18s, com taxas de acerto de 56.1% vs 63.6%.
Benchmarks gerados a partir das suítes de teste do AI BENCHY em:
2026-09-02
Posição
#130
Total de tokens de saída
24,375
Tempo de resposta (médio)
10.33s
Custo total
$2.565
Posição
#132
Total de tokens de saída
410,575
Tempo de resposta (médio)
124.18s
Custo total
$1.273
Modelo recomendadoClaude Fable 5.1 (low)
Tem a melhor pontuação aqui (6.9) e responde cerca de 12.0x mais rápido que Seed-2.0-Code (high).
6.9Pontuação média em todos os testes de benchmark.…
6.9Pontuação média em todos os testes de benchmark.…
Posição
#130
#132
Confiabilidade
10.0Pontuação de sucesso na primeira tentativa: 10.0 significa nenhum erro reexecutável da API alvo ou de limite de taxa antes de chamadas bem-sucedidas; falhas registradas reduzem a pontuação.…
8.6Pontuação de sucesso na primeira tentativa: 10.0 significa nenhum erro reexecutável da API alvo ou de limite de taxa antes de chamadas bem-sucedidas; falhas registradas reduzem a pontuação.…
Consistência
9.2A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
7.8A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
Tentativas
66/66
66/66
Testes corretos
Um teste é totalmente aprovado apenas quando todas as execuções passam.Formatação extra: 4Resposta incorreta: 4Não seguiu as instruções: 3Tempo de resposta (médio)10.33sTempo de resposta (máx.)33.10sTempo de resposta (total)227.37sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Erro de API: 5Resposta incorreta: 4Não seguiu as instruções: 1Sem resposta: 1Tempo de resposta (médio)124.18sTempo de resposta (máx.)675.30sTempo de resposta (total)2732.03sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
Taxa de acerto por tentativa
56.1%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
63.6%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
Testes instáveis
2Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
5Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Execuções totais
66Execuções totais…
66Execuções totais…
Custo por resultado
23.315
11.571
Custo total
$2.565
$1.273
Preço de entrada
$10.000 / 1MPreço de entrada…
$0.500 / 1MPreço de entrada…
Preço de saída
$50.000 / 1MPreço de saída…
$3.000 / 1MPreço de saída…
Total de tokens de entrada
134,582Total de tokens de entrada…
81,970Total de tokens de entrada…
Tokens de saída
8,955Tokens de saída…
7,186Tokens de saída…
Tokens de raciocínio
15,420Tokens de raciocínio…
403,389Tokens de raciocínio…
Tempo de resposta (médio)
10.33sTempo de resposta (médio)…
124.18sTempo de resposta (médio)…
Tempo de resposta (máx.)
33.10sTempo de resposta (máx.)…
675.30sTempo de resposta (máx.)…
Tempo de resposta (total)
227.37sTempo de resposta (total)…
2732.03sTempo de resposta (total)…
Parâmetros
~9.5T no total (~878B ativos)
~200B no total (~20B ativos)
Disponibilidade
Código fechado
Código fechado
Geração showcase de modelos
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
6.5Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
50.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Formatação extra: 2Tempo de resposta (médio)4.54sTempo de resposta (máx.)4.91sTempo de resposta (total)18.16sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
8.3Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
75.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 1Tempo de resposta (médio)35.07sTempo de resposta (máx.)82.43sTempo de resposta (total)140.28sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
3.4Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
0.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Não seguiu as instruções: 2Formatação extra: 1Tempo de resposta (médio)6.75sTempo de resposta (máx.)7.70sTempo de resposta (total)20.24sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
6.2Pontuação média em todos os testes de benchmark.…
6.5A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
55.6%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
1Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Erro de API: 1Não seguiu as instruções: 1Tempo de resposta (médio)266.74sTempo de resposta (máx.)443.32sTempo de resposta (total)800.23sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
10.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
100.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)29.40sTempo de resposta (máx.)33.10sTempo de resposta (total)58.80sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
7.3Pontuação média em todos os testes de benchmark.…
5.8A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
83.3%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
1Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Erro de API: 1Tempo de resposta (médio)144.87sTempo de resposta (máx.)236.85sTempo de resposta (total)289.75sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
10.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
100.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)4.71sTempo de resposta (máx.)4.86sTempo de resposta (total)9.43sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
10.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
100.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)24.28sTempo de resposta (máx.)34.05sTempo de resposta (total)48.55sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
4.1Pontuação média em todos os testes de benchmark.…
4.4A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
44.5%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
2Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 3Tempo de resposta (médio)19.30sTempo de resposta (máx.)19.72sTempo de resposta (total)57.90sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
3.5Pontuação média em todos os testes de benchmark.…
4.4A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
33.3%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
2Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 2Sem resposta: 1Tempo de resposta (médio)419.73sTempo de resposta (máx.)675.30sTempo de resposta (total)1259.19sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
10.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
100.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)5.62sTempo de resposta (máx.)5.62sTempo de resposta (total)5.62sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
4.6Pontuação média em todos os testes de benchmark.…
7.8A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
0.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Erro de API: 1Tempo de resposta (médio)36.45sTempo de resposta (máx.)36.45sTempo de resposta (total)36.45sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
6.5Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
50.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Formatação extra: 1Tempo de resposta (médio)5.24sTempo de resposta (máx.)5.70sTempo de resposta (total)10.49sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
9.8Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
100.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)11.26sTempo de resposta (máx.)19.26sTempo de resposta (total)22.53sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
7.7Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
66.7%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Não seguiu as instruções: 1Tempo de resposta (médio)4.78sTempo de resposta (máx.)5.07sTempo de resposta (total)14.33sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
7.8Pontuação média em todos os testes de benchmark.…
9.3A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
66.7%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Erro de API: 1Tempo de resposta (médio)15.91sTempo de resposta (máx.)17.11sTempo de resposta (total)47.73sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
10.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
100.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)13.22sTempo de resposta (máx.)13.22sTempo de resposta (total)13.22sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
4.7Pontuação média em todos os testes de benchmark.…
1.6A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
66.7%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
1Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Erro de API: 1Tempo de resposta (médio)35.09sTempo de resposta (máx.)35.09sTempo de resposta (total)35.09sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
3.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
0.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 1Tempo de resposta (médio)19.18sTempo de resposta (máx.)19.18sTempo de resposta (total)19.18sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
3.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
0.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 1Tempo de resposta (médio)52.23sTempo de resposta (máx.)52.23sTempo de resposta (total)52.23sUm teste é totalmente aprovado apenas quando todas as execuções passam.…