Leaderboard do AI Benchy
Benchmarks gerados a partir das suítes de teste do AI BENCHY em: 2026-09-02
Modelos avaliados: 311
Modelos recomendados
GPT-5.6 Sol
high
Inteligente
Taxa de acerto por tentativa
89.4%
Testes corretos
18 / 22
Pontuação
9.4/10
GPT-5.6 Luna
medium
Rápido
Tempo de resposta (médio)
7.43s
Total de tokens de saída
44,525
Pontuação
7.4/10
DeepSeek V4 Flash 0731
high
Acessível
Preço de entrada
$0.065 / 1M
Preço de saída
$0.180 / 1M
Pontuação
8.0/10
311/311
Filtrar modelos
Nenhum modelo corresponde à pesquisa e aos filtros atuais.
| Posição | Modelo | Pontuação Pontuação média em todos os testes de benchmark. | Empresa | Custo total | Tempo de resposta (médio) Tempo de resposta (médio) | Testes corretos Mostra quantos testes foram totalmente aprovados (todas as execuções aprovadas). |
|---|---|---|---|---|---|---|
| #261#261 | Laguna S 2.1low | 5.0… | Poolside | $0.082 ↓ … | 85.34s… | Um teste é totalmente aprovado apenas quando todas as execuções passam. Resposta incorreta: 15 Erro de API: 1 Formatação extra: 1 Não seguiu as instruções: 1 Chamada de ferramenta inválida: 1 Tempo de resposta (médio)85.34s Tempo de resposta (máx.)814.73s Tempo de resposta (total)1877.49s … |
Resposta incorreta: 15 Erro de API: 1 Formatação extra: 1 Não seguiu as instruções: 1 Chamada de ferramenta inválida: 1
|
||||||
| #268#268 | Hy4 previewnone | 4.8… | Tencent | $0.041 … | 39.24s… | Um teste é totalmente aprovado apenas quando todas as execuções passam. Resposta incorreta: 9 Erro de API: 7 Não seguiu as instruções: 2 Formatação extra: 1 Tempo de resposta (médio)39.24s Tempo de resposta (máx.)95.32s Tempo de resposta (total)863.30s … |
|
||||||
| #283#283 | Qwen3 Coder Nextmedium | 4.6… | Qwen | $0.034 ↑ … | 9.07s… | Um teste é totalmente aprovado apenas quando todas as execuções passam. Resposta incorreta: 14 Não seguiu as instruções: 3 Sem resposta: 1 Tempo esgotado: 1 Tempo de resposta (médio)9.07s Tempo de resposta (máx.)81.80s Tempo de resposta (total)154.19s … |
|
||||||
| #291#291 | Granite 4.2 8Bnone | 4.3… | IBM Granite | $0.026 … | 86.27s… | Um teste é totalmente aprovado apenas quando todas as execuções passam. Resposta incorreta: 11 Formatação extra: 4 Tempo esgotado: 3 Não seguiu as instruções: 1 Tempo de resposta (médio)86.27s Tempo de resposta (máx.)747.17s Tempo de resposta (total)1897.96s … |
|
||||||
| #299#299 | Nemotron 3.5 Lightningnone | 4.0… | NVIDIA | $0.007 ↕ … | 1.21s… | Um teste é totalmente aprovado apenas quando todas as execuções passam. Resposta incorreta: 16 Chamada de ferramenta inválida: 2 Não seguiu as instruções: 1 Tempo de resposta (médio)1.21s Tempo de resposta (máx.)6.30s Tempo de resposta (total)26.62s … |
|
||||||
| #304#304 | Qwen3.5-9Bmedium | 3.8… | Qwen | $0.062 ↑ … | 107.51s… | Um teste é totalmente aprovado apenas quando todas as execuções passam. Tempo esgotado: 11 Sem resposta: 3 Resposta incorreta: 2 Erro de API: 1 Formatação extra: 1 Não seguiu as instruções: 1 Tempo de resposta (médio)107.51s Tempo de resposta (máx.)569.97s Tempo de resposta (total)1720.15s … |
Tempo esgotado: 11 Sem resposta: 3 Resposta incorreta: 2 Erro de API: 1 Formatação extra: 1 Não seguiu as instruções: 1
|
||||||
| #311#311 | LFM2-24B-A2BnoneModelo arquivado: este modelo não é mais atualizado nem testado em novos testes. | 2.2… | Liquid | $0.001 … | 782ms… | Um teste é totalmente aprovado apenas quando todas as execuções passam. Resposta incorreta: 9 Erro de API: 4 Não seguiu as instruções: 1 Tempo de resposta (médio)782ms Tempo de resposta (máx.)3.15s Tempo de resposta (total)10.94s … |
|
||||||
| #309#309 | Nemotron 3 Nano Omni 30b A3b ReasoningnoneModelo arquivado: este modelo não é mais atualizado nem testado em novos testes. | 3.2… | NVIDIA | $0.000 … | 728ms… | Um teste é totalmente aprovado apenas quando todas as execuções passam. Resposta incorreta: 9 Erro de API: 6 Não seguiu as instruções: 2 Tempo de resposta (médio)728ms Tempo de resposta (máx.)2.21s Tempo de resposta (total)9.47s … |
|
||||||
| #285#285 | Laguna S 2.1none | 4.5… | Poolside | $0.022 ↓ … | 11.67s… | Um teste é totalmente aprovado apenas quando todas as execuções passam. Resposta incorreta: 18 Não seguiu as instruções: 1 Sem resposta: 1 Tempo de resposta (médio)11.67s Tempo de resposta (máx.)200.52s Tempo de resposta (total)256.71s … |
|
||||||
| #297#297 | Ling 3.0 Tinynone | 4.0… | Inclusionai | $0.000 … | 14.02s… | Um teste é totalmente aprovado apenas quando todas as execuções passam. Resposta incorreta: 13 Não seguiu as instruções: 4 Erro de API: 1 Formatação extra: 1 Chamada de ferramenta inválida: 1 Tempo de resposta (médio)14.02s Tempo de resposta (máx.)240.61s Tempo de resposta (total)294.46s … |
Resposta incorreta: 13 Não seguiu as instruções: 4 Erro de API: 1 Formatação extra: 1 Chamada de ferramenta inválida: 1
|
||||||
| #298#298 | Granite 4.1 8Bnone | 4.0… | IBM Granite | $0.007 … | 1.44s… | Um teste é totalmente aprovado apenas quando todas as execuções passam. Resposta incorreta: 13 Não seguiu as instruções: 4 Chamada de ferramenta inválida: 2 Formatação extra: 1 Tempo de resposta (médio)1.44s Tempo de resposta (máx.)16.67s Tempo de resposta (total)31.75s … |
Resposta incorreta: 13 Não seguiu as instruções: 4 Chamada de ferramenta inválida: 2 Formatação extra: 1
|
||||||
Tendências globais do benchmark
Veja como os modelos atuais equilibram pontuação, custo, velocidade, comprimento da saída e desempenho por categoria.
Evolução da melhor pontuação das empresas líderes
Fronteira de Pareto: inteligência vs velocidade de resposta
Fronteira de Pareto: pontuação vs tokens de saída
Dificuldade das categorias entre os modelos
Comparação rápida
Gemini 3.6 FlashhighvsGemini 3.8 FlashhighGemini 3.8 FlashhighvsGemini 3.7 FlashhighGemini 3.7 FlashhighvsGemini 3.6 FlashmediumGemini 3.6 FlashmediumvsGPT-5.6 SollowGPT-5.6 SollowvsGemini 3 Flash PreviewmediumGemini 3 Flash PreviewmediumvsGemini 3.5 FlashhighGemini 3.5 FlashhighvsGemini 3.7 FlashmediumGemini 3.7 FlashmediumvsGPT-5.6 SolmediumGPT-5.6 SolmediumvsGPT-5.6 SolhighGPT-5.6 SolhighvsGPT-5.5lowGPT-5.5lowvsGrok 4.6highGrok 4.6highvsGemini 3.1 Pro Previewmedium