Categoria AI BENCHY
Ranking de Específico do domínio
Veja quais modelos de IA vão melhor em Específico do domínio, quais permanecem confiáveis e onde aparecem as maiores diferenças. Ordenar por: Testes corretos ↓.
Modelos exibidos
15
Média de Pontuação de Específico do domínio
4.7
Melhor modelo
Gemini 3 Flash Preview 10.0
197/197
Filtrar modelos
Nenhum modelo corresponde à pesquisa e aos filtros atuais.
| Posição | Modelo | Empresa | Pontuação de Específico do domínio | Pontuação | Custo total | Testes corretos | Tempo de resposta (médio) |
|---|---|---|---|---|---|---|---|
| #2 | Gemini 3 Flash Preview medium | 10.0 | 9.6 | $0.667 | 3/3 | 15.3s | |
| #88 | Gemini 3.5 Flash minimal | 10.0 | 6.8 | $0.108 | 3/3 | 899ms | |
| #196 | Step 3.5 Flash none | Stepfun | 3.3 | 2.6 | $0.020 | 1/1 | 34.5s |
| #1 | Gemini 3.5 Flash high | 7.6 | 9.8 | $1.115 | 2/3 | 14.1s | |
| #8 | Gemini 3.5 Flash low | 7.7 | 9.2 | $0.349 | 2/3 | 3.39s | |
| #10 | Gemini 3.1 Pro Preview medium | 7.7 | 9.2 | $1.054 | 2/3 | 32.7s | |
| #11 | Gemini 3.5 Flash medium | 7.7 | 9.1 | $0.582 | 2/3 | 5.24s | |
| #16 | Claude Opus 4.7 medium | Anthropic | 7.7 | 8.7 | $0.679 | 2/3 | 1.17s |
| #23 | Step 3.7 Flash medium | Stepfun | 7.7 | 8.5 | $0.376 | 2/3 | 48.3s |
| #37 | Claude Sonnet 5 medium | Anthropic | 7.7 | 7.9 | $0.550 | 2/3 | 20.4s |
| #52 | GPT-5.6 Luna high | OpenAI | 7.7 | 7.7 | $0.924 | 2/3 | 79.0s |
| #65 | Claude Opus 4.7 none | Anthropic | 7.7 | 7.4 | $0.505 | 2/3 | 1.19s |
| #71 | Claude Sonnet 4.6 none | Anthropic | 7.7 | 7.3 | $0.316 | 2/3 | 3.54s |
| #83 | Gemini 3.5 Flash none | 7.6 | 7.0 | $1.079 | 2/3 | 10.6s | |
| #84 | Gemini 3 Flash Preview none | 7.7 | 6.9 | $0.025 | 2/3 | 963ms |