Ranking de Tareas de agentes
Mira qué modelos de IA rinden mejor en Tareas de agentes, cuáles se mantienen fiables y dónde aparecen las mayores diferencias. Ordenar por: Métrica ↑.
Modelos mostrados
15
Promedio de Puntuación de Tareas de agentes
5.8
Mejor modelo
Qwen3.6 Max Preview 0.0
380/380
Filtrar modelos
Ningún modelo coincide con la búsqueda y los filtros actuales.
| Rango | Modelo | Empresa | Puntuación de Tareas de agentes | Puntuación | Costo total | Pruebas correctas | Tiempo de respuesta (promedio) |
|---|---|---|---|---|---|---|---|
| #137 | Qwen3.6 Plus medium | Qwen | 4.7 | 7.3 | $0.391 | 0/1 | 307.1s |
| #138 | Gemini 3.5 Flash Lite medium | 4.7 | 7.3 | $0.440 | 0/1 | 86.9s | |
| #143 | Claude Opus 4.8 low | Anthropic | 4.7 | 7.2 | $3.787 | 0/1 | 110.7s |
| #146 | GLM 5 medium | Z.ai | 4.7 | 7.2 | $0.360 | 0/1 | 110.7s |
| #157 | Ember-1 low | Fireworks | 4.7 | 7.0 | $1.488 | 0/1 | 121.3s |
| #203 | Solar Pro 4 medium | Upstage | 4.7 | 6.4 | $0.174 | 0/1 | 272.3s |
| #206 | Mercury 2.5 medium | Inception | 4.7 | 6.4 | $0.034 | 0/1 | 107.9s |
| #238 | GLM 5.3 FlashX low | Z.ai | 4.7 | 6.0 | $0.157 | 0/1 | 78.0s |
| #246 | Claude Sonnet 5 none | Anthropic | 4.7 | 5.9 | $1.095 | 0/1 | 64.7s |
| #248 | Qwen3.7 Flash none | Qwen | 4.7 | 5.9 | $0.028 | 0/1 | 117.0s |
| #254 | GPT-5 Nano medium | OpenAI | 4.7 | 5.7 | $0.139 | 0/1 | 94.1s |
| #259 | Space Bunny Alpha low | Stealth | 4.7 | 5.7 | $0.000 | 0/1 | 89.0s |
| #265 | Kimi K2.6 none | Moonshot AI | 4.7 | 5.5 | $0.376 | 0/1 | 175.2s |
| #298 | MiniMax M2.7 medium | Minimax | 4.7 | 5.0 | $0.202 | 0/1 | 198.8s |
| #64 | Grok 4.6 high | X AI | 5.0 | 8.5 | $2.629 | 0/1 | 160.9s |