Ranking de Tareas de agentes
Mira qué modelos de IA rinden mejor en Tareas de agentes, cuáles se mantienen fiables y dónde aparecen las mayores diferencias. Ordenar por: Tiempo de respuesta (promedio) ↑.
Modelos mostrados
15
Promedio de Puntuación de Tareas de agentes
5.8
Mejor modelo
Qwen3.6 Max Preview 0.0
380/380
Filtrar modelos
Ningún modelo coincide con la búsqueda y los filtros actuales.
| Rango | Modelo | Empresa | Puntuación de Tareas de agentes | Puntuación | Costo total | Pruebas correctas | Tiempo de respuesta (promedio) |
|---|---|---|---|---|---|---|---|
| #146 | GLM 5 medium | Z.ai | 4.7 | 7.2 | $0.360 | 0/1 | 110.7s |
| #31 | Claude Sonnet 5.5 max | Anthropic | 10.0 | 9.2 | $8.557 | 1/1 | 111.1s |
| #132 | GLM 5.3 Flash high | Z.ai | 7.4 | 7.3 | $0.084 | 0/1 | 111.5s |
| #363 | Command A+ medium | Cohere | 5.0 | 3.4 | $0.064 | 0/1 | 112.8s |
| #152 | MiMo-V2.5 medium | Xiaomi | 10.0 | 7.1 | $0.419 | 1/1 | 113.6s |
| #32 | Qwen3.8 MAX medium | Qwen | 10.0 | 9.2 | $0.948 | 1/1 | 115.3s |
| #2 | Gemini 3.8 Flash high | 10.0 | 9.9 | $1.927 | 1/1 | 115.5s | |
| #136 | LongCat 2.0 high | Meituan | 10.0 | 7.3 | $0.569 | 1/1 | 116.1s |
| #180 | MiniMax M3 medium | Minimax | 3.0 | 6.7 | $0.372 | 0/1 | 116.5s |
| #248 | Qwen3.7 Flash none | Qwen | 4.7 | 5.9 | $0.028 | 0/1 | 117.0s |
| #157 | Ember-1 low | Fireworks | 4.7 | 7.0 | $1.488 | 0/1 | 121.3s |
| #320 | DeepSeek V3.2 none | DeepSeek | 3.0 | 4.6 | $0.121 | 0/1 | 122.5s |
| #308 | MiMo-V2.5 none | Xiaomi | 3.9 | 4.9 | $0.063 | 0/1 | 124.2s |
| #139 | Qwen3.5-27B none | Qwen | 10.0 | 7.2 | $0.116 | 1/1 | 124.5s |
| #212 | Qwen3.5-35B-A3B medium | Qwen | 7.4 | 6.3 | $1.249 | 0/1 | 126.8s |