Agenttaken-ranglijst
Zie welke AI-modellen het best presteren op Agenttaken, welke betrouwbaar blijven en waar de grootste verschillen zitten. Sorteren op: Metriek ↑.
380/380
Modellen filteren
Geen modellen komen overeen met de huidige zoekopdracht en filters.
| Rang | Model | Bedrijf | Agenttaken-score | Score | Totale kosten | Correcte tests | Responstijd (gem.) |
|---|---|---|---|---|---|---|---|
| #86 | DeepSeek V4 Pro 0423 high | DeepSeek | 10.0 | 8.1 | $0.556 | 1/1 | 64.5s |
| #88 | DeepSeek V4 Flash 0423 high | DeepSeek | 10.0 | 8.1 | $0.056 | 1/1 | 148.1s |
| #91 | GPT-5.6 Luna high | OpenAI | 10.0 | 8.0 | $0.207 | 1/1 | 60.2s |
| #92 | Nemotron 3 Ultra medium | NVIDIA | 10.0 | 8.0 | $0.762 | 1/1 | 188.1s |
| #93 | GPT-5.4 Nano medium | OpenAI | 10.0 | 8.0 | $0.187 | 1/1 | 74.0s |
| #95 | GPT-5.6 Terra low | OpenAI | 10.0 | 7.9 | $0.645 | 1/1 | 54.6s |
| #96 | Qwen3.5-27B medium | Qwen | 10.0 | 7.9 | $1.135 | 1/1 | 146.5s |
| #99 | Qwen3.7 Max none | Qwen | 10.0 | 7.9 | $0.492 | 1/1 | 80.3s |
| #100 | Qwen3.8 2.4T A95B high | Qwen | 10.0 | 7.9 | $2.805 | 1/1 | 127.1s |
| #101 | MiMo-V2.6-Flash medium | Xiaomi | 10.0 | 7.9 | $0.218 | 1/1 | 90.1s |
| #103 | GLM 5.3 high | Z.ai | 10.0 | 7.8 | $0.610 | 1/1 | 40.7s |
| #107 | Qwen3.7 Plus none | Qwen | 10.0 | 7.8 | $0.184 | 1/1 | 143.1s |
| #109 | DeepSeek V4 Flash 0731 medium | DeepSeek | 10.0 | 7.8 | $0.462 | 1/1 | 303.3s |
| #111 | Muse Glimmer 30B high | Meta | 10.0 | 7.7 | $0.625 | 1/1 | 139.7s |
| #112 | Qwen3.5 Plus 2026-04-20 medium | Qwen | 10.0 | 7.7 | $0.488 | 1/1 | 203.0s |