Agenttaken-ranglijst
Zie welke AI-modellen het best presteren op Agenttaken, welke betrouwbaar blijven en waar de grootste verschillen zitten. Sorteren op: Correcte tests ↑.
380/380
Modellen filteren
Geen modellen komen overeen met de huidige zoekopdracht en filters.
| Rang | Model | Bedrijf | Agenttaken-score | Score | Totale kosten | Correcte tests | Responstijd (gem.) |
|---|---|---|---|---|---|---|---|
| #232 | Trinity Large Thinking medium | Arcee AI | 6.1 | 6.1 | $0.820 | 0/1 | 52.5s |
| #234 | Qwen3.5 Plus 2026-04-20 none | Qwen | 6.1 | 6.1 | $0.226 | 0/1 | 137.1s |
| #236 | KAT-Coder-Pro V2.5 none | Kwaipilot | 3.0 | 6.1 | $0.487 | 0/1 | 1.90s |
| #237 | Claude Sonnet 4.6 none | Anthropic | 0.0 | 6.0 | $0.661 | 0/0 | 0ms |
| #238 | GLM 5.3 FlashX low | Z.ai | 4.7 | 6.0 | $0.157 | 0/1 | 78.0s |
| #239 | MiMo-V2.6-Pro none | Xiaomi | 5.0 | 6.0 | $0.193 | 0/1 | 66.1s |
| #240 | Inkling Small medium | Thinkingmachines | 3.0 | 6.0 | $0.118 | 0/1 | 49ms |
| #241 | Seed-2.0-Lite none | Bytedance Seed | 5.0 | 6.0 | $0.114 | 0/1 | 76.0s |
| #242 | Gemini 3.1 Flash Lite minimal | 5.0 | 5.9 | $0.080 | 0/1 | 50.0s | |
| #243 | gpt-oss-120b medium | OpenAI | 5.0 | 5.9 | $0.030 | 0/1 | 203.9s |
| #244 | Gemini 3.1 Flash Lite none | 5.0 | 5.9 | $0.069 | 0/1 | 43.8s | |
| #245 | Qwen3.6 Flash none | Qwen | 5.0 | 5.9 | $0.143 | 0/1 | 93.5s |
| #246 | Claude Sonnet 5 none | Anthropic | 4.7 | 5.9 | $1.095 | 0/1 | 64.7s |
| #247 | Nemotron 3 Ultra none | NVIDIA | 5.0 | 5.9 | $0.193 | 0/1 | 70.2s |
| #248 | Qwen3.7 Flash none | Qwen | 4.7 | 5.9 | $0.028 | 0/1 | 117.0s |