Agentenaufgaben-Ranking
Sieh, welche KI-Modelle bei Agentenaufgaben am besten abschneiden, welche zuverlässig bleiben und wo die größten Unterschiede liegen. Sortieren nach: Korrekte Tests ↓.
Angezeigte Modelle
15
Durchschnittlicher Wert für Agentenaufgaben-Score
0.6
Bestes Modell
Gemini 3.6 Flash 1.0
387/387
Modelle filtern
Keine Modelle entsprechen der aktuellen Suche und den Filtern.
| Rang | Modell | Unternehmen | Agentenaufgaben-Score | Punktzahl | Gesamtkosten | Korrekte Tests | Antwortzeit (Durchschnitt) |
|---|---|---|---|---|---|---|---|
| #285 | Qwen3.6 Max Preview none | Qwen | 0.0 | 0.5 | $0.228 | 0/0 | 0ms |
| #286 | Laguna XS 2.1 none | Poolside | 0.5 | 0.5 | $0.020 | 0/1 | 70.8s |
| #287 | Qwen3.6 35B A3B none | Qwen | 0.5 | 0.5 | $0.105 | 0/1 | 65.6s |
| #288 | Inkling Small low | Thinkingmachines | 0.3 | 0.5 | $0.055 | 0/1 | 24ms |
| #289 | Ling 3.0 Flash none | Inclusionai | 0.3 | 0.5 | $0.004 | 0/1 | 26ms |
| #290 | Nemotron 3.5 Lightning high | NVIDIA | 0.4 | 0.5 | $0.168 | 0/1 | 491.0s |
| #291 | KAT Coder AIR V2.5 high | Kwaipilot | 0.3 | 0.5 | $0.077 | 0/1 | 1.10s |
| #292 | Mimo V2 PRO medium | Xiaomi | 0.0 | 0.5 | $0.333 | 0/0 | 0ms |
| #293 | MiMo-V2-Flash medium | Xiaomi | 0.0 | 0.5 | $0.043 | 0/0 | 0ms |
| #294 | Mistral Small 4 medium | Mistral | 0.5 | 0.5 | $0.126 | 0/1 | 54.1s |
| #295 | Mistral Small 4 none | Mistral | 0.5 | 0.5 | $0.047 | 0/1 | 45.5s |
| #296 | Mercury 2.5 low | Inception | 0.5 | 0.5 | $0.020 | 0/1 | 47.1s |
| #297 | KAT Coder AIR V2.5 medium | Kwaipilot | 0.3 | 0.5 | $0.048 | 0/1 | 1.05s |
| #298 | MiMo-V2.5-Pro none | Xiaomi | 0.4 | 0.5 | $0.135 | 0/1 | 49.6s |
| #299 | Apodex 1.1 Mini none | Apodex | 0.5 | 0.5 | $0.000 | 0/1 | 121.5s |