AI BENCHY Kategorie
Befolgung von Anweisungen-Ranking
Sieh, welche KI-Modelle bei Befolgung von Anweisungen am besten abschneiden, welche zuverlässig bleiben und wo die größten Unterschiede liegen. Sortieren nach: Metrik ↑.
Angezeigte Modelle
8
Durchschnittlicher Wert für Befolgung von Anweisungen-Score
8.0
Bestes Modell
Grok 4.1 Fast 3.0| Rang | Modell | Unternehmen | Befolgung von Anweisungen-Score | Punktzahl | Korrekte Tests | Antwortzeit (Durchschnitt) |
|---|---|---|---|---|---|---|
| #41 | MiMo-V2-Flash medium | Xiaomi | 10.0 | 7.5 | 2/2 | 4.28s |
| #43 | Qwen3.5-35B-A3B medium | Qwen | 10.0 | 7.4 | 2/2 | 24.4s |
| #46 | Kimi K2.5 medium | Moonshot AI | 10.0 | 7.0 | 2/2 | 92.5s |
| #49 | Qwen3.5 Plus 2026-02-15 none | Qwen | 10.0 | 6.8 | 2/2 | 1.67s |
| #53 | GLM 5 none | Z.ai | 10.0 | 6.6 | 2/2 | 1.48s |
| #54 | Mercury 2 medium | Inception | 10.0 | 6.5 | 2/2 | 1.07s |
| #61 | Seed-2.0-Lite none | Bytedance Seed | 10.0 | 6.2 | 2/2 | 1.06s |
| #64 | DeepSeek V3.2 none | DeepSeek | 10.0 | 6.1 | 2/2 | 1.52s |