AI BENCHY
Advertise here

AI BENCHY Kategorie

Befolgung von Anweisungen-Ranking

Sieh, welche KI-Modelle bei Befolgung von Anweisungen am besten abschneiden, welche zuverlässig bleiben und wo die größten Unterschiede liegen. Sortieren nach: Metrik ↑.

Angezeigte Modelle

15

Durchschnittlicher Wert für Befolgung von Anweisungen-Score

8.5

Bestes Modell

Grok 4.1 Fast 3.0
Rang Modell Unternehmen Befolgung von Anweisungen-Score Punktzahl Korrekte Tests Antwortzeit (Durchschnitt)
#50 Gemini 3.1 Flash Lite Preview low Google 10.0 7.4 2/2 1.49s
#52 Claude Sonnet 4.6 medium Anthropic 10.0 7.4 2/2 2.61s
#54 GPT-5 Mini medium OpenAI 10.0 7.3 2/2 11.6s
#58 Gemini 3.1 Flash Lite Preview none Google 10.0 7.2 2/2 1.13s
#60 Kimi K2.6 medium Moonshot AI 10.0 7.2 2/2 12.5s
#61 Gemini 3.1 Flash Lite low Google 10.0 7.2 2/2 1.52s
#64 MiMo-V2-Flash medium Xiaomi 10.0 7.2 2/2 4.28s
#66 Qwen3.5-35B-A3B medium Qwen 10.0 7.1 2/2 24.4s
#69 Claude Opus 4.6 medium Anthropic 10.0 7.0 2/2 2.43s
#72 DeepSeek V3.2 medium DeepSeek 10.0 7.0 2/2 35.8s
#73 Seed-2.0-Mini medium Bytedance Seed 10.0 6.9 2/2 17.5s
#76 Kimi K2.5 medium Moonshot AI 10.0 6.8 2/2 92.5s
#78 Qwen3.6 27B medium Qwen 10.0 6.8 2/2 38.0s
#81 Mercury 2 medium Inception 10.0 6.6 2/2 1.07s
#82 Hy3 preview high Tencent 10.0 6.6 2/2 34.4s

Top-Modelle nach Befolgung von Anweisungen-Score

Befolgung von Anweisungen-Score vs. Gesamtkosten

Top-Modelle nach Antwortzeit (Durchschnitt)