Fehler-Ranking für Anweisungen nicht befolgt

Sieh, bei welchen KI-Modellen Anweisungen nicht befolgt besonders häufig auftritt, damit du Zuverlässigkeitsrisiken vor der Auswahl erkennst. Sortieren nach: Korrekte Tests ↓.

Angezeigte Modelle

Gesamtfehler

246

Am stärksten betroffenes Modell

Gemini 3.5 Flash 1

Kategorien

In der Kategorie Rätsellösen90 In der Kategorie Allgemeine Intelligenz78 In der Kategorie Anti-KI-Tricks33 In der Kategorie Befolgung von Anweisungen19 In der Kategorie Programmierung16 In der Kategorie Werkzeugaufrufe8 In der Kategorie Domänenspezifisch1 In der Kategorie Kombiniert1

141/141

Rang	Modell	Unternehmen	Anweisungen nicht befolgt-Anzahl	Punktzahl	Gesamtkosten	Korrekte Tests	Antwortzeit (Durchschnitt)
#127	gpt-oss-120b medium	OpenAI	3	6.1	$0.019	9/22	21.9s
Gesamttests 22 Falsche Tests 13 Gesamtkosten $0.019 Antwortzeit (Durchschnitt) 21.9s
#128	Gemini 3.1 Flash Lite none	Google	1	6.1	$0.046	9/22	1.75s
Gesamttests 22 Falsche Tests 13 Gesamtkosten $0.046 Antwortzeit (Durchschnitt) 1.75s
#134	GPT-5 Nano medium	OpenAI	2	6.1	$0.114	9/22	54.9s
Gesamttests 22 Falsche Tests 13 Gesamtkosten $0.114 Antwortzeit (Durchschnitt) 54.9s
#185	Ring-2.6-1T none	Inclusionai	2	4.8	$0.026	9/22	55.1s
Gesamttests 22 Falsche Tests 13 Gesamtkosten $0.026 Antwortzeit (Durchschnitt) 55.1s
#151	GLM 5V Turbo none	Z.ai	2	5.6	$0.052	8/21	2.99s
Gesamttests 21 Falsche Tests 13 Gesamtkosten $0.052 Antwortzeit (Durchschnitt) 2.99s
#152	Owl Alpha medium	Openrouter	2	5.6	$0.000	8/21	11.9s
Gesamttests 21 Falsche Tests 13 Gesamtkosten $0.000 Antwortzeit (Durchschnitt) 11.9s
#163	Mimo V2 Omni none	Xiaomi	1	5.5	$0.021	8/21	2.44s
Gesamttests 21 Falsche Tests 13 Gesamtkosten $0.021 Antwortzeit (Durchschnitt) 2.44s
#208	Grok Build 0.1 none	X AI	2	4.0	$0.547	7/19	28.7s
Gesamttests 19 Falsche Tests 12 Gesamtkosten $0.547 Antwortzeit (Durchschnitt) 28.7s
#109	Qwen3.5-27B none	Qwen	2	6.5	$0.090	8/22	4.76s
Gesamttests 22 Falsche Tests 14 Gesamtkosten $0.090 Antwortzeit (Durchschnitt) 4.76s
#118	Claude Sonnet 5 none	Anthropic	1	6.3	$0.548	8/22	6.04s
Gesamttests 22 Falsche Tests 14 Gesamtkosten $0.548 Antwortzeit (Durchschnitt) 6.04s
#132	Qwen3.5 Plus 2026-04-20 none	Qwen	2	6.1	$0.122	8/22	13.6s
Gesamttests 22 Falsche Tests 14 Gesamtkosten $0.122 Antwortzeit (Durchschnitt) 13.6s
#135	Nemotron 3 Ultra none	NVIDIA	1	6.1	$0.095	8/22	3.87s
Gesamttests 22 Falsche Tests 14 Gesamtkosten $0.095 Antwortzeit (Durchschnitt) 3.87s
#138	GPT-5.6 Terra none	OpenAI	1	6.0	$0.349	8/22	1.65s
Gesamttests 22 Falsche Tests 14 Gesamtkosten $0.349 Antwortzeit (Durchschnitt) 1.65s
#146	Nemotron 3 Super medium	NVIDIA	3	5.7	$0.055	8/22	52.0s
Gesamttests 22 Falsche Tests 14 Gesamtkosten $0.055 Antwortzeit (Durchschnitt) 52.0s
#155	KAT-Coder-Air V2.5 medium	Kwaipilot	1	5.6	$0.048	8/22	8.42s
Gesamttests 22 Falsche Tests 14 Gesamtkosten $0.048 Antwortzeit (Durchschnitt) 8.42s

Anweisungen nicht befolgt-Fehler

Modelle filtern

Top-Modelle nach Anweisungen nicht befolgt-Anzahl

Anweisungen nicht befolgt-Anzahl vs Punktzahl

Top-Modelle nach Antwortzeit (Durchschnitt)