Fehler-Ranking für Anweisungen nicht befolgt

Sieh, bei welchen KI-Modellen Anweisungen nicht befolgt besonders häufig auftritt, damit du Zuverlässigkeitsrisiken vor der Auswahl erkennst. Sortieren nach: Fehleranzahl ↑.

Angezeigte Modelle

Gesamtfehler

246

Am stärksten betroffenes Modell

Gemini 3.5 Flash 1

Kategorien

In der Kategorie Rätsellösen90 In der Kategorie Allgemeine Intelligenz78 In der Kategorie Anti-KI-Tricks33 In der Kategorie Befolgung von Anweisungen19 In der Kategorie Programmierung16 In der Kategorie Werkzeugaufrufe8 In der Kategorie Domänenspezifisch1 In der Kategorie Kombiniert1

141/141

Rang	Modell	Unternehmen	Anweisungen nicht befolgt-Anzahl	Punktzahl	Gesamtkosten	Korrekte Tests	Antwortzeit (Durchschnitt)
#210	Qwen3.5-9B medium	Qwen	1	3.8	$0.036	3/22	82.2s
Gesamttests 22 Falsche Tests 19 Gesamtkosten $0.036 Antwortzeit (Durchschnitt) 82.2s
#211	Laguna Xs.2 none	Poolside	1	3.8	$0.004	5/19	806ms
Gesamttests 19 Falsche Tests 14 Gesamtkosten $0.004 Antwortzeit (Durchschnitt) 806ms
#213	Nemotron 3 Nano Omni 30b A3b Reasoning medium	NVIDIA	1	3.4	$0.000	4/19	17.1s
Gesamttests 19 Falsche Tests 15 Gesamtkosten $0.000 Antwortzeit (Durchschnitt) 17.1s
#215	Step 3.5 Flash none	Stepfun	1	2.3	$0.020	6/12	39.0s
Gesamttests 12 Falsche Tests 6 Gesamtkosten $0.020 Antwortzeit (Durchschnitt) 39.0s
#216	LFM2-24B-A2B none	Liquid	1	2.2	$0.001	2/16	782ms
Gesamttests 16 Falsche Tests 14 Gesamtkosten $0.001 Antwortzeit (Durchschnitt) 782ms
#16	GPT-5.3-Codex medium	OpenAI	2	8.9	$0.920	16/22	17.0s
Gesamttests 22 Falsche Tests 6 Gesamtkosten $0.920 Antwortzeit (Durchschnitt) 17.0s
#19	Muse Spark 1.1 medium	Meta	2	8.6	$1.357	15/22	25.0s
Gesamttests 22 Falsche Tests 7 Gesamtkosten $1.357 Antwortzeit (Durchschnitt) 25.0s
#21	GPT-5.4 medium	OpenAI	2	8.5	$1.533	15/22	23.1s
Gesamttests 22 Falsche Tests 7 Gesamtkosten $1.533 Antwortzeit (Durchschnitt) 23.1s
#27	Muse Spark 1.1 low	Meta	2	8.3	$0.647	13/22	11.5s
Gesamttests 22 Falsche Tests 9 Gesamtkosten $0.647 Antwortzeit (Durchschnitt) 11.5s
#30	Muse Spark 1.1 high	Meta	2	8.1	$1.694	12/22	31.5s
Gesamttests 22 Falsche Tests 10 Gesamtkosten $1.694 Antwortzeit (Durchschnitt) 31.5s
#39	Seed-2.0-Lite medium	Bytedance Seed	2	7.9	$0.234	14/22	48.5s
Gesamttests 22 Falsche Tests 8 Gesamtkosten $0.234 Antwortzeit (Durchschnitt) 48.5s
#49	DeepSeek V4 Flash high	DeepSeek	2	7.7	$0.041	13/22	49.7s
Gesamttests 22 Falsche Tests 9 Gesamtkosten $0.041 Antwortzeit (Durchschnitt) 49.7s
#50	DeepSeek V4 Pro high	DeepSeek	2	7.7	$0.200	10/22	79.1s
Gesamttests 22 Falsche Tests 12 Gesamtkosten $0.200 Antwortzeit (Durchschnitt) 79.1s
#51	MiniMax M3 medium	Minimax	2	7.6	$0.286	12/22	75.0s
Gesamttests 22 Falsche Tests 10 Gesamtkosten $0.286 Antwortzeit (Durchschnitt) 75.0s
#57	GPT-5.4 Nano medium	OpenAI	2	7.5	$0.138	12/22	13.2s
Gesamttests 22 Falsche Tests 10 Gesamtkosten $0.138 Antwortzeit (Durchschnitt) 13.2s

Anweisungen nicht befolgt-Fehler

Modelle filtern

Top-Modelle nach Anweisungen nicht befolgt-Anzahl

Anweisungen nicht befolgt-Anzahl vs Punktzahl

Top-Modelle nach Antwortzeit (Durchschnitt)