Foutenranglijst voor Instructies niet gevolgd

Zie welke AI-modellen het vaakst tegen Instructies niet gevolgd aanlopen, zodat je betrouwbaarheidsrisico's ziet voordat je kiest. Sorteren op: Aantal fouten ↑.

Getoonde modellen

Totaal fouten

246

Meest getroffen model

Gemini 3.5 Flash 1

Categorieën

In categorie Puzzeloplossing90 In categorie Algemene intelligentie78 In categorie Anti-AI-trucs33 In categorie Instructies opvolgen19 In categorie Programmeren16 In categorie Toolaanroepen8 In categorie Domeinspecifiek1 In categorie Gecombineerd1

141/141

Rang	Model	Bedrijf	Instructies niet gevolgd-aantal	Score	Totale kosten	Correcte tests	Responstijd (gem.)
#210	Qwen3.5-9B medium	Qwen	1	3.8	$0.036	3/22	82.2s
Totaal tests 22 Foute tests 19 Totale kosten $0.036 Responstijd (gem.) 82.2s
#211	Laguna Xs.2 none	Poolside	1	3.8	$0.004	5/19	806ms
Totaal tests 19 Foute tests 14 Totale kosten $0.004 Responstijd (gem.) 806ms
#213	Nemotron 3 Nano Omni 30b A3b Reasoning medium	NVIDIA	1	3.4	$0.000	4/19	17.1s
Totaal tests 19 Foute tests 15 Totale kosten $0.000 Responstijd (gem.) 17.1s
#215	Step 3.5 Flash none	Stepfun	1	2.3	$0.020	6/12	39.0s
Totaal tests 12 Foute tests 6 Totale kosten $0.020 Responstijd (gem.) 39.0s
#216	LFM2-24B-A2B none	Liquid	1	2.2	$0.001	2/16	782ms
Totaal tests 16 Foute tests 14 Totale kosten $0.001 Responstijd (gem.) 782ms
#16	GPT-5.3-Codex medium	OpenAI	2	8.9	$0.920	16/22	17.0s
Totaal tests 22 Foute tests 6 Totale kosten $0.920 Responstijd (gem.) 17.0s
#19	Muse Spark 1.1 medium	Meta	2	8.6	$1.357	15/22	25.0s
Totaal tests 22 Foute tests 7 Totale kosten $1.357 Responstijd (gem.) 25.0s
#21	GPT-5.4 medium	OpenAI	2	8.5	$1.533	15/22	23.1s
Totaal tests 22 Foute tests 7 Totale kosten $1.533 Responstijd (gem.) 23.1s
#27	Muse Spark 1.1 low	Meta	2	8.3	$0.647	13/22	11.5s
Totaal tests 22 Foute tests 9 Totale kosten $0.647 Responstijd (gem.) 11.5s
#30	Muse Spark 1.1 high	Meta	2	8.1	$1.694	12/22	31.5s
Totaal tests 22 Foute tests 10 Totale kosten $1.694 Responstijd (gem.) 31.5s
#39	Seed-2.0-Lite medium	Bytedance Seed	2	7.9	$0.234	14/22	48.5s
Totaal tests 22 Foute tests 8 Totale kosten $0.234 Responstijd (gem.) 48.5s
#49	DeepSeek V4 Flash high	DeepSeek	2	7.7	$0.041	13/22	49.7s
Totaal tests 22 Foute tests 9 Totale kosten $0.041 Responstijd (gem.) 49.7s
#50	DeepSeek V4 Pro high	DeepSeek	2	7.7	$0.200	10/22	79.1s
Totaal tests 22 Foute tests 12 Totale kosten $0.200 Responstijd (gem.) 79.1s
#51	MiniMax M3 medium	Minimax	2	7.6	$0.286	12/22	75.0s
Totaal tests 22 Foute tests 10 Totale kosten $0.286 Responstijd (gem.) 75.0s
#57	GPT-5.4 Nano medium	OpenAI	2	7.5	$0.138	12/22	13.2s
Totaal tests 22 Foute tests 10 Totale kosten $0.138 Responstijd (gem.) 13.2s

Instructies niet gevolgd-fouten

Modellen filteren

Topmodellen op Instructies niet gevolgd-aantal

Instructies niet gevolgd-aantal vs Score

Topmodellen op Responstijd (gem.)