Foutenranglijst voor Verkeerd antwoord

Zie welke AI-modellen het vaakst tegen Verkeerd antwoord aanlopen, zodat je betrouwbaarheidsrisico's ziet voordat je kiest.

Getoonde modellen

Totaal fouten

1585

Meest getroffen model

Mercury 2 17

Categorieën

In categorie Domeinspecifiek421 In categorie Anti-AI-trucs293 In categorie Programmeren259 In categorie Puzzeloplossing204 In categorie Algemene kennis172 In categorie Gecombineerd69 In categorie Algemene intelligentie62 In categorie Instructies opvolgen61 In categorie Gegevensparsering en extractie41 In categorie Toolaanroepen3

215/215

Rang	Model	Bedrijf	Verkeerd antwoord-aantal	Score	Totale kosten	Correcte tests	Responstijd (gem.)
#199	Elephant Alpha none	Openrouter	9	4.3	$0.000	5/21	1.22s
Totaal tests 21 Foute tests 16 Totale kosten $0.000 Responstijd (gem.) 1.22s
#200	GLM 4.7 Flash medium	Z.ai	9	4.3	$0.166	4/22	142.6s
Totaal tests 22 Foute tests 18 Totale kosten $0.166 Responstijd (gem.) 142.6s
#201	Elephant Alpha medium	Openrouter	9	4.3	$0.000	6/21	1.27s
Totaal tests 21 Foute tests 15 Totale kosten $0.000 Responstijd (gem.) 1.27s
#202	Hunter Alpha none	OpenRouter	9	4.2	$0.000	6/18	4.70s
Totaal tests 18 Foute tests 12 Totale kosten $0.000 Responstijd (gem.) 4.70s
#214	Nemotron 3 Nano Omni 30b A3b Reasoning none	NVIDIA	9	3.2	$0.000	2/19	728ms
Totaal tests 19 Foute tests 17 Totale kosten $0.000 Responstijd (gem.) 728ms
#216	LFM2-24B-A2B none	Liquid	9	2.2	$0.001	2/16	782ms
Totaal tests 16 Foute tests 14 Totale kosten $0.001 Responstijd (gem.) 782ms
#43	GPT-5.6 Terra medium	OpenAI	8	7.8	$0.676	14/22	7.11s
Totaal tests 22 Foute tests 8 Totale kosten $0.676 Responstijd (gem.) 7.11s
#54	GPT-5.6 Luna medium	OpenAI	8	7.6	$0.352	14/22	7.28s
Totaal tests 22 Foute tests 8 Totale kosten $0.352 Responstijd (gem.) 7.28s
#57	GPT-5.4 Nano medium	OpenAI	8	7.5	$0.138	12/22	13.2s
Totaal tests 22 Foute tests 10 Totale kosten $0.138 Responstijd (gem.) 13.2s
#59	GPT-5.6 Terra low	OpenAI	8	7.5	$0.519	13/22	5.31s
Totaal tests 22 Foute tests 9 Totale kosten $0.519 Responstijd (gem.) 5.31s
#71	Step 3.7 Flash low	Stepfun	8	7.3	$0.454	12/22	20.7s
Totaal tests 22 Foute tests 10 Totale kosten $0.454 Responstijd (gem.) 20.7s
#74	Qwen3.5 Plus 2026-04-20 medium	Qwen	8	7.2	$0.317	13/22	46.4s
Totaal tests 22 Foute tests 9 Totale kosten $0.317 Responstijd (gem.) 46.4s
#82	Mercury 2 medium	Inception	8	7.0	$0.093	10/22	2.72s
Totaal tests 22 Foute tests 12 Totale kosten $0.093 Responstijd (gem.) 2.72s
#86	DeepSeek V4 Pro none	DeepSeek	8	6.9	$0.096	10/22	11.6s
Totaal tests 22 Foute tests 12 Totale kosten $0.096 Responstijd (gem.) 11.6s
#89	Qwen3.6 Flash medium	Qwen	8	6.9	$0.738	12/22	44.7s
Totaal tests 22 Foute tests 10 Totale kosten $0.738 Responstijd (gem.) 44.7s

Verkeerd antwoord-fouten

Modellen filteren

Topmodellen op Verkeerd antwoord-aantal

Verkeerd antwoord-aantal vs Score

Topmodellen op Responstijd (gem.)