Foutenranglijst voor Verkeerd antwoord

Zie welke AI-modellen het vaakst tegen Verkeerd antwoord aanlopen, zodat je betrouwbaarheidsrisico's ziet voordat je kiest. Sorteren op: Correcte tests ↓.

Getoonde modellen

Totaal fouten

1558

Meest getroffen model

Gemini 3 Flash Preview 1

Categorieën

In categorie Domeinspecifiek412 In categorie Anti-AI-trucs293 In categorie Programmeren252 In categorie Puzzeloplossing201 In categorie Algemene kennis168 In categorie Gecombineerd68 In categorie Instructies opvolgen61 In categorie Algemene intelligentie59 In categorie Gegevensparsering en extractie41 In categorie Toolaanroepen3

209/209

Rang	Model	Bedrijf	Verkeerd antwoord-aantal	Score	Totale kosten	Correcte tests	Responstijd (gem.)
#28	Inkling high	Thinkingmachines	4	8.0	$1.006	15/22	64.2s
Totaal tests 22 Foute tests 7 Totale kosten $1.006 Responstijd (gem.) 64.2s
#32	Inkling medium	Thinkingmachines	4	8.0	$0.391	15/22	16.2s
Totaal tests 22 Foute tests 7 Totale kosten $0.391 Responstijd (gem.) 16.2s
#36	Qwen3.7 Plus medium	Qwen	5	7.9	$0.267	15/22	51.5s
Totaal tests 22 Foute tests 7 Totale kosten $0.267 Responstijd (gem.) 51.5s
#37	Qwen3.6 Plus medium	Qwen	5	7.8	$0.405	15/22	43.1s
Totaal tests 22 Foute tests 7 Totale kosten $0.405 Responstijd (gem.) 43.1s
#44	GPT-5.6 Luna high	OpenAI	7	7.7	$1.017	15/22	18.7s
Totaal tests 22 Foute tests 7 Totale kosten $1.017 Responstijd (gem.) 18.7s
#59	Qwen3.7 Max none	Qwen	7	7.4	$0.197	15/22	4.52s
Totaal tests 22 Foute tests 7 Totale kosten $0.197 Responstijd (gem.) 4.52s
#79	Gemini 3.5 Flash none	Google	3	7.0	$1.079	15/22	9.93s
Totaal tests 22 Foute tests 7 Totale kosten $1.079 Responstijd (gem.) 9.93s
#49	GLM 5 Turbo medium	Z.ai	4	7.6	$0.323	14/21	23.0s
Totaal tests 21 Foute tests 7 Totale kosten $0.323 Responstijd (gem.) 23.0s
#100	Hy3 preview medium	Tencent	3	6.5	$0.018	14/21	16.3s
Totaal tests 21 Foute tests 7 Totale kosten $0.018 Responstijd (gem.) 16.3s
#133	Gemini 3 PRO Preview medium	Google	3	6.0	$0.385	14/21	9.05s
Totaal tests 21 Foute tests 7 Totale kosten $0.385 Responstijd (gem.) 9.05s
#21	GPT-5.2 medium	OpenAI	3	8.4	$0.951	14/22	22.6s
Totaal tests 22 Foute tests 8 Totale kosten $0.951 Responstijd (gem.) 22.6s
#29	Step 3.7 Flash medium	Stepfun	5	8.0	$0.515	14/22	26.4s
Totaal tests 22 Foute tests 8 Totale kosten $0.515 Responstijd (gem.) 26.4s
#30	GPT-5.2 Chat none	OpenAI	6	8.0	$0.604	14/22	7.65s
Totaal tests 22 Foute tests 8 Totale kosten $0.604 Responstijd (gem.) 7.65s
#31	GLM 5.2 high	Z.ai	3	8.0	$0.970	14/22	62.7s
Totaal tests 22 Foute tests 8 Totale kosten $0.970 Responstijd (gem.) 62.7s
#34	GPT-5.6 Terra high	OpenAI	7	8.0	$1.055	14/22	11.3s
Totaal tests 22 Foute tests 8 Totale kosten $1.055 Responstijd (gem.) 11.3s

Verkeerd antwoord-fouten

Modellen filteren

Topmodellen op Verkeerd antwoord-aantal

Verkeerd antwoord-aantal vs Score

Topmodellen op Responstijd (gem.)