Foutenranglijst voor Verkeerd antwoord

Zie welke AI-modellen het vaakst tegen Verkeerd antwoord aanlopen, zodat je betrouwbaarheidsrisico's ziet voordat je kiest. Sorteren op: Responstijd (gem.) ↑.

Getoonde modellen

Totaal fouten

1585

Meest getroffen model

Nemotron 3 Nano Omni 30b A3b Reasoning 9

Categorieën

In categorie Domeinspecifiek421 In categorie Anti-AI-trucs293 In categorie Programmeren259 In categorie Puzzeloplossing204 In categorie Algemene kennis172 In categorie Gecombineerd69 In categorie Algemene intelligentie62 In categorie Instructies opvolgen61 In categorie Gegevensparsering en extractie41 In categorie Toolaanroepen3

215/215

Rang	Model	Bedrijf	Verkeerd antwoord-aantal	Score	Totale kosten	Correcte tests	Responstijd (gem.)
#127	gpt-oss-120b medium	OpenAI	9	6.1	$0.019	9/22	21.9s
Totaal tests 22 Foute tests 13 Totale kosten $0.019 Responstijd (gem.) 21.9s
#115	Mimo V2 PRO medium	Xiaomi	5	6.3	$0.333	12/21	22.2s
Totaal tests 21 Foute tests 9 Totale kosten $0.333 Responstijd (gem.) 22.2s
#24	GPT-5.2 medium	OpenAI	3	8.4	$0.951	14/22	22.6s
Totaal tests 22 Foute tests 8 Totale kosten $0.951 Responstijd (gem.) 22.6s
#53	GLM 5 Turbo medium	Z.ai	4	7.6	$0.323	14/21	23.0s
Totaal tests 21 Foute tests 7 Totale kosten $0.323 Responstijd (gem.) 23.0s
#98	GLM 5V Turbo medium	Z.ai	7	6.7	$0.457	11/21	23.1s
Totaal tests 21 Foute tests 10 Totale kosten $0.457 Responstijd (gem.) 23.1s
#21	GPT-5.4 medium	OpenAI	5	8.5	$1.533	15/22	23.1s
Totaal tests 22 Foute tests 7 Totale kosten $1.533 Responstijd (gem.) 23.1s
#42	GLM 5.2 medium	Z.ai	3	7.8	$0.187	15/21	23.3s
Totaal tests 21 Foute tests 6 Totale kosten $0.187 Responstijd (gem.) 23.3s
#191	Grok 4.1 Fast medium	X AI	4	4.7	$0.069	9/19	23.8s
Totaal tests 19 Foute tests 10 Totale kosten $0.069 Responstijd (gem.) 23.8s
#85	KAT-Coder-Pro V2.5 medium	Kwaipilot	9	6.9	$0.467	11/22	24.0s
Totaal tests 22 Foute tests 11 Totale kosten $0.467 Responstijd (gem.) 24.0s
#159	Hy3 preview low	Tencent	4	5.5	$0.015	10/21	24.6s
Totaal tests 21 Foute tests 11 Totale kosten $0.015 Responstijd (gem.) 24.6s
#19	Muse Spark 1.1 medium	Meta	4	8.6	$1.357	15/22	25.0s
Totaal tests 22 Foute tests 7 Totale kosten $1.357 Responstijd (gem.) 25.0s
#131	Qwen3.5-Flash none	Qwen	13	6.1	$0.073	8/22	25.3s
Totaal tests 22 Foute tests 14 Totale kosten $0.073 Responstijd (gem.) 25.3s
#97	KAT-Coder-Pro V2.5 none	Kwaipilot	10	6.7	$0.476	11/22	25.6s
Totaal tests 22 Foute tests 11 Totale kosten $0.476 Responstijd (gem.) 25.6s
#44	Claude Sonnet 4.6 medium	Anthropic	4	7.8	$2.057	14/22	25.9s
Totaal tests 22 Foute tests 8 Totale kosten $2.057 Responstijd (gem.) 25.9s
#60	GPT-5.4 Mini medium	OpenAI	6	7.5	$0.756	12/22	25.9s
Totaal tests 22 Foute tests 10 Totale kosten $0.756 Responstijd (gem.) 25.9s

←

1 9 10 11 15

→

Verkeerd antwoord-fouten

Modellen filteren

Topmodellen op Verkeerd antwoord-aantal

Verkeerd antwoord-aantal vs Score

Topmodellen op Responstijd (gem.)