Foutenranglijst voor Verkeerd antwoord

Zie welke AI-modellen het vaakst tegen Verkeerd antwoord aanlopen, zodat je betrouwbaarheidsrisico's ziet voordat je kiest. Sorteren op: Score ↑.

Getoonde modellen

Totaal fouten

1585

Meest getroffen model

LFM2-24B-A2B 9

Categorieën

In categorie Domeinspecifiek421 In categorie Anti-AI-trucs293 In categorie Programmeren259 In categorie Puzzeloplossing204 In categorie Algemene kennis172 In categorie Gecombineerd69 In categorie Algemene intelligentie62 In categorie Instructies opvolgen61 In categorie Gegevensparsering en extractie41 In categorie Toolaanroepen3

215/215

Rang	Model	Bedrijf	Verkeerd antwoord-aantal	Score	Totale kosten	Correcte tests	Responstijd (gem.)
#66	KAT-Coder-Pro V2.5 low	Kwaipilot	10	7.4	$0.387	11/22	19.5s
Totaal tests 22 Foute tests 11 Totale kosten $0.387 Responstijd (gem.) 19.5s
#65	Gemini 3 Flash Preview low	Google	6	7.4	$0.177	16/22	6.28s
Totaal tests 22 Foute tests 6 Totale kosten $0.177 Responstijd (gem.) 6.28s
#64	LongCat 2.0 medium	Meituan	7	7.4	$0.478	12/22	136.6s
Totaal tests 22 Foute tests 10 Totale kosten $0.478 Responstijd (gem.) 136.6s
#63	Qwen3.7 Max none	Qwen	7	7.4	$0.197	15/22	4.52s
Totaal tests 22 Foute tests 7 Totale kosten $0.197 Responstijd (gem.) 4.52s
#62	Qwen3.5-27B medium	Qwen	4	7.4	$1.627	13/22	111.9s
Totaal tests 22 Foute tests 9 Totale kosten $1.627 Responstijd (gem.) 111.9s
#61	Qwen3.5 Plus 2026-02-15 medium	Qwen	4	7.5	$0.437	14/22	89.2s
Totaal tests 22 Foute tests 8 Totale kosten $0.437 Responstijd (gem.) 89.2s
#60	GPT-5.4 Mini medium	OpenAI	6	7.5	$0.756	12/22	25.9s
Totaal tests 22 Foute tests 10 Totale kosten $0.756 Responstijd (gem.) 25.9s
#59	GPT-5.6 Terra low	OpenAI	8	7.5	$0.519	13/22	5.31s
Totaal tests 22 Foute tests 9 Totale kosten $0.519 Responstijd (gem.) 5.31s
#58	GPT-5.3 Chat none	OpenAI	7	7.5	$0.571	13/22	6.88s
Totaal tests 22 Foute tests 9 Totale kosten $0.571 Responstijd (gem.) 6.88s
#57	GPT-5.4 Nano medium	OpenAI	8	7.5	$0.138	12/22	13.2s
Totaal tests 22 Foute tests 10 Totale kosten $0.138 Responstijd (gem.) 13.2s
#56	Kimi K2.7 Code medium	Moonshot AI	5	7.5	$0.740	12/22	84.2s
Totaal tests 22 Foute tests 10 Totale kosten $0.740 Responstijd (gem.) 84.2s
#55	Nemotron 3 Ultra medium	NVIDIA	7	7.5	$0.774	13/22	32.2s
Totaal tests 22 Foute tests 9 Totale kosten $0.774 Responstijd (gem.) 32.2s
#54	GPT-5.6 Luna medium	OpenAI	8	7.6	$0.352	14/22	7.28s
Totaal tests 22 Foute tests 8 Totale kosten $0.352 Responstijd (gem.) 7.28s
#53	GLM 5 Turbo medium	Z.ai	4	7.6	$0.323	14/21	23.0s
Totaal tests 21 Foute tests 7 Totale kosten $0.323 Responstijd (gem.) 23.0s
#52	Grok Build 0.1 medium	X AI	5	7.6	$1.097	14/22	52.1s
Totaal tests 22 Foute tests 8 Totale kosten $1.097 Responstijd (gem.) 52.1s

Verkeerd antwoord-fouten

Modellen filteren

Topmodellen op Verkeerd antwoord-aantal

Verkeerd antwoord-aantal vs Score

Topmodellen op Responstijd (gem.)