Foutenranglijst voor Verkeerd antwoord

Zie welke AI-modellen het vaakst tegen Verkeerd antwoord aanlopen, zodat je betrouwbaarheidsrisico's ziet voordat je kiest. Sorteren op: Responstijd (gem.) ↓.

Getoonde modellen

Totaal fouten

1585

Meest getroffen model

Step 3.5 Flash 4

Categorieën

In categorie Domeinspecifiek421 In categorie Anti-AI-trucs293 In categorie Programmeren259 In categorie Puzzeloplossing204 In categorie Algemene kennis172 In categorie Gecombineerd69 In categorie Algemene intelligentie62 In categorie Instructies opvolgen61 In categorie Gegevensparsering en extractie41 In categorie Toolaanroepen3

215/215

Rang	Model	Bedrijf	Verkeerd antwoord-aantal	Score	Totale kosten	Correcte tests	Responstijd (gem.)
#89	Qwen3.6 Flash medium	Qwen	8	6.9	$0.738	12/22	44.7s
Totaal tests 22 Foute tests 10 Totale kosten $0.738 Responstijd (gem.) 44.7s
#41	Qwen3.6 Plus medium	Qwen	5	7.8	$0.405	15/22	43.1s
Totaal tests 22 Foute tests 7 Totale kosten $0.405 Responstijd (gem.) 43.1s
#178	MiniMax M2.7 medium	Minimax	6	5.0	$0.163	5/22	41.3s
Totaal tests 22 Foute tests 17 Totale kosten $0.163 Responstijd (gem.) 41.3s
#140	Mimo V2 Omni medium	Xiaomi	5	5.9	$0.683	10/21	41.2s
Totaal tests 21 Foute tests 11 Totale kosten $0.683 Responstijd (gem.) 41.2s
#11	Qwen3.7 Max medium	Qwen	3	9.2	$1.116	18/22	40.6s
Totaal tests 22 Foute tests 4 Totale kosten $1.116 Responstijd (gem.) 40.6s
#194	Cobuddy medium	Baidu	9	4.7	$0.000	7/21	39.9s
Totaal tests 21 Foute tests 14 Totale kosten $0.000 Responstijd (gem.) 39.9s
#215	Step 3.5 Flash none	Stepfun	1	2.3	$0.020	6/12	39.0s
Totaal tests 12 Foute tests 6 Totale kosten $0.020 Responstijd (gem.) 39.0s
#13	GPT-5.5 medium	OpenAI	4	9.0	$4.137	18/22	38.4s
Totaal tests 22 Foute tests 4 Totale kosten $4.137 Responstijd (gem.) 38.4s
#156	DeepSeek V4 Flash none	DeepSeek	12	5.6	$0.042	5/22	36.8s
Totaal tests 22 Foute tests 17 Totale kosten $0.042 Responstijd (gem.) 36.8s
#47	Claude Opus 4.6 medium	Anthropic	3	7.7	$3.059	13/22	34.3s
Totaal tests 22 Foute tests 9 Totale kosten $3.059 Responstijd (gem.) 34.3s
#88	MiMo-V2.5-Pro medium	Xiaomi	3	6.9	$0.187	12/22	33.9s
Totaal tests 22 Foute tests 10 Totale kosten $0.187 Responstijd (gem.) 33.9s
#46	GLM 5 medium	Z.ai	3	7.7	$0.307	15/21	33.5s
Totaal tests 21 Foute tests 6 Totale kosten $0.307 Responstijd (gem.) 33.5s
#55	Nemotron 3 Ultra medium	NVIDIA	7	7.5	$0.774	13/22	32.2s
Totaal tests 22 Foute tests 9 Totale kosten $0.774 Responstijd (gem.) 32.2s
#107	MiMo-V2.5 medium	Xiaomi	5	6.5	$0.082	12/22	32.2s
Totaal tests 22 Foute tests 10 Totale kosten $0.082 Responstijd (gem.) 32.2s
#30	Muse Spark 1.1 high	Meta	4	8.1	$1.694	12/22	31.5s
Totaal tests 22 Foute tests 10 Totale kosten $1.694 Responstijd (gem.) 31.5s

Verkeerd antwoord-fouten

Modellen filteren

Topmodellen op Verkeerd antwoord-aantal

Verkeerd antwoord-aantal vs Score

Topmodellen op Responstijd (gem.)