Foutenranglijst voor Verkeerd antwoord

Zie welke AI-modellen het vaakst tegen Verkeerd antwoord aanlopen, zodat je betrouwbaarheidsrisico's ziet voordat je kiest. Sorteren op: Correcte tests ↑.

Getoonde modellen

Totaal fouten

1585

Meest getroffen model

Granite 4.1 8B 13

Categorieën

In categorie Domeinspecifiek421 In categorie Anti-AI-trucs293 In categorie Programmeren259 In categorie Puzzeloplossing204 In categorie Algemene kennis172 In categorie Gecombineerd69 In categorie Algemene intelligentie62 In categorie Instructies opvolgen61 In categorie Gegevensparsering en extractie41 In categorie Toolaanroepen3

215/215

Rang	Model	Bedrijf	Verkeerd antwoord-aantal	Score	Totale kosten	Correcte tests	Responstijd (gem.)
#211	Laguna Xs.2 none	Poolside	8	3.8	$0.004	5/19	806ms
Totaal tests 19 Foute tests 14 Totale kosten $0.004 Responstijd (gem.) 806ms
#142	GPT-5.4 Mini none	OpenAI	13	5.9	$0.095	6/22	1.53s
Totaal tests 22 Foute tests 16 Totale kosten $0.095 Responstijd (gem.) 1.53s
#148	Qwen3.5-122B-A10B none	Qwen	13	5.7	$0.247	6/22	12.9s
Totaal tests 22 Foute tests 16 Totale kosten $0.247 Responstijd (gem.) 12.9s
#160	MiMo-V2.5-Pro none	Xiaomi	11	5.5	$0.068	6/22	4.12s
Totaal tests 22 Foute tests 16 Totale kosten $0.068 Responstijd (gem.) 4.12s
#161	Kimi K2.5 none	Moonshot AI	15	5.5	$0.127	6/22	19.2s
Totaal tests 22 Foute tests 16 Totale kosten $0.127 Responstijd (gem.) 19.2s
#165	GPT-5.6 Luna none	OpenAI	14	5.4	$0.142	6/22	1.50s
Totaal tests 22 Foute tests 16 Totale kosten $0.142 Responstijd (gem.) 1.50s
#170	Inkling none	Thinkingmachines	13	5.2	$0.147	6/22	3.50s
Totaal tests 22 Foute tests 16 Totale kosten $0.147 Responstijd (gem.) 3.50s
#179	DeepSeek V3.2 none	DeepSeek	7	5.0	$0.054	6/22	18.3s
Totaal tests 22 Foute tests 16 Totale kosten $0.054 Responstijd (gem.) 18.3s
#182	GLM 4.7 Flash none	Z.ai	13	4.9	$0.016	6/22	9.15s
Totaal tests 22 Foute tests 16 Totale kosten $0.016 Responstijd (gem.) 9.15s
#184	Ling-2.6-flash none	Inclusionai	9	4.9	$0.002	6/22	10.7s
Totaal tests 22 Foute tests 16 Totale kosten $0.002 Responstijd (gem.) 10.7s
#176	GLM 5 Turbo none	Z.ai	13	5.1	$0.047	6/21	2.82s
Totaal tests 21 Foute tests 15 Totale kosten $0.047 Responstijd (gem.) 2.82s
#201	Elephant Alpha medium	Openrouter	9	4.3	$0.000	6/21	1.27s
Totaal tests 21 Foute tests 15 Totale kosten $0.000 Responstijd (gem.) 1.27s
#204	Laguna Xs.2 medium	Poolside	6	4.1	$0.015	6/19	6.73s
Totaal tests 19 Foute tests 13 Totale kosten $0.015 Responstijd (gem.) 6.73s
#212	gpt-oss-120b none	OpenAI	8	3.7	$0.010	6/19	21.6s
Totaal tests 19 Foute tests 13 Totale kosten $0.010 Responstijd (gem.) 21.6s
#117	LongCat 2.0 none	Meituan	14	6.3	$0.044	7/22	5.18s
Totaal tests 22 Foute tests 15 Totale kosten $0.044 Responstijd (gem.) 5.18s

Verkeerd antwoord-fouten

Modellen filteren

Topmodellen op Verkeerd antwoord-aantal

Verkeerd antwoord-aantal vs Score

Topmodellen op Responstijd (gem.)