Foutenranglijst voor Verkeerd antwoord

Zie welke AI-modellen het vaakst tegen Verkeerd antwoord aanlopen, zodat je betrouwbaarheidsrisico's ziet voordat je kiest. Sorteren op: Score ↓.

Getoonde modellen

Totaal fouten

1585

Meest getroffen model

Gemini 3.6 Flash 1

Categorieën

In categorie Domeinspecifiek421 In categorie Anti-AI-trucs293 In categorie Programmeren259 In categorie Puzzeloplossing204 In categorie Algemene kennis172 In categorie Gecombineerd69 In categorie Algemene intelligentie62 In categorie Instructies opvolgen61 In categorie Gegevensparsering en extractie41 In categorie Toolaanroepen3

215/215

Rang	Model	Bedrijf	Verkeerd antwoord-aantal	Score	Totale kosten	Correcte tests	Responstijd (gem.)
#122	Seed-2.0-Lite none	Bytedance Seed	13	6.2	$0.066	8/22	4.40s
Totaal tests 22 Foute tests 14 Totale kosten $0.066 Responstijd (gem.) 4.40s
#123	GPT-5.6 Luna low	OpenAI	10	6.2	$0.249	10/22	5.04s
Totaal tests 22 Foute tests 12 Totale kosten $0.249 Responstijd (gem.) 5.04s
#124	Gemini 2.5 Flash none	Google	12	6.2	$0.017	9/22	6.20s
Totaal tests 22 Foute tests 13 Totale kosten $0.017 Responstijd (gem.) 6.20s
#125	Qwen3.5-35B-A3B medium	Qwen	2	6.2	$0.837	11/22	112.5s
Totaal tests 22 Foute tests 11 Totale kosten $0.837 Responstijd (gem.) 112.5s
#126	Gemini 3.1 Flash Lite minimal	Google	8	6.1	$0.047	10/22	1.86s
Totaal tests 22 Foute tests 12 Totale kosten $0.047 Responstijd (gem.) 1.86s
#127	gpt-oss-120b medium	OpenAI	9	6.1	$0.019	9/22	21.9s
Totaal tests 22 Foute tests 13 Totale kosten $0.019 Responstijd (gem.) 21.9s
#128	Gemini 3.1 Flash Lite none	Google	11	6.1	$0.046	9/22	1.75s
Totaal tests 22 Foute tests 13 Totale kosten $0.046 Responstijd (gem.) 1.75s
#129	Inkling low	Thinkingmachines	8	6.1	$0.187	10/22	5.15s
Totaal tests 22 Foute tests 12 Totale kosten $0.187 Responstijd (gem.) 5.15s
#130	Qwen3.6 Flash none	Qwen	12	6.1	$0.062	7/22	3.74s
Totaal tests 22 Foute tests 15 Totale kosten $0.062 Responstijd (gem.) 3.74s
#131	Qwen3.5-Flash none	Qwen	13	6.1	$0.073	8/22	25.3s
Totaal tests 22 Foute tests 14 Totale kosten $0.073 Responstijd (gem.) 25.3s
#132	Qwen3.5 Plus 2026-04-20 none	Qwen	12	6.1	$0.122	8/22	13.6s
Totaal tests 22 Foute tests 14 Totale kosten $0.122 Responstijd (gem.) 13.6s
#133	Qwen3.5-35B-A3B none	Qwen	12	6.1	$0.106	7/22	12.7s
Totaal tests 22 Foute tests 15 Totale kosten $0.106 Responstijd (gem.) 12.7s
#134	GPT-5 Nano medium	OpenAI	9	6.1	$0.114	9/22	54.9s
Totaal tests 22 Foute tests 13 Totale kosten $0.114 Responstijd (gem.) 54.9s
#135	Nemotron 3 Ultra none	NVIDIA	12	6.1	$0.095	8/22	3.87s
Totaal tests 22 Foute tests 14 Totale kosten $0.095 Responstijd (gem.) 3.87s
#136	Step 3.5 Flash medium	Stepfun	4	6.0	$0.108	11/21	174.2s
Totaal tests 21 Foute tests 10 Totale kosten $0.108 Responstijd (gem.) 174.2s

Verkeerd antwoord-fouten

Modellen filteren

Topmodellen op Verkeerd antwoord-aantal

Verkeerd antwoord-aantal vs Score

Topmodellen op Responstijd (gem.)