Foutenranglijst voor Verkeerd antwoord

Zie welke AI-modellen het vaakst tegen Verkeerd antwoord aanlopen, zodat je betrouwbaarheidsrisico's ziet voordat je kiest. Sorteren op: Score ↓.

Getoonde modellen

Totaal fouten

1558

Meest getroffen model

Gemini 3 Flash Preview 1

Categorieën

In categorie Domeinspecifiek412 In categorie Anti-AI-trucs293 In categorie Programmeren252 In categorie Puzzeloplossing201 In categorie Algemene kennis168 In categorie Gecombineerd68 In categorie Instructies opvolgen61 In categorie Algemene intelligentie59 In categorie Gegevensparsering en extractie41 In categorie Toolaanroepen3

209/209

Rang	Model	Bedrijf	Verkeerd antwoord-aantal	Score	Totale kosten	Correcte tests	Responstijd (gem.)
#16	Muse Spark 1.1 medium	Meta	4	8.6	$1.357	15/22	25.0s
Totaal tests 22 Foute tests 7 Totale kosten $1.357 Responstijd (gem.) 25.0s
#17	Claude Fable 5 medium	Anthropic	2	8.6	$3.478	17/22	17.2s
Totaal tests 22 Foute tests 5 Totale kosten $3.478 Responstijd (gem.) 17.2s
#18	GPT-5.4 medium	OpenAI	5	8.5	$1.533	15/22	23.1s
Totaal tests 22 Foute tests 7 Totale kosten $1.533 Responstijd (gem.) 23.1s
#19	Qwen3.6 Max Preview medium	Qwen	5	8.4	$1.143	16/22	67.5s
Totaal tests 22 Foute tests 6 Totale kosten $1.143 Responstijd (gem.) 67.5s
#20	Grok 4.5 low	X AI	6	8.4	$0.935	16/22	15.6s
Totaal tests 22 Foute tests 6 Totale kosten $0.935 Responstijd (gem.) 15.6s
#21	GPT-5.2 medium	OpenAI	3	8.4	$0.951	14/22	22.6s
Totaal tests 22 Foute tests 8 Totale kosten $0.951 Responstijd (gem.) 22.6s
#22	Grok 4.5 medium	X AI	6	8.3	$1.928	16/22	61.7s
Totaal tests 22 Foute tests 6 Totale kosten $1.928 Responstijd (gem.) 61.7s
#23	Claude Sonnet 5 medium	Anthropic	4	8.3	$0.922	16/22	12.5s
Totaal tests 22 Foute tests 6 Totale kosten $0.922 Responstijd (gem.) 12.5s
#24	Muse Spark 1.1 low	Meta	6	8.3	$0.647	13/22	11.5s
Totaal tests 22 Foute tests 9 Totale kosten $0.647 Responstijd (gem.) 11.5s
#25	Gemini 2.5 Flash medium	Google	6	8.2	$0.643	15/22	21.2s
Totaal tests 22 Foute tests 7 Totale kosten $0.643 Responstijd (gem.) 21.2s
#26	GPT-5 Mini medium	OpenAI	5	8.1	$0.237	12/22	27.6s
Totaal tests 22 Foute tests 10 Totale kosten $0.237 Responstijd (gem.) 27.6s
#27	Muse Spark 1.1 high	Meta	4	8.1	$1.694	12/22	31.5s
Totaal tests 22 Foute tests 10 Totale kosten $1.694 Responstijd (gem.) 31.5s
#28	Inkling high	Thinkingmachines	4	8.0	$1.006	15/22	64.2s
Totaal tests 22 Foute tests 7 Totale kosten $1.006 Responstijd (gem.) 64.2s
#29	Step 3.7 Flash medium	Stepfun	5	8.0	$0.515	14/22	26.4s
Totaal tests 22 Foute tests 8 Totale kosten $0.515 Responstijd (gem.) 26.4s
#30	GPT-5.2 Chat none	OpenAI	6	8.0	$0.604	14/22	7.65s
Totaal tests 22 Foute tests 8 Totale kosten $0.604 Responstijd (gem.) 7.65s

Verkeerd antwoord-fouten

Modellen filteren

Topmodellen op Verkeerd antwoord-aantal

Verkeerd antwoord-aantal vs Score

Topmodellen op Responstijd (gem.)