Vergelijken Grafieken Methodologie

Taal:

❤️ Made by XCS

AI BENCHY Compare

OpenAI: GPT-5.4 vs Qwen: Qwen3.5-122B-A10B

Vergelijken:

Benchmarks gegenereerd uit AI BENCHY-testsuites op: 2026-03-06

Metriek	OpenAI: GPT-5.4 medium Releasedatum: 2026-03-05	Qwen: Qwen3.5-122B-A10B medium Releasedatum: 2026-02-24
Gem. score	8.2	8.2
Rang	#7	#6
Correcte tests
Consistentie	8.9	9.4
Kosten per resultaat	6.533	3.962
Totale kosten	$0.784	$0.476
Slaagpercentage per poging	86.7%	82.2%
Instabiele tests	2	1
common.totalRuns	45 (15 x 3)	45 (15 x 3)
Uitvoer-tokens	1,611	17,226
Redeneer-tokens	46,321	138,033
Responstijd (gem.)	21.06s	29.45s
Responstijd (max)	100.41s	119.29s
Responstijd (totaal)	315.95s	441.71s

Topmodellen op score

Score vs totale kosten

Responstijd (gem.)

Gem. score vs Responstijd (gem.)

Categorie-uitsplitsing

Anti-AI-trucs	Score	Consistentie	Slaagpercentage per poging	Instabiele tests	Correcte tests	Responstijd (gem.)	Uitvoer-tokens	Redeneer-tokens
OpenAI: GPT-5.4	10.0	10.0	100.0%	0		5.02s	216	1,466
Qwen: Qwen3.5-122B-A10B	10.0	10.0	100.0%	0		6.99s	248	10,486

Gecombineerd	Score	Consistentie	Slaagpercentage per poging	Instabiele tests	Correcte tests	Responstijd (gem.)	Uitvoer-tokens	Redeneer-tokens
OpenAI: GPT-5.4	10.0	10.0	100.0%	0		20.57s	301	3,543
Qwen: Qwen3.5-122B-A10B	10.0	10.0	100.0%	0		107.79s	483	11,337

Gegevensparsering en extractie	Score	Consistentie	Slaagpercentage per poging	Instabiele tests	Correcte tests	Responstijd (gem.)	Uitvoer-tokens	Redeneer-tokens
OpenAI: GPT-5.4	9.9	10.0	100.0%	0		5.32s	234	804
Qwen: Qwen3.5-122B-A10B	9.9	10.0	100.0%	0		23.41s	270	16,558

Domeinspecifiek	Score	Consistentie	Slaagpercentage per poging	Instabiele tests	Correcte tests	Responstijd (gem.)	Uitvoer-tokens	Redeneer-tokens
OpenAI: GPT-5.4	4.0	7.2	44.4%	1		74.27s	61	34,748
Qwen: Qwen3.5-122B-A10B	10.0	7.2	11.1%	1		63.40s	15,537	64,889

Instructies opvolgen	Score	Consistentie	Slaagpercentage per poging	Instabiele tests	Correcte tests	Responstijd (gem.)	Uitvoer-tokens	Redeneer-tokens
OpenAI: GPT-5.4	10.0	10.0	100.0%	0		3.11s	93	897
Qwen: Qwen3.5-122B-A10B	10.0	10.0	100.0%	0		9.88s	77	7,372

Puzzle Solving	Score	Consistentie	Slaagpercentage per poging	Instabiele tests	Correcte tests	Responstijd (gem.)	Uitvoer-tokens	Redeneer-tokens
OpenAI: GPT-5.4	7.0	7.2	88.9%	1		9.13s	442	3,832
Qwen: Qwen3.5-122B-A10B	10.0	10.0	100.0%	0		17.18s	289	26,165

Toolaanroepen	Score	Consistentie	Slaagpercentage per poging	Instabiele tests	Correcte tests	Responstijd (gem.)	Uitvoer-tokens	Redeneer-tokens
OpenAI: GPT-5.4	10.0	10.0	100.0%	0		13.28s	264	1,031
Qwen: Qwen3.5-122B-A10B	10.0	10.0	100.0%	0		4.60s	322	1,226

Snelle vergelijking

Vergelijkingspaar wisselen

Gemini 3 Flash PreviewlowvsGPT-5.4medium Gemini 3 Flash PreviewlowvsQwen3.5-122B-A10Bmedium Gemini 3.1 Flash Lite PreviewhighvsGPT-5.4medium Gemini 3.1 Flash Lite PreviewhighvsQwen3.5-122B-A10Bmedium GPT-5.2 ChatnonevsQwen3.5-122B-A10Bmedium Gemini 3.1 Flash Lite PreviewlowvsGPT-5.4medium Gemini 3.1 Flash Lite PreviewlowvsQwen3.5-122B-A10Bmedium GPT-5.3 ChatnonevsQwen3.5-122B-A10Bmedium Gemini 3.1 Flash Lite PreviewnonevsGPT-5.4medium Gemini 3.1 Flash Lite PreviewnonevsQwen3.5-122B-A10Bmedium Gemini 3 Flash PreviewnonevsGPT-5.4medium Gemini 3 Flash PreviewnonevsQwen3.5-122B-A10Bmedium