AI BENCHY Compare

Inception: Mercury 2 vs Qwen: Qwen3.5-9B

Benchmark-urile au fost generate din suitele de teste AI BENCHY la: 2026-03-12

Metrică	Mercury 2 Mercury 2 none Lansare: 2026-02-24	Qwen3.5-9B Qwen3.5-9B none Lansare: 2026-03-02

Metrică	Mercury 2 Mercury 2 none Lansare: 2026-02-24	Qwen3.5-9B Qwen3.5-9B none Lansare: 2026-03-02
Rang	#61	#60
Scor mediu	3.4	3.4
Consistență	9.0	10.0
Cost per rezultat	0.153	0.111
Cost total	$0.007	$0.005
Teste corecte
Rată de trecere pe încercare	31.3%	25.0%
Teste instabile	2	0
Rulări totale	48	48
Tokenuri de ieșire	1,303	2,939
Tokenuri de raționament	0	0
Timp de răspuns (mediu)	596ms	1.06s
Timp de răspuns (maxim)	1.27s	5.91s
Timp de răspuns (total)	9.54s	16.95s

Top modele după scor

Scor vs cost total

Timp de răspuns (mediu)

Scor mediu vs Timp de răspuns (mediu)

Total tokenuri de ieșire

Scor mediu vs Total tokenuri de ieșire

Defalcare pe categorii

Trucuri anti-AI	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
Mercury 2	10.0	10.0	0.0%	0		466ms	274	0
Qwen3.5-9B	10.0	9.9	0.0%	0		1.02s	576	0

Combinat	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
Mercury 2	10.0	10.0	0.0%	0		606ms	131	0
Qwen3.5-9B	10.0	10.0	0.0%	0		5.91s	1,255	0

Parsare și extragere de date	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
Mercury 2	5.5	5.9	83.3%	1		667ms	180	0
Qwen3.5-9B	9.9	10.0	100.0%	0		847ms	249	0

Specific domeniului	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
Mercury 2	4.0	7.2	44.4%	1		534ms	46	0
Qwen3.5-9B	10.0	10.0	0.0%	0		464ms	24	0

Inteligență generală	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
Mercury 2	4.0	10.0	0.0%	0		628ms	159	0
Qwen3.5-9B	3.0	9.9	0.0%	0		552ms	99	0

Respectarea instrucțiunilor	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
Mercury 2	5.5	10.0	50.0%	0		551ms	82	0
Qwen3.5-9B	5.5	10.0	50.0%	0		514ms	75	0

Puzzle Solving	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
Mercury 2	10.0	10.0	0.0%	0		533ms	234	0
Qwen3.5-9B	10.0	9.9	0.0%	0		683ms	388	0

Apelare instrumente	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
Mercury 2	10.0	10.0	100.0%	0		1.27s	197	0
Qwen3.5-9B	10.0	10.0	100.0%	0		1.27s	273	0

Comparație rapidă

Schimbă perechea de comparație

Mercury 2nonevsQwen3 Coder Nextmedium Mercury 2nonevsGLM 4.7 Flashmedium Qwen3.5-9BnonevsGLM 4.7 Flashmedium Mercury 2nonevsQwen3.5-9Bmedium MiniMax M2.5mediumvsQwen3.5-9Bnone Mercury 2nonevsMiniMax M2.5medium Qwen3.5-9BnonevsGrok 4.20 Multi-Agent Betamedium Mercury 2nonevsGrok 4.20 Multi-Agent Betamedium gpt-oss-120bmediumDisponibil gratuitvsQwen3.5-9Bnone Mercury 2nonevsgpt-oss-120bmediumDisponibil gratuit Mercury 2mediumvsQwen3.5-9Bnone GPT-5 NanomediumvsQwen3.5-9Bnone