AI BENCHY Compare

Qwen: Qwen3.6 Max Preview vs xAI: Grok 4.3

Benchmark-urile au fost generate din suitele de teste AI BENCHY la: 2026-05-07

Metrică	Qwen3.6 Max Preview Qwen3.6 Max Preview medium Lansare: 2026-04-20	Grok 4.3 Grok 4.3 medium Lansare: 2026-05-01

Metrică	Qwen3.6 Max Preview Qwen3.6 Max Preview medium Lansare: 2026-04-20	Grok 4.3 Grok 4.3 medium Lansare: 2026-05-01
Scor	8.8	8.2
Rang	#8	#21
Fiabilitate	10.0	10.0
Consistență	9.5	8.6
Teste corecte
Rată de trecere pe încercare	85.2%	81.5%
Teste instabile	1	3
Rulări totale	54	54
Cost per rezultat	5.486	3.974
Cost total	$0.823	$0.517
Preț de intrare	$1.040 / 1M	$1.250 / 1M
Preț de ieșire	$6.240 / 1M	$2.500 / 1M
Tokenuri de ieșire	2,158	1,223
Tokenuri de raționament	97,495	187,047
Timp de răspuns (mediu)	48.31s	48.63s
Timp de răspuns (maxim)	186.74s	216.69s
Timp de răspuns (total)	869.64s	875.27s

Top modele după scor

Scor vs cost total

Timp de răspuns (mediu)

Scor vs Timp de răspuns (mediu)

Total tokenuri de ieșire

Scor vs Total tokenuri de ieșire

Defalcare pe categorii

Trucuri anti-AI	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
Qwen3.6 Max Preview	10.0	10.0	100.0%	0		22.13s	228	10,075
Grok 4.3	10.0	10.0	100.0%	0		8.83s	88	8,207

Programare	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
Qwen3.6 Max Preview	10.0	10.0	100.0%	0		117.87s	368	13,790
Grok 4.3	10.0	10.0	100.0%	0		45.72s	284	9,659

Combinat	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
Qwen3.6 Max Preview	10.0	10.0	100.0%	0		121.49s	390	14,575
Grok 4.3	10.0	10.0	100.0%	0		63.99s	234	15,301

Parsare și extragere de date	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
Qwen3.6 Max Preview	10.0	10.0	100.0%	0		41.15s	270	10,106
Grok 4.3	10.0	10.0	100.0%	0		18.97s	180	9,546

Specific domeniului	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
Qwen3.6 Max Preview	2.9	7.2	11.1%	1		95.91s	60	30,371
Grok 4.3	5.3	7.2	44.4%	1		181.74s	14	111,300

Inteligență generală	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
Qwen3.6 Max Preview	10.0	10.0	100.0%	0		32.24s	129	3,510
Grok 4.3	5.4	2.5	66.7%	1		24.70s	70	5,020

Respectarea instrucțiunilor	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
Qwen3.6 Max Preview	10.0	10.0	100.0%	0		24.31s	103	5,848
Grok 4.3	9.8	10.0	100.0%	0		18.58s	57	8,713

Rezolvare de puzzle-uri	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
Qwen3.6 Max Preview	10.0	10.0	100.0%	0		24.19s	301	7,649
Grok 4.3	5.9	7.2	55.6%	1		22.53s	128	14,686

Apelare instrumente	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
Qwen3.6 Max Preview	10.0	10.0	100.0%	0		18.32s	309	1,571
Grok 4.3	10.0	10.0	100.0%	0		17.66s	168	4,615

Comparație rapidă

Schimbă perechea de comparație

Gemini 3 Flash PreviewlowvsQwen3.6 Max Previewmedium HY3 PreviewlowDisponibil gratuitvsGrok 4.3medium Gemini 3 Flash PreviewnonevsGrok 4.3medium Gemini 3.1 Flash Lite PreviewlowvsGrok 4.3medium Qwen3.6 Max PreviewmediumvsHY3 PreviewhighDisponibil gratuit GPT-5.2 ChatnonevsGrok 4.3medium Gemini 3.1 Flash Lite PreviewnonevsGrok 4.3medium Claude Opus 4.7nonevsQwen3.6 Max Previewmedium GPT-5.3 ChatnonevsGrok 4.3medium HY3 PreviewhighDisponibil gratuitvsGrok 4.3medium DeepSeek V4 FlashhighvsGrok 4.3medium GPT-5.5lowvsQwen3.6 Max Previewmedium