AI BENCHY Compare

Anthropic: Claude Opus 4.8 vs Qwen: Qwen3.5 Plus 2026-02-15

Benchmark-urile au fost generate din suitele de teste AI BENCHY la: 2026-05-28

Metrică	Claude Opus 4.8 Claude Opus 4.8 medium Lansare: 2026-05-28	Qwen3.5 Plus 2026-02-15 Qwen3.5 Plus 2026-02-15 medium Lansare: 2026-02-15

Metrică	Claude Opus 4.8 Claude Opus 4.8 medium Lansare: 2026-05-28	Qwen3.5 Plus 2026-02-15 Qwen3.5 Plus 2026-02-15 medium Lansare: 2026-02-15
Scor	8.7	8.1
Rang	#12	#22
Fiabilitate	10.0	10.0
Consistență	9.6	8.8
Teste corecte
Rată de trecere pe încercare	83.3%	76.7%
Teste instabile	1	3
Rulări totale	60	60
Cost per rezultat	6.285	2.251
Cost total	$1.006	$0.283
Preț de intrare	$5.000 / 1M	$0.260 / 1M
Preț de ieșire	$25.000 / 1M	$1.560 / 1M
Tokenuri de ieșire	23,201	2,145
Tokenuri de raționament	5,901	172,563
Timp de răspuns (mediu)	9.34s	67.58s
Timp de răspuns (maxim)	38.03s	266.69s
Timp de răspuns (total)	186.84s	878.57s

Top modele după scor

Scor vs cost total

Timp de răspuns (mediu)

Scor vs Timp de răspuns (mediu)

Total tokenuri de ieșire

Scor vs Total tokenuri de ieșire

Defalcare pe categorii

Trucuri anti-AI	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
Claude Opus 4.8	10.0	10.0	100.0%	0		3.95s	1,179	478
Qwen3.5 Plus 2026-02-15	8.2	7.9	83.3%	1		45.78s	205	21,236

Programare	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
Claude Opus 4.8	10.0	10.0	100.0%	0		14.97s	6,651	1,381
Qwen3.5 Plus 2026-02-15	7.6	6.7	66.7%	1		193.80s	406	63,554

Combinat	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
Claude Opus 4.8	9.8	10.0	100.0%	0		38.03s	5,260	1,588
Qwen3.5 Plus 2026-02-15	10.0	10.0	100.0%	0		46.85s	421	7,906

Parsare și extragere de date	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
Claude Opus 4.8	7.1	5.6	83.3%	1		12.29s	481	312
Qwen3.5 Plus 2026-02-15	10.0	10.0	100.0%	0		46.91s	270	14,916

Specific domeniului	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
Claude Opus 4.8	5.3	10.0	33.3%	0		14.15s	7,477	900
Qwen3.5 Plus 2026-02-15	5.3	10.0	33.3%	0		17.50s	35	16,680

Inteligență generală	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
Claude Opus 4.8	10.0	10.0	100.0%	0		2.46s	237	0
Qwen3.5 Plus 2026-02-15	4.7	1.6	66.7%	1		79.86s	73	8,675

Respectarea instrucțiunilor	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
Claude Opus 4.8	10.0	10.0	100.0%	0		3.32s	373	320
Qwen3.5 Plus 2026-02-15	10.0	10.0	100.0%	0		31.93s	101	7,704

Rezolvare de puzzle-uri	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
Claude Opus 4.8	10.0	10.0	100.0%	0		3.95s	791	483
Qwen3.5 Plus 2026-02-15	10.0	10.0	100.0%	0		32.50s	301	13,853

Apelare instrumente	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
Claude Opus 4.8	10.0	10.0	100.0%	0		8.96s	301	225
Qwen3.5 Plus 2026-02-15	10.0	10.0	100.0%	0		7.54s	309	909

Cultură generală	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
Claude Opus 4.8	3.0	10.0	0.0%	0		6.14s	451	214
Qwen3.5 Plus 2026-02-15	3.0	10.0	0.0%	0		103.81s	24	17,130

Comparație rapidă

Schimbă perechea de comparație

Claude Opus 4.8mediumvsGemini 3 Flash Previewlow Gemini 3.5 FlashminimalvsQwen3.5 Plus 2026-02-15medium GPT-5.2 ChatnonevsQwen3.5 Plus 2026-02-15medium Claude Opus 4.8mediumvsGemini 3.5 Flashnone Claude Opus 4.8mediumvsGPT-5.5low Gemini 3 Flash PreviewnonevsQwen3.5 Plus 2026-02-15medium DeepSeek V4 FlashhighDisponibil gratuitvsQwen3.5 Plus 2026-02-15medium Gemini 3.1 Flash Lite PreviewlowvsQwen3.5 Plus 2026-02-15medium Gemini 3 Flash PreviewlowvsQwen3.5 Plus 2026-02-15medium Gemini 3.1 Flash Lite PreviewnonevsQwen3.5 Plus 2026-02-15medium Claude Opus 4.8mediumvsGemini 3.5 Flashlow Gemini 3.1 Flash LitelowvsQwen3.5 Plus 2026-02-15medium