AI BENCHY Compare

Anthropic: Claude Opus 4.8 vs Qwen: Qwen3.5 Plus 2026-02-15

Last updated at: 2026-05-28

Metric	Claude Opus 4.8 Claude Opus 4.8 medium Release: 2026-05-28	Qwen3.5 Plus 2026-02-15 Qwen3.5 Plus 2026-02-15 medium Release: 2026-02-15

Metric	Claude Opus 4.8 Claude Opus 4.8 medium Release: 2026-05-28	Qwen3.5 Plus 2026-02-15 Qwen3.5 Plus 2026-02-15 medium Release: 2026-02-15
Score	8.7	8.1
Rank	#12	#22
Reliability	10.0	10.0
Consistency	9.6	8.8
Tests Correct
Attempt pass rate	83.3%	76.7%
Flaky tests	1	3
Total Runs	60	60
Cost per result	6.285	2.251
Total Cost	$1.006	$0.283
Input Price	$5.000 / 1M	$0.260 / 1M
Output Price	$25.000 / 1M	$1.560 / 1M
Output Tokens	23,201	2,145
Reasoning Tokens	5,901	172,563
Response Time (avg)	9.34s	67.58s
Response Time (max)	38.03s	266.69s
Response Time (total)	186.84s	878.57s

Top Models by Score

Score vs Total Cost

Response Time (avg)

Score vs Response Time (avg)

Total Output Tokens

Score vs Total Output Tokens

Category Breakdown

Anti-AI Tricks	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Claude Opus 4.8	10.0	10.0	100.0%	0		3.95s	1,179	478
Qwen3.5 Plus 2026-02-15	8.2	7.9	83.3%	1		45.78s	205	21,236

Coding	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Claude Opus 4.8	10.0	10.0	100.0%	0		14.97s	6,651	1,381
Qwen3.5 Plus 2026-02-15	7.6	6.7	66.7%	1		193.80s	406	63,554

Combined	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Claude Opus 4.8	9.8	10.0	100.0%	0		38.03s	5,260	1,588
Qwen3.5 Plus 2026-02-15	10.0	10.0	100.0%	0		46.85s	421	7,906

Data parsing and extraction	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Claude Opus 4.8	7.1	5.6	83.3%	1		12.29s	481	312
Qwen3.5 Plus 2026-02-15	10.0	10.0	100.0%	0		46.91s	270	14,916

Domain specific	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Claude Opus 4.8	5.3	10.0	33.3%	0		14.15s	7,477	900
Qwen3.5 Plus 2026-02-15	5.3	10.0	33.3%	0		17.50s	35	16,680

General Intelligence	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Claude Opus 4.8	10.0	10.0	100.0%	0		2.46s	237	0
Qwen3.5 Plus 2026-02-15	4.7	1.6	66.7%	1		79.86s	73	8,675

Instructions following	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Claude Opus 4.8	10.0	10.0	100.0%	0		3.32s	373	320
Qwen3.5 Plus 2026-02-15	10.0	10.0	100.0%	0		31.93s	101	7,704

Puzzle Solving	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Claude Opus 4.8	10.0	10.0	100.0%	0		3.95s	791	483
Qwen3.5 Plus 2026-02-15	10.0	10.0	100.0%	0		32.50s	301	13,853

Tool Calling	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Claude Opus 4.8	10.0	10.0	100.0%	0		8.96s	301	225
Qwen3.5 Plus 2026-02-15	10.0	10.0	100.0%	0		7.54s	309	909

Trivia	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Claude Opus 4.8	3.0	10.0	0.0%	0		6.14s	451	214
Qwen3.5 Plus 2026-02-15	3.0	10.0	0.0%	0		103.81s	24	17,130

Quick Compare

Switch Comparison Pair

Claude Opus 4.8mediumvsGemini 3 Flash Previewlow Gemini 3.5 FlashminimalvsQwen3.5 Plus 2026-02-15medium GPT-5.2 ChatnonevsQwen3.5 Plus 2026-02-15medium Claude Opus 4.8mediumvsGemini 3.5 Flashnone Claude Opus 4.8mediumvsGPT-5.5low Gemini 3 Flash PreviewnonevsQwen3.5 Plus 2026-02-15medium DeepSeek V4 FlashhighFree AvailablevsQwen3.5 Plus 2026-02-15medium Gemini 3.1 Flash Lite PreviewlowvsQwen3.5 Plus 2026-02-15medium Gemini 3 Flash PreviewlowvsQwen3.5 Plus 2026-02-15medium Gemini 3.1 Flash Lite PreviewnonevsQwen3.5 Plus 2026-02-15medium Claude Opus 4.8mediumvsGemini 3.5 Flashlow Gemini 3.1 Flash LitelowvsQwen3.5 Plus 2026-02-15medium