AI BENCHY Compare

Anthropic: Claude Opus 4.7 vs Qwen: Qwen3.6 35B A3B

Last updated at: 2026-04-27

Metric	Claude Opus 4.7 Claude Opus 4.7 medium Release: 2026-04-16	Qwen3.6 35B A3B Qwen3.6 35B A3B none Release: 2026-04-20

Metric	Claude Opus 4.7 Claude Opus 4.7 medium Release: 2026-04-16	Qwen3.6 35B A3B Qwen3.6 35B A3B none Release: 2026-04-20
Score	9.2	5.1
Rank	#3	#112
Reliability	N/A	10.0
Consistency	10.0	7.4
Tests Correct
Attempt pass rate	88.9%	39.6%
Flaky tests	0	5
Total Runs	54	54
Cost per result	2.790	0.471
Total Cost	$0.447	$0.019
Input Price	$5.000 / 1M	$0.162 / 1M
Output Price	$25.000 / 1M	$0.966 / 1M
Output Tokens	5,375	17,503
Reasoning Tokens	1,341	0
Response Time (avg)	3.53s	2.87s
Response Time (max)	21.45s	12.46s
Response Time (total)	60.03s	46.00s

Top Models by Score

Score vs Total Cost

Response Time (avg)

Score vs Response Time (avg)

Total Output Tokens

Score vs Total Output Tokens

Category Breakdown

Anti-AI Tricks	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Claude Opus 4.7	8.3	10.0	75.0%	0		1.85s	348	0
Qwen3.6 35B A3B	3.6	7.6	16.7%	1		2.10s	1,571	0

Coding	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Claude Opus 4.7	10.0	10.0	100.0%	0		6.41s	1,141	257
Qwen3.6 35B A3B	10.0	10.0	100.0%	0		2.05s	921	0

Combined	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Claude Opus 4.7	10.0	10.0	100.0%	0		21.45s	2,369	1,084
Qwen3.6 35B A3B	0.0	0.0	0.0%	0		0ms	0	0

Data parsing and extraction	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Claude Opus 4.7	10.0	10.0	100.0%	0		2.37s	324	0
Qwen3.6 35B A3B	10.0	10.0	100.0%	0		1.46s	248	0

Domain specific	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Claude Opus 4.7	7.7	10.0	66.7%	0		1.17s	51	0
Qwen3.6 35B A3B	3.5	4.4	33.3%	2		7.45s	11,381	0

General Intelligence	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Claude Opus 4.7	10.0	10.0	100.0%	0		2.87s	256	0
Qwen3.6 35B A3B	4.4	3.0	33.3%	1		3.51s	1,545	0

Instructions following	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Claude Opus 4.7	10.0	10.0	100.0%	0		1.57s	114	0
Qwen3.6 35B A3B	6.2	5.8	66.7%	1		1.86s	1,264	0

Puzzle Solving	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Claude Opus 4.7	10.0	10.0	100.0%	0		2.51s	399	0
Qwen3.6 35B A3B	3.2	9.9	0.0%	0		1.00s	573	0

Tool Calling	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Claude Opus 4.7	10.0	10.0	100.0%	0		4.17s	373	0
Qwen3.6 35B A3B	0.0	0.0	0.0%	0		0ms	0	0

Quick Compare

Switch Comparison Pair

Elephant AlphamediumvsQwen3.6 35B A3Bnone MiniMax M2.7mediumvsQwen3.6 35B A3Bnone Claude Opus 4.7mediumvsGPT-5.5low Claude Opus 4.7mediumvsGemini 3 Flash Previewlow Qwen3.6 35B A3BnonevsGLM 4.7 Flashmedium Mistral Small 4mediumvsQwen3.6 35B A3Bnone MiniMax M2.5mediumFree AvailablevsQwen3.6 35B A3Bnone Claude Opus 4.7mediumvsHY3 PreviewhighFree Available gpt-oss-120bmediumFree AvailablevsQwen3.6 35B A3Bnone Claude Opus 4.7mediumvsHY3 PreviewlowFree Available Claude Opus 4.7mediumvsGemini 3 Flash Previewnone Claude Opus 4.7mediumvsGemini 3.1 Flash Lite Previewlow