AI BENCHY तुलना

Anthropic: Claude Opus 4.8 vs Qwen: Qwen3.5-27B

सारांश

Claude Opus 4.8 vs Qwen3.5-27B benchmark तुलना: Qwen3.5-27B average score में आगे है: 7.9 vs 7.7. Qwen3.5-27B की benchmark लागत कम है: $0.536 vs $1.270. Claude Opus 4.8 तेज है: 10.83s vs 68.39s, pass rates 79.4% vs 73.0%.

अनुशंसित मॉडल: Claude Opus 4.8 - Its score stays close to the best score here (7.7 vs 7.9), while responding about 6.3x faster than Qwen3.5-27B.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-06-30

मेट्रिक	Claude Opus 4.8 Claude Opus 4.8 low रिलीज़: 2026-05-28	Qwen3.5-27B Qwen3.5-27B medium रिलीज़: 2026-02-24

मेट्रिक	Claude Opus 4.8 Claude Opus 4.8 low रिलीज़: 2026-05-28	Qwen3.5-27B Qwen3.5-27B medium रिलीज़: 2026-02-24
स्कोर	7.7	7.9
रैंक	#38	#29
विश्वसनीयता	10.0	10.0
संगति	8.8	8.5
सही परीक्षण
प्रति प्रयास पास दर	79.4%	73.0%
अस्थिर टेस्ट	3	4
कुल रन	63	63
प्रति परिणाम लागत	8.466	4.901
कुल लागत	$1.270	$0.536
इनपुट कीमत	$5.000 / 1M	$0.195 / 1M
आउटपुट कीमत	$25.000 / 1M	$1.560 / 1M
कुल इनपुट टोकन	60,946	42,164
आउटपुट टोकन	31,771	8,534
रीजनिंग टोकन	6,831	329,289
प्रतिक्रिया समय (औसत)	10.83s	68.39s
प्रतिक्रिया समय (अधिकतम)	127.97s	234.36s
प्रतिक्रिया समय (कुल)	227.39s	1436.24s

जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#38 Claude Opus 4.8

low

लागत: $0.031
समय: 14.1s
टोकन: 1,345 tok

#29 Qwen3.5-27B

medium

लागत: $0.008
समय: 62.0s
टोकन: 3,099 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

एंटी-एआई ट्रिक्स	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Claude Opus 4.8	10.0	10.0	100.0%	0		3.30s	834	793	371
Qwen3.5-27B	8.7	7.9	91.7%	1		19.75s	672	569	31,505

कोडिंग	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Claude Opus 4.8	6.6	4.6	77.8%	2		7.58s	10,590	3,637	809
Qwen3.5-27B	6.2	7.1	55.6%	1		160.69s	7,895	6,381	89,388

संयुक्त	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Claude Opus 4.8	9.8	10.0	100.0%	0		20.84s	23,500	2,216	1,081
Qwen3.5-27B	10.0	10.0	100.0%	0		163.96s	14,946	483	9,991

डेटा पार्सिंग और निष्कर्षण	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Claude Opus 4.8	6.3	5.8	66.7%	1		2.27s	10,503	310	0
Qwen3.5-27B	10.0	10.0	100.0%	0		30.26s	7,782	270	16,150

डोमेन-विशिष्ट	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Claude Opus 4.8	5.3	10.0	33.3%	0		45.53s	975	23,311	3,908
Qwen3.5-27B	5.3	10.0	33.3%	0		79.53s	553	43	52,368

Samanya Buddhimatta	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Claude Opus 4.8	10.0	10.0	100.0%	0		2.55s	708	231	0
Qwen3.5-27B	6.1	3.1	66.7%	1		101.41s	524	70	23,147

निर्देश पालन	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Claude Opus 4.8	9.8	10.0	100.0%	0		2.78s	909	111	221
Qwen3.5-27B	10.0	10.0	100.0%	0		19.66s	699	97	11,638

पहेली समाधान	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Claude Opus 4.8	10.0	10.0	100.0%	0		3.01s	894	592	184
Qwen3.5-27B	8.2	7.7	77.8%	1		59.60s	696	242	70,096

टूल कॉलिंग	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Claude Opus 4.8	10.0	10.0	100.0%	0		6.85s	11,775	370	35
Qwen3.5-27B	10.0	10.0	100.0%	0		7.45s	8,193	348	1,323

सामान्य ज्ञान	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Claude Opus 4.8	3.0	10.0	0.0%	0		5.48s	258	200	222
Qwen3.5-27B	3.0	10.0	0.0%	0		85.11s	204	31	23,683

त्वरित तुलना

तुलना जोड़ी बदलें