AI BENCHY तुलना

Anthropic: Claude Sonnet 4.6 vs Qwen: Qwen3.7 Plus

सारांश

Claude Sonnet 4.6 vs Qwen3.7 Plus benchmark तुलना: Qwen3.7 Plus average score में आगे है: 8.2 vs 7.3. Qwen3.7 Plus की benchmark लागत कम है: $0.177 vs $0.316. Claude Sonnet 4.6 तेज है: 5.04s vs 38.95s, pass rates 55.6% vs 77.8%.

अनुशंसित मॉडल: Qwen3.7 Plus - It has the best score here (8.2), while costing about 1.8x less than Claude Sonnet 4.6.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-06-12

मेट्रिक	Claude Sonnet 4.6 Claude Sonnet 4.6 none रिलीज़: 2026-02-17	Qwen3.7 Plus Qwen3.7 Plus medium रिलीज़: 2026-06-03

मेट्रिक	Claude Sonnet 4.6 Claude Sonnet 4.6 none रिलीज़: 2026-02-17	Qwen3.7 Plus Qwen3.7 Plus medium रिलीज़: 2026-06-03
स्कोर	7.3	8.2
रैंक	#56	#28
विश्वसनीयता	10.0	10.0
संगति	9.7	9.1
सही परीक्षण
प्रति प्रयास पास दर	55.6%	77.8%
अस्थिर टेस्ट	1	2
कुल रन	63	63
प्रति परिणाम लागत	2.870	1.474
कुल लागत	$0.316	$0.177
इनपुट कीमत	$3.000 / 1M	$0.320 / 1M
आउटपुट कीमत	$15.000 / 1M	$1.280 / 1M
कुल इनपुट टोकन	57,886	40,939
आउटपुट टोकन	9,465	2,125
रीजनिंग टोकन	0	125,754
प्रतिक्रिया समय (औसत)	5.04s	38.95s
प्रतिक्रिया समय (अधिकतम)	23.84s	178.04s
प्रतिक्रिया समय (कुल)	70.60s	817.85s

Generation showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#56 Claude Sonnet 4.6

none

Cost: $0.038
Time: 27.3s
Tokens: 2,598 tok

#28 Qwen3.7 Plus

medium

Cost: $0.018
Time: 193.2s
Tokens: 10,821 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

एंटी-एआई ट्रिक्स	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Claude Sonnet 4.6	4.8	10.0	25.0%	0		2.94s	636	1,214	0
Qwen3.7 Plus	10.0	10.0	100.0%	0		8.58s	672	195	5,065

कोडिंग	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Claude Sonnet 4.6	5.5	10.0	33.3%	0		5.19s	8,522	2,127	0
Qwen3.7 Plus	6.1	6.6	55.6%	1		108.60s	6,472	414	43,576

संयुक्त	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Claude Sonnet 4.6	9.5	10.0	100.0%	0		23.84s	26,024	3,766	0
Qwen3.7 Plus	10.0	10.0	100.0%	0		65.24s	14,934	366	10,132

डेटा पार्सिंग और निष्कर्षण	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Claude Sonnet 4.6	10.0	10.0	100.0%	0		3.43s	8,574	252	0
Qwen3.7 Plus	10.0	10.0	100.0%	0		21.75s	7,782	270	6,713

डोमेन-विशिष्ट	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Claude Sonnet 4.6	7.7	10.0	66.7%	0		3.54s	759	413	0
Qwen3.7 Plus	3.6	7.2	22.2%	1		45.35s	771	57	27,073

Samanya Buddhimatta	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Claude Sonnet 4.6	6.1	3.1	66.7%	1		2.56s	513	192	0
Qwen3.7 Plus	10.0	10.0	100.0%	0		25.48s	516	123	3,998

निर्देश पालन	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Claude Sonnet 4.6	6.5	10.0	50.0%	0		1.96s	690	90	0
Qwen3.7 Plus	10.0	10.0	100.0%	0		16.13s	699	102	5,013

पहेली समाधान	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Claude Sonnet 4.6	7.7	10.0	66.7%	0		2.53s	663	533	0
Qwen3.7 Plus	10.0	10.0	100.0%	0		16.38s	696	280	7,312

टूल कॉलिंग	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Claude Sonnet 4.6	10.0	10.0	100.0%	0		4.11s	11,301	447	0
Qwen3.7 Plus	10.0	10.0	100.0%	0		15.02s	8,193	292	1,831

सामान्य ज्ञान	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Claude Sonnet 4.6	3.0	10.0	0.0%	0		4.67s	204	431	0
Qwen3.7 Plus	3.0	10.0	0.0%	0		91.07s	204	26	15,041

त्वरित तुलना

तुलना जोड़ी बदलें