AI BENCHY तुलना

Anthropic: Claude Opus 4.8 vs Qwen: Qwen3.7 Max

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-05-28

मेट्रिक	Claude Opus 4.8 Claude Opus 4.8 medium रिलीज़: 2026-05-28	Qwen3.7 Max Qwen3.7 Max none रिलीज़: 2026-05-22

मेट्रिक	Claude Opus 4.8 Claude Opus 4.8 medium रिलीज़: 2026-05-28	Qwen3.7 Max Qwen3.7 Max none रिलीज़: 2026-05-22
स्कोर	8.7	7.9
रैंक	#12	#28
विश्वसनीयता	10.0	10.0
संगति	9.6	10.0
सही परीक्षण
प्रति प्रयास पास दर	83.3%	70.0%
अस्थिर टेस्ट	1	0
कुल रन	60	60
प्रति परिणाम लागत	6.285	0.719
कुल लागत	$1.006	$0.051
इनपुट कीमत	$5.000 / 1M	$1.250 / 1M
आउटपुट कीमत	$25.000 / 1M	$3.750 / 1M
आउटपुट टोकन	23,201	1,988
रीजनिंग टोकन	5,901	0
प्रतिक्रिया समय (औसत)	9.34s	1.30s
प्रतिक्रिया समय (अधिकतम)	38.03s	3.92s
प्रतिक्रिया समय (कुल)	186.84s	25.95s

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

एंटी-एआई ट्रिक्स	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	आउटपुट टोकन	रीजनिंग टोकन
Claude Opus 4.8	10.0	10.0	100.0%	0		3.95s	1,179	478
Qwen3.7 Max	6.5	10.0	50.0%	0		1.08s	242	0

कोडिंग	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	आउटपुट टोकन	रीजनिंग टोकन
Claude Opus 4.8	10.0	10.0	100.0%	0		14.97s	6,651	1,381
Qwen3.7 Max	6.8	10.0	50.0%	0		1.39s	576	0

संयुक्त	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	आउटपुट टोकन	रीजनिंग टोकन
Claude Opus 4.8	9.8	10.0	100.0%	0		38.03s	5,260	1,588
Qwen3.7 Max	3.0	10.0	0.0%	0		2.17s	171	0

डेटा पार्सिंग और निष्कर्षण	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	आउटपुट टोकन	रीजनिंग टोकन
Claude Opus 4.8	7.1	5.6	83.3%	1		12.29s	481	312
Qwen3.7 Max	10.0	10.0	100.0%	0		1.35s	243	0

डोमेन-विशिष्ट	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	आउटपुट टोकन	रीजनिंग टोकन
Claude Opus 4.8	5.3	10.0	33.3%	0		14.15s	7,477	900
Qwen3.7 Max	7.7	10.0	66.7%	0		975ms	15	0

Samanya Buddhimatta	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	आउटपुट टोकन	रीजनिंग टोकन
Claude Opus 4.8	10.0	10.0	100.0%	0		2.46s	237	0
Qwen3.7 Max	10.0	10.0	100.0%	0		1.04s	120	0

निर्देश पालन	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	आउटपुट टोकन	रीजनिंग टोकन
Claude Opus 4.8	10.0	10.0	100.0%	0		3.32s	373	320
Qwen3.7 Max	10.0	10.0	100.0%	0		943ms	72	0

पहेली समाधान	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	आउटपुट टोकन	रीजनिंग टोकन
Claude Opus 4.8	10.0	10.0	100.0%	0		3.95s	791	483
Qwen3.7 Max	10.0	10.0	100.0%	0		1.13s	314	0

टूल कॉलिंग	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	आउटपुट टोकन	रीजनिंग टोकन
Claude Opus 4.8	10.0	10.0	100.0%	0		8.96s	301	225
Qwen3.7 Max	10.0	10.0	100.0%	0		3.92s	222	0

सामान्य ज्ञान	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	आउटपुट टोकन	रीजनिंग टोकन
Claude Opus 4.8	3.0	10.0	0.0%	0		6.14s	451	214
Qwen3.7 Max	3.0	10.0	0.0%	0		856ms	13	0

त्वरित तुलना

तुलना जोड़ी बदलें

GPT-5.4mediumvsQwen3.7 Maxnone Qwen3.7 MaxnonevsGLM 5 Turbomedium Claude Opus 4.8mediumvsGemini 3 Flash Previewlow Gemini 3.5 FlashminimalvsQwen3.7 Maxnone Gemma 4 26B A4Bmediumनिःशुल्क उपलब्धvsQwen3.7 Maxnone Gemma 4 31Bmediumनिःशुल्क उपलब्धvsQwen3.7 Maxnone Qwen3.7 MaxnonevsGrok 4.3medium Seed-2.0-LitemediumvsQwen3.7 Maxnone Gemini 3.1 Flash Lite PreviewmediumvsQwen3.7 Maxnone Gemini 3.1 Flash LitemediumvsQwen3.7 Maxnone Gemini 2.5 FlashmediumvsQwen3.7 Maxnone Claude Opus 4.8mediumvsGemini 3.5 Flashnone