AI BENCHY तुलना

Anthropic: Claude Opus 4.6 vs Anthropic: Claude Opus 4.8

सारांश

Claude Opus 4.6 vs Claude Opus 4.8 benchmark तुलना: average score लगभग बराबर है: 7.7 vs 7.7. Claude Opus 4.8 की benchmark लागत कम है: $1.270 vs $2.053. Claude Opus 4.8 तेज है: 10.83s vs 25.89s, pass rates 61.9% vs 79.4%.

अनुशंसित मॉडल: Claude Opus 4.8 - It has the best score here (7.7), while costing about 1.6x less than Claude Opus 4.6.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-06-30

मेट्रिक	Claude Opus 4.6 Claude Opus 4.6 medium रिलीज़: 2026-02-05	Claude Opus 4.8 Claude Opus 4.8 low रिलीज़: 2026-05-28

मेट्रिक	Claude Opus 4.6 Claude Opus 4.6 medium रिलीज़: 2026-02-05	Claude Opus 4.8 Claude Opus 4.8 low रिलीज़: 2026-05-28
स्कोर	7.7	7.7
रैंक	#40	#38
विश्वसनीयता	10.0	10.0
संगति	8.8	8.8
सही परीक्षण
प्रति प्रयास पास दर	61.9%	79.4%
अस्थिर टेस्ट	3	3
कुल रन	63	63
प्रति परिणाम लागत	17.103	8.466
कुल लागत	$2.053	$1.270
इनपुट कीमत	$5.000 / 1M	$5.000 / 1M
आउटपुट कीमत	$25.000 / 1M	$25.000 / 1M
कुल इनपुट टोकन	53,227	60,946
आउटपुट टोकन	47,446	31,771
रीजनिंग टोकन	24,000	6,831
प्रतिक्रिया समय (औसत)	25.89s	10.83s
प्रतिक्रिया समय (अधिकतम)	83.40s	127.97s
प्रतिक्रिया समय (कुल)	362.49s	227.39s

जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#40 Claude Opus 4.6

medium

अमान्य SVG

लागत: $0.000
समय: 300.0s
टोकन: 0 tok

#38 Claude Opus 4.8

low

लागत: $0.031
समय: 14.1s
टोकन: 1,345 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

एंटी-एआई ट्रिक्स	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Claude Opus 4.6	6.4	5.8	66.7%	2		7.45s	840	986	1,071
Claude Opus 4.8	10.0	10.0	100.0%	0		3.30s	834	793	371

कोडिंग	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Claude Opus 4.6	5.7	7.1	44.4%	1		30.10s	8,522	13,057	4,121
Claude Opus 4.8	6.6	4.6	77.8%	2		7.58s	10,590	3,637	809

संयुक्त	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Claude Opus 4.6	10.0	10.0	100.0%	0		76.66s	20,685	8,178	5,194
Claude Opus 4.8	9.8	10.0	100.0%	0		20.84s	23,500	2,216	1,081

डेटा पार्सिंग और निष्कर्षण	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Claude Opus 4.6	10.0	10.0	100.0%	0		7.37s	8,676	691	757
Claude Opus 4.8	6.3	5.8	66.7%	1		2.27s	10,503	310	0

डोमेन-विशिष्ट	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Claude Opus 4.6	3.0	10.0	0.0%	0		83.40s	674	14,642	8,687
Claude Opus 4.8	5.3	10.0	33.3%	0		45.53s	975	23,311	3,908

Samanya Buddhimatta	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Claude Opus 4.6	10.0	10.0	100.0%	0		5.04s	564	188	292
Claude Opus 4.8	10.0	10.0	100.0%	0		2.55s	708	231	0

निर्देश पालन	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Claude Opus 4.6	10.0	10.0	100.0%	0		2.43s	792	266	467
Claude Opus 4.8	9.8	10.0	100.0%	0		2.78s	909	111	221

पहेली समाधान	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Claude Opus 4.6	7.7	10.0	66.7%	0		4.71s	816	532	630
Claude Opus 4.8	10.0	10.0	100.0%	0		3.01s	894	592	184

टूल कॉलिंग	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Claude Opus 4.6	10.0	10.0	100.0%	0		9.73s	11,454	861	329
Claude Opus 4.8	10.0	10.0	100.0%	0		6.85s	11,775	370	35

सामान्य ज्ञान	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Claude Opus 4.6	3.0	10.0	0.0%	0		63.24s	204	8,045	2,452
Claude Opus 4.8	3.0	10.0	0.0%	0		5.48s	258	200	222

त्वरित तुलना

तुलना जोड़ी बदलें