AI BENCHY तुलना

Anthropic: Claude Opus 4.8 vs OpenAI: GPT-5.5

सारांश

Claude Opus 4.8 (medium) vs GPT-5.5 (medium) benchmark तुलना: GPT-5.5 (medium) average score में आगे है: 9.0 vs 8.8. Claude Opus 4.8 (medium) की benchmark लागत कम है: $1.107 vs $3.679. Claude Opus 4.8 (medium) तेज है: 9.72s vs 37.98s, pass rates 84.1% vs 87.3%.

अनुशंसित मॉडल: Claude Opus 4.8 (medium) - Its score stays close to the best score here (8.8 vs 9.0), while costing about 3.3x less than GPT-5.5 (medium).

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-07-10

मेट्रिक	Claude Opus 4.8 Claude Opus 4.8 medium रिलीज़: 2026-05-28	GPT-5.5 GPT-5.5 medium रिलीज़: 2026-04-24

मेट्रिक	Claude Opus 4.8 Claude Opus 4.8 medium रिलीज़: 2026-05-28	GPT-5.5 GPT-5.5 medium रिलीज़: 2026-04-24
स्कोर	8.8	9.0
रैंक	#15	#12
विश्वसनीयता	10.0	10.0
संगति	9.6	8.9
सही परीक्षण
प्रति प्रयास पास दर	84.1%	87.3%
अस्थिर टेस्ट	1	3
कुल रन	63	63
प्रति परिणाम लागत	6.512	21.638
कुल लागत	$1.107	$3.679
इनपुट कीमत	$5.000 / 1M	$5.000 / 1M
आउटपुट कीमत	$25.000 / 1M	$30.000 / 1M
कुल इनपुट टोकन	61,007	34,212
आउटपुट टोकन	26,495	1,985
रीजनिंग टोकन	5,901	114,925
प्रतिक्रिया समय (औसत)	9.72s	37.98s
प्रतिक्रिया समय (अधिकतम)	38.03s	332.10s
प्रतिक्रिया समय (कुल)	204.19s	797.60s

जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#15 Claude Opus 4.8

medium

लागत: $0.057
समय: 23.1s
टोकन: 2,412 tok

#12 GPT-5.5

medium

लागत: $0.112
समय: 71.9s
टोकन: 3,807 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

एंटी-एआई ट्रिक्स	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Claude Opus 4.8	10.0	10.0	100.0%	0		3.95s	834	1,179	478
GPT-5.5	10.0	10.0	100.0%	0		4.66s	606	250	1,335

कोडिंग	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Claude Opus 4.8	10.0	10.0	100.0%	0		15.33s	10,590	9,945	1,381
GPT-5.5	8.8	7.8	88.9%	1		59.77s	7,305	362	24,959

संयुक्त	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Claude Opus 4.8	9.8	10.0	100.0%	0		38.03s	23,561	5,260	1,588
GPT-5.5	10.0	10.0	100.0%	0		19.29s	11,019	312	2,841

डेटा पार्सिंग और निष्कर्षण	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Claude Opus 4.8	7.1	5.6	83.3%	1		12.29s	10,503	481	312
GPT-5.5	10.0	10.0	100.0%	0		4.18s	7,140	234	593

डोमेन-विशिष्ट	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Claude Opus 4.8	5.3	10.0	33.3%	0		14.59s	975	7,477	900
GPT-5.5	5.3	7.2	44.4%	1		164.14s	723	67	79,625

Samanya Buddhimatta	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Claude Opus 4.8	10.0	10.0	100.0%	0		2.46s	708	237	0
GPT-5.5	10.0	10.0	100.0%	0		4.16s	477	138	223

निर्देश पालन	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Claude Opus 4.8	10.0	10.0	100.0%	0		3.32s	909	373	320
GPT-5.5	10.0	10.0	100.0%	0		3.36s	660	93	538

पहेली समाधान	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Claude Opus 4.8	10.0	10.0	100.0%	0		3.95s	894	791	483
GPT-5.5	10.0	10.0	100.0%	0		6.76s	642	241	2,225

टूल कॉलिंग	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Claude Opus 4.8	10.0	10.0	100.0%	0		8.96s	11,775	301	225
GPT-5.5	10.0	10.0	100.0%	0		10.57s	5,445	258	832

सामान्य ज्ञान	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Claude Opus 4.8	3.0	10.0	0.0%	0		6.14s	258	451	214
GPT-5.5	2.8	1.6	33.3%	1		37.86s	195	30	1,754

त्वरित तुलना

तुलना जोड़ी बदलें

Gemini 3.5 FlashlowvsGPT-5.5medium Claude Opus 4.8mediumvsGPT-5.2 Chatnone Claude Opus 4.8mediumvsGemini 3.5 Flashlow Claude Opus 4.8mediumvsGPT-5.5low Claude Opus 4.8mediumvsGPT-5.6 Solhigh Claude Opus 4.8mediumvsDeepSeek V4 Flashhigh Claude Opus 4.8mediumvsGPT-5.6 Terrahigh Claude Opus 4.8mediumvsGPT-5.6 Sollow DeepSeek V4 FlashhighvsGPT-5.5medium Claude Opus 4.8mediumvsGLM 5.2high Gemini 3.5 FlashhighvsGPT-5.5medium GPT-5.5mediumvsGLM 5.2high