AI BENCHY तुलना

Anthropic: Claude Opus 4.8 vs OpenAI: GPT-5.4

सारांश

Claude Opus 4.8 vs GPT-5.4 benchmark तुलना: GPT-5.4 average score में आगे है: 8.5 vs 7.7. GPT-5.4 की benchmark लागत कम है: $1.210 vs $1.270. Claude Opus 4.8 तेज है: 10.83s vs 22.35s, pass rates 79.4% vs 76.2%.

अनुशंसित मॉडल: GPT-5.4 - It has the strongest score in this comparison (8.5) and the best overall balance of cost and response time across all 2 models.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-07-02

मेट्रिक	Claude Opus 4.8 Claude Opus 4.8 low रिलीज़: 2026-05-28	GPT-5.4 GPT-5.4 medium रिलीज़: 2026-03-05

मेट्रिक	Claude Opus 4.8 Claude Opus 4.8 low रिलीज़: 2026-05-28	GPT-5.4 GPT-5.4 medium रिलीज़: 2026-03-05
स्कोर	7.7	8.5
रैंक	#38	#17
विश्वसनीयता	10.0	10.0
संगति	8.8	8.6
सही परीक्षण
प्रति प्रयास पास दर	79.4%	76.2%
अस्थिर टेस्ट	3	4
कुल रन	63	63
प्रति परिणाम लागत	8.466	8.640
कुल लागत	$1.270	$1.210
इनपुट कीमत	$5.000 / 1M	$2.500 / 1M
आउटपुट कीमत	$25.000 / 1M	$15.000 / 1M
कुल इनपुट टोकन	60,946	34,108
आउटपुट टोकन	31,771	2,242
रीजनिंग टोकन	6,831	72,707
प्रतिक्रिया समय (औसत)	10.83s	22.35s
प्रतिक्रिया समय (अधिकतम)	127.97s	100.41s
प्रतिक्रिया समय (कुल)	227.39s	469.29s

जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#38 Claude Opus 4.8

low

लागत: $0.031
समय: 14.1s
टोकन: 1,345 tok

#17 GPT-5.4

medium

लागत: $0.214
समय: 199.6s
टोकन: 14,349 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

एंटी-एआई ट्रिक्स	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Claude Opus 4.8	10.0	10.0	100.0%	0		3.30s	834	793	371
GPT-5.4	8.3	10.0	75.0%	0		4.11s	606	240	1,511

कोडिंग	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Claude Opus 4.8	6.6	4.6	77.8%	2		7.58s	10,590	3,637	809
GPT-5.4	8.8	7.8	88.9%	1		44.36s	7,305	433	24,216

संयुक्त	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Claude Opus 4.8	9.8	10.0	100.0%	0		20.84s	23,500	2,216	1,081
GPT-5.4	10.0	10.0	100.0%	0		20.57s	11,019	301	3,543

डेटा पार्सिंग और निष्कर्षण	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Claude Opus 4.8	6.3	5.8	66.7%	1		2.27s	10,503	310	0
GPT-5.4	10.0	10.0	100.0%	0		5.32s	7,140	234	804

डोमेन-विशिष्ट	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Claude Opus 4.8	5.3	10.0	33.3%	0		45.53s	975	23,311	3,908
GPT-5.4	5.3	7.2	44.4%	1		74.27s	619	61	34,748

Samanya Buddhimatta	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Claude Opus 4.8	10.0	10.0	100.0%	0		2.55s	708	231	0
GPT-5.4	4.7	3.1	33.3%	1		4.92s	477	145	321

निर्देश पालन	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Claude Opus 4.8	9.8	10.0	100.0%	0		2.78s	909	111	221
GPT-5.4	10.0	10.0	100.0%	0		3.11s	660	93	897

पहेली समाधान	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Claude Opus 4.8	10.0	10.0	100.0%	0		3.01s	894	592	184
GPT-5.4	8.2	7.2	88.9%	1		9.14s	642	441	3,815

टूल कॉलिंग	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Claude Opus 4.8	10.0	10.0	100.0%	0		6.85s	11,775	370	35
GPT-5.4	10.0	10.0	100.0%	0		13.28s	5,445	264	1,031

सामान्य ज्ञान	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Claude Opus 4.8	3.0	10.0	0.0%	0		5.48s	258	200	222
GPT-5.4	3.0	10.0	0.0%	0		13.95s	195	30	1,821

त्वरित तुलना

तुलना जोड़ी बदलें