AI BENCHY तुलना

Anthropic: Claude Opus 4.8 vs OpenAI: GPT-5.4 Mini

सारांश

Claude Opus 4.8 vs GPT-5.4 Mini benchmark तुलना: GPT-5.4 Mini average score में आगे है: 8.0 vs 7.7. GPT-5.4 Mini की benchmark लागत कम है: $0.526 vs $1.270. Claude Opus 4.8 तेज है: 10.83s vs 22.34s, pass rates 79.4% vs 73.0%.

अनुशंसित मॉडल: GPT-5.4 Mini - It has the best score here (8.0), while costing about 2.4x less than Claude Opus 4.8.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-06-30

मेट्रिक	Claude Opus 4.8 Claude Opus 4.8 low रिलीज़: 2026-05-28	GPT-5.4 Mini GPT-5.4 Mini medium रिलीज़: 2026-03-17

मेट्रिक	Claude Opus 4.8 Claude Opus 4.8 low रिलीज़: 2026-05-28	GPT-5.4 Mini GPT-5.4 Mini medium रिलीज़: 2026-03-17
स्कोर	7.7	8.0
रैंक	#38	#27
विश्वसनीयता	10.0	10.0
संगति	8.8	8.0
सही परीक्षण
प्रति प्रयास पास दर	79.4%	73.0%
अस्थिर टेस्ट	3	5
कुल रन	63	63
प्रति परिणाम लागत	8.466	4.381
कुल लागत	$1.270	$0.526
इनपुट कीमत	$5.000 / 1M	$0.750 / 1M
आउटपुट कीमत	$25.000 / 1M	$4.500 / 1M
कुल इनपुट टोकन	60,946	34,116
आउटपुट टोकन	31,771	2,181
रीजनिंग टोकन	6,831	108,937
प्रतिक्रिया समय (औसत)	10.83s	22.34s
प्रतिक्रिया समय (अधिकतम)	127.97s	138.75s
प्रतिक्रिया समय (कुल)	227.39s	469.20s

जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#38 Claude Opus 4.8

low

लागत: $0.031
समय: 14.1s
टोकन: 1,345 tok

#27 GPT-5.4 Mini

medium

लागत: $0.056
समय: 95.5s
टोकन: 12,464 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

एंटी-एआई ट्रिक्स	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Claude Opus 4.8	10.0	10.0	100.0%	0		3.30s	834	793	371
GPT-5.4 Mini	8.6	7.9	91.7%	1		4.05s	606	296	2,876

कोडिंग	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Claude Opus 4.8	6.6	4.6	77.8%	2		7.58s	10,590	3,637	809
GPT-5.4 Mini	8.4	7.4	88.9%	1		57.87s	7,305	467	40,902

संयुक्त	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Claude Opus 4.8	9.8	10.0	100.0%	0		20.84s	23,500	2,216	1,081
GPT-5.4 Mini	10.0	10.0	100.0%	0		17.81s	11,019	317	4,317

डेटा पार्सिंग और निष्कर्षण	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Claude Opus 4.8	6.3	5.8	66.7%	1		2.27s	10,503	310	0
GPT-5.4 Mini	10.0	10.0	100.0%	0		2.43s	7,140	234	650

डोमेन-विशिष्ट	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Claude Opus 4.8	5.3	10.0	33.3%	0		45.53s	975	23,311	3,908
GPT-5.4 Mini	4.1	4.4	44.5%	2		65.31s	619	60	43,286

Samanya Buddhimatta	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Claude Opus 4.8	10.0	10.0	100.0%	0		2.55s	708	231	0
GPT-5.4 Mini	4.5	10.0	0.0%	0		3.72s	477	150	510

निर्देश पालन	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Claude Opus 4.8	9.8	10.0	100.0%	0		2.78s	909	111	221
GPT-5.4 Mini	9.8	10.0	100.0%	0		2.13s	660	96	1,185

पहेली समाधान	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Claude Opus 4.8	10.0	10.0	100.0%	0		3.01s	894	592	184
GPT-5.4 Mini	7.8	10.0	66.7%	0		4.37s	642	278	2,443

टूल कॉलिंग	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Claude Opus 4.8	10.0	10.0	100.0%	0		6.85s	11,775	370	35
GPT-5.4 Mini	4.7	1.6	66.7%	1		9.62s	5,453	251	2,594

सामान्य ज्ञान	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Claude Opus 4.8	3.0	10.0	0.0%	0		5.48s	258	200	222
GPT-5.4 Mini	3.0	10.0	0.0%	0		30.10s	195	32	10,174

त्वरित तुलना

तुलना जोड़ी बदलें