AI BENCHY तुलना

Anthropic: Claude Opus 4.8 vs OpenAI: GPT-5.3-Codex

सारांश

Claude Opus 4.8 vs GPT-5.3-Codex benchmark तुलना: GPT-5.3-Codex average score में आगे है: 8.9 vs 7.7. GPT-5.3-Codex की benchmark लागत कम है: $0.740 vs $1.270. Claude Opus 4.8 तेज है: 10.83s vs 16.22s, pass rates 79.4% vs 82.5%.

अनुशंसित मॉडल: GPT-5.3-Codex - It has the best score here (8.9), while costing about 1.7x less than Claude Opus 4.8.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-07-02

मेट्रिक	Claude Opus 4.8 Claude Opus 4.8 low रिलीज़: 2026-05-28	GPT-5.3-Codex GPT-5.3-Codex medium रिलीज़: 2026-02-05

मेट्रिक	Claude Opus 4.8 Claude Opus 4.8 low रिलीज़: 2026-05-28	GPT-5.3-Codex GPT-5.3-Codex medium रिलीज़: 2026-02-05
स्कोर	7.7	8.9
रैंक	#38	#10
विश्वसनीयता	10.0	10.0
संगति	8.8	8.5
सही परीक्षण
प्रति प्रयास पास दर	79.4%	82.5%
अस्थिर टेस्ट	3	4
कुल रन	63	63
प्रति परिणाम लागत	8.466	4.932
कुल लागत	$1.270	$0.740
इनपुट कीमत	$5.000 / 1M	$1.750 / 1M
आउटपुट कीमत	$25.000 / 1M	$14.000 / 1M
कुल इनपुट टोकन	60,946	34,299
आउटपुट टोकन	31,771	2,357
रीजनिंग टोकन	6,831	46,189
प्रतिक्रिया समय (औसत)	10.83s	16.22s
प्रतिक्रिया समय (अधिकतम)	127.97s	100.93s
प्रतिक्रिया समय (कुल)	227.39s	340.67s

जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#38 Claude Opus 4.8

low

लागत: $0.031
समय: 14.1s
टोकन: 1,345 tok

#10 GPT-5.3-Codex

medium

लागत: $0.049
समय: 54.9s
टोकन: 3,580 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

एंटी-एआई ट्रिक्स	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Claude Opus 4.8	10.0	10.0	100.0%	0		3.30s	834	793	371
GPT-5.3-Codex	8.7	7.9	91.7%	1		4.16s	606	240	1,722

कोडिंग	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Claude Opus 4.8	6.6	4.6	77.8%	2		7.58s	10,590	3,637	809
GPT-5.3-Codex	10.0	10.0	100.0%	0		19.50s	7,302	535	10,890

संयुक्त	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Claude Opus 4.8	9.8	10.0	100.0%	0		20.84s	23,500	2,216	1,081
GPT-5.3-Codex	10.0	10.0	100.0%	0		19.56s	11,019	364	2,731

डेटा पार्सिंग और निष्कर्षण	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Claude Opus 4.8	6.3	5.8	66.7%	1		2.27s	10,503	310	0
GPT-5.3-Codex	10.0	10.0	100.0%	0		3.07s	7,140	234	728

डोमेन-विशिष्ट	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Claude Opus 4.8	5.3	10.0	33.3%	0		45.53s	975	23,311	3,908
GPT-5.3-Codex	5.9	7.2	55.6%	1		64.31s	813	64	25,308

Samanya Buddhimatta	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Claude Opus 4.8	10.0	10.0	100.0%	0		2.55s	708	231	0
GPT-5.3-Codex	4.6	10.0	0.0%	0		4.87s	477	187	331

निर्देश पालन	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Claude Opus 4.8	9.8	10.0	100.0%	0		2.78s	909	111	221
GPT-5.3-Codex	10.0	10.0	100.0%	0		3.04s	660	93	693

पहेली समाधान	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Claude Opus 4.8	10.0	10.0	100.0%	0		3.01s	894	592	184
GPT-5.3-Codex	9.0	7.9	88.9%	1		5.05s	642	356	1,593

टूल कॉलिंग	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Claude Opus 4.8	10.0	10.0	100.0%	0		6.85s	11,775	370	35
GPT-5.3-Codex	10.0	10.0	100.0%	0		6.37s	5,445	254	492

सामान्य ज्ञान	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Claude Opus 4.8	3.0	10.0	0.0%	0		5.48s	258	200	222
GPT-5.3-Codex	2.8	1.6	33.3%	1		14.43s	195	30	1,701

त्वरित तुलना

तुलना जोड़ी बदलें