AI BENCHY Compare

Anthropic: Claude Opus 4.8 vs OpenAI: GPT-5.3-Codex

خلاصہ

Claude Opus 4.8 vs GPT-5.3-Codex benchmark موازنہ: GPT-5.3-Codex average score میں آگے ہے: 8.9 vs 7.7. GPT-5.3-Codex کی benchmark لاگت کم ہے: $0.740 vs $1.270. Claude Opus 4.8 تیز ہے: 10.83s vs 16.22s، pass rates 79.4% vs 82.5%.

تجویز کردہ ماڈل: GPT-5.3-Codex - It has the best score here (8.9), while costing about 1.7x less than Claude Opus 4.8.

بینچ مارکس AI BENCHY ٹیسٹ سوئٹس سے اس وقت تیار کیے گئے: 2026-07-02

میٹرک	Claude Opus 4.8 Claude Opus 4.8 low اجرا: 2026-05-28	GPT-5.3-Codex GPT-5.3-Codex medium اجرا: 2026-02-05

میٹرک	Claude Opus 4.8 Claude Opus 4.8 low اجرا: 2026-05-28	GPT-5.3-Codex GPT-5.3-Codex medium اجرا: 2026-02-05
اسکور	7.7	8.9
درجہ	#38	#10
اعتماد پذیری	10.0	10.0
تسلسل	8.8	8.5
درست ٹیسٹس
فی کوشش کامیابی کی شرح	79.4%	82.5%
غیر مستحکم ٹیسٹ	3	4
کل رنز	63	63
فی نتیجہ لاگت	8.466	4.932
کل لاگت	$1.270	$0.740
ان پٹ قیمت	$5.000 / 1M	$1.750 / 1M
آؤٹ پٹ قیمت	$25.000 / 1M	$14.000 / 1M
کل ان پٹ ٹوکنز	60,946	34,299
آؤٹ پٹ ٹوکنز	31,771	2,357
ریزننگ ٹوکنز	6,831	46,189
ردِعمل کا وقت (اوسط)	10.83s	16.22s
ردِعمل کا وقت (زیادہ سے زیادہ)	127.97s	100.93s
ردِعمل کا وقت (کل)	227.39s	340.67s

جنریشن شوکیس

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#38 Claude Opus 4.8

low

لاگت: $0.031
وقت: 14.1s
ٹوکنز: 1,345 tok

#10 GPT-5.3-Codex

medium

لاگت: $0.049
وقت: 54.9s
ٹوکنز: 3,580 tok

اسکور کے لحاظ سے سرفہرست ماڈلز

اسکور بمقابلہ کل لاگت

ردِعمل کا وقت (اوسط)

اسکور vs ردِعمل کا وقت (اوسط)

کل آؤٹ پٹ ٹوکنز

اسکور vs کل آؤٹ پٹ ٹوکنز

زمرہ وار تفصیل

اینٹی اے آئی چالیں	اسکور	تسلسل	فی کوشش کامیابی کی شرح	غیر مستحکم ٹیسٹ	درست ٹیسٹس	ردِعمل کا وقت (اوسط)	ان پٹ ٹوکنز	آؤٹ پٹ ٹوکنز	ریزننگ ٹوکنز
Claude Opus 4.8	10.0	10.0	100.0%	0		3.30s	834	793	371
GPT-5.3-Codex	8.7	7.9	91.7%	1		4.16s	606	240	1,722

کوڈنگ	اسکور	تسلسل	فی کوشش کامیابی کی شرح	غیر مستحکم ٹیسٹ	درست ٹیسٹس	ردِعمل کا وقت (اوسط)	ان پٹ ٹوکنز	آؤٹ پٹ ٹوکنز	ریزننگ ٹوکنز
Claude Opus 4.8	6.6	4.6	77.8%	2		7.58s	10,590	3,637	809
GPT-5.3-Codex	10.0	10.0	100.0%	0		19.50s	7,302	535	10,890

مشترکہ	اسکور	تسلسل	فی کوشش کامیابی کی شرح	غیر مستحکم ٹیسٹ	درست ٹیسٹس	ردِعمل کا وقت (اوسط)	ان پٹ ٹوکنز	آؤٹ پٹ ٹوکنز	ریزننگ ٹوکنز
Claude Opus 4.8	9.8	10.0	100.0%	0		20.84s	23,500	2,216	1,081
GPT-5.3-Codex	10.0	10.0	100.0%	0		19.56s	11,019	364	2,731

ڈیٹا پارسنگ اور استخراج	اسکور	تسلسل	فی کوشش کامیابی کی شرح	غیر مستحکم ٹیسٹ	درست ٹیسٹس	ردِعمل کا وقت (اوسط)	ان پٹ ٹوکنز	آؤٹ پٹ ٹوکنز	ریزننگ ٹوکنز
Claude Opus 4.8	6.3	5.8	66.7%	1		2.27s	10,503	310	0
GPT-5.3-Codex	10.0	10.0	100.0%	0		3.07s	7,140	234	728

ڈومین مخصوص	اسکور	تسلسل	فی کوشش کامیابی کی شرح	غیر مستحکم ٹیسٹ	درست ٹیسٹس	ردِعمل کا وقت (اوسط)	ان پٹ ٹوکنز	آؤٹ پٹ ٹوکنز	ریزننگ ٹوکنز
Claude Opus 4.8	5.3	10.0	33.3%	0		45.53s	975	23,311	3,908
GPT-5.3-Codex	5.9	7.2	55.6%	1		64.31s	813	64	25,308

عمومی ذہانت	اسکور	تسلسل	فی کوشش کامیابی کی شرح	غیر مستحکم ٹیسٹ	درست ٹیسٹس	ردِعمل کا وقت (اوسط)	ان پٹ ٹوکنز	آؤٹ پٹ ٹوکنز	ریزننگ ٹوکنز
Claude Opus 4.8	10.0	10.0	100.0%	0		2.55s	708	231	0
GPT-5.3-Codex	4.6	10.0	0.0%	0		4.87s	477	187	331

ہدایات کی پیروی	اسکور	تسلسل	فی کوشش کامیابی کی شرح	غیر مستحکم ٹیسٹ	درست ٹیسٹس	ردِعمل کا وقت (اوسط)	ان پٹ ٹوکنز	آؤٹ پٹ ٹوکنز	ریزننگ ٹوکنز
Claude Opus 4.8	9.8	10.0	100.0%	0		2.78s	909	111	221
GPT-5.3-Codex	10.0	10.0	100.0%	0		3.04s	660	93	693

پہیلی حل کرنا	اسکور	تسلسل	فی کوشش کامیابی کی شرح	غیر مستحکم ٹیسٹ	درست ٹیسٹس	ردِعمل کا وقت (اوسط)	ان پٹ ٹوکنز	آؤٹ پٹ ٹوکنز	ریزننگ ٹوکنز
Claude Opus 4.8	10.0	10.0	100.0%	0		3.01s	894	592	184
GPT-5.3-Codex	9.0	7.9	88.9%	1		5.05s	642	356	1,593

ٹول کالنگ	اسکور	تسلسل	فی کوشش کامیابی کی شرح	غیر مستحکم ٹیسٹ	درست ٹیسٹس	ردِعمل کا وقت (اوسط)	ان پٹ ٹوکنز	آؤٹ پٹ ٹوکنز	ریزننگ ٹوکنز
Claude Opus 4.8	10.0	10.0	100.0%	0		6.85s	11,775	370	35
GPT-5.3-Codex	10.0	10.0	100.0%	0		6.37s	5,445	254	492

معلومات عامہ	اسکور	تسلسل	فی کوشش کامیابی کی شرح	غیر مستحکم ٹیسٹ	درست ٹیسٹس	ردِعمل کا وقت (اوسط)	ان پٹ ٹوکنز	آؤٹ پٹ ٹوکنز	ریزننگ ٹوکنز
Claude Opus 4.8	3.0	10.0	0.0%	0		5.48s	258	200	222
GPT-5.3-Codex	2.8	1.6	33.3%	1		14.43s	195	30	1,701

فوری موازنہ

موازنہ کی جوڑی تبدیل کریں