AI BENCHY Compare

OpenAI: GPT-5.5 vs Poolside: Laguna XS 2.1

خلاصہ

GPT-5.5 vs Laguna XS 2.1 benchmark موازنہ: GPT-5.5 average score میں آگے ہے: 9.3 vs 7.0. Laguna XS 2.1 کی benchmark لاگت کم ہے: $0.036 vs $0.907. GPT-5.5 تیز ہے: 9.76s vs 30.08s، pass rates 85.7% vs 44.4%.

تجویز کردہ ماڈل: GPT-5.5 - It has the best score here (9.3), while responding about 3.1x faster than Laguna XS 2.1.

بینچ مارکس AI BENCHY ٹیسٹ سوئٹس سے اس وقت تیار کیے گئے: 2026-07-02

میٹرک	GPT-5.5 GPT-5.5 low اجرا: 2026-04-24	Laguna XS 2.1 Laguna XS 2.1 medium اجرا: 2026-07-02 مفت دستیاب

میٹرک	GPT-5.5 GPT-5.5 low اجرا: 2026-04-24	Laguna XS 2.1 Laguna XS 2.1 medium اجرا: 2026-07-02 مفت دستیاب
اسکور	9.3	7.0
درجہ	#4	#67
اعتماد پذیری	10.0	10.0
تسلسل	10.0	9.6
درست ٹیسٹس
فی کوشش کامیابی کی شرح	85.7%	44.4%
غیر مستحکم ٹیسٹ	0	1
کل رنز	63	63
فی نتیجہ لاگت	5.035	0.392
کل لاگت	$0.907	$0.036
ان پٹ قیمت	$5.000 / 1M	$0.060 / 1M
آؤٹ پٹ قیمت	$30.000 / 1M	$0.120 / 1M
کل ان پٹ ٹوکنز	34,209	45,324
آؤٹ پٹ ٹوکنز	2,046	25,761
ریزننگ ٹوکنز	22,460	268,677
ردِعمل کا وقت (اوسط)	9.76s	30.08s
ردِعمل کا وقت (زیادہ سے زیادہ)	56.19s	155.23s
ردِعمل کا وقت (کل)	204.92s	631.77s

جنریشن شوکیس

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#4 GPT-5.5

low

لاگت: $0.068
وقت: 37.0s
ٹوکنز: 2,339 tok

#67 Laguna XS 2.1

medium

لاگت: $0.001
وقت: 30.6s
ٹوکنز: 4,678 tok

اسکور کے لحاظ سے سرفہرست ماڈلز

اسکور بمقابلہ کل لاگت

ردِعمل کا وقت (اوسط)

اسکور vs ردِعمل کا وقت (اوسط)

کل آؤٹ پٹ ٹوکنز

اسکور vs کل آؤٹ پٹ ٹوکنز

زمرہ وار تفصیل

اینٹی اے آئی چالیں	اسکور	تسلسل	فی کوشش کامیابی کی شرح	غیر مستحکم ٹیسٹ	درست ٹیسٹس	ردِعمل کا وقت (اوسط)	ان پٹ ٹوکنز	آؤٹ پٹ ٹوکنز	ریزننگ ٹوکنز
GPT-5.5	10.0	10.0	100.0%	0		4.41s	606	238	1,020
Laguna XS 2.1	4.8	10.0	25.0%	0		41.96s	774	353	73,090

کوڈنگ	اسکور	تسلسل	فی کوشش کامیابی کی شرح	غیر مستحکم ٹیسٹ	درست ٹیسٹس	ردِعمل کا وقت (اوسط)	ان پٹ ٹوکنز	آؤٹ پٹ ٹوکنز	ریزننگ ٹوکنز
GPT-5.5	10.0	10.0	100.0%	0		15.04s	7,302	423	6,402
Laguna XS 2.1	5.5	10.0	33.3%	0		70.35s	7,995	23,767	83,258

مشترکہ	اسکور	تسلسل	فی کوشش کامیابی کی شرح	غیر مستحکم ٹیسٹ	درست ٹیسٹس	ردِعمل کا وقت (اوسط)	ان پٹ ٹوکنز	آؤٹ پٹ ٹوکنز	ریزننگ ٹوکنز
GPT-5.5	10.0	10.0	100.0%	0		9.56s	11,019	303	717
Laguna XS 2.1	9.6	10.0	100.0%	0		13.43s	18,033	507	5,908

ڈیٹا پارسنگ اور استخراج	اسکور	تسلسل	فی کوشش کامیابی کی شرح	غیر مستحکم ٹیسٹ	درست ٹیسٹس	ردِعمل کا وقت (اوسط)	ان پٹ ٹوکنز	آؤٹ پٹ ٹوکنز	ریزننگ ٹوکنز
GPT-5.5	10.0	10.0	100.0%	0		3.28s	7,140	228	157
Laguna XS 2.1	10.0	10.0	100.0%	0		4.50s	7,734	234	3,129

ڈومین مخصوص	اسکور	تسلسل	فی کوشش کامیابی کی شرح	غیر مستحکم ٹیسٹ	درست ٹیسٹس	ردِعمل کا وقت (اوسط)	ان پٹ ٹوکنز	آؤٹ پٹ ٹوکنز	ریزننگ ٹوکنز
GPT-5.5	5.3	10.0	33.3%	0		28.05s	723	69	11,609
Laguna XS 2.1	2.9	7.2	11.1%	1		65.66s	834	17	91,533

عمومی ذہانت	اسکور	تسلسل	فی کوشش کامیابی کی شرح	غیر مستحکم ٹیسٹ	درست ٹیسٹس	ردِعمل کا وقت (اوسط)	ان پٹ ٹوکنز	آؤٹ پٹ ٹوکنز	ریزننگ ٹوکنز
GPT-5.5	10.0	10.0	100.0%	0		5.17s	477	133	245
Laguna XS 2.1	5.0	10.0	0.0%	0		4.15s	537	119	1,375

ہدایات کی پیروی	اسکور	تسلسل	فی کوشش کامیابی کی شرح	غیر مستحکم ٹیسٹ	درست ٹیسٹس	ردِعمل کا وقت (اوسط)	ان پٹ ٹوکنز	آؤٹ پٹ ٹوکنز	ریزننگ ٹوکنز
GPT-5.5	9.9	10.0	100.0%	0		3.74s	660	93	415
Laguna XS 2.1	9.8	10.0	100.0%	0		2.57s	753	82	1,844

پہیلی حل کرنا	اسکور	تسلسل	فی کوشش کامیابی کی شرح	غیر مستحکم ٹیسٹ	درست ٹیسٹس	ردِعمل کا وقت (اوسط)	ان پٹ ٹوکنز	آؤٹ پٹ ٹوکنز	ریزننگ ٹوکنز
GPT-5.5	10.0	10.0	100.0%	0		4.74s	642	279	954
Laguna XS 2.1	5.3	10.0	33.3%	0		3.43s	771	357	3,355

ٹول کالنگ	اسکور	تسلسل	فی کوشش کامیابی کی شرح	غیر مستحکم ٹیسٹ	درست ٹیسٹس	ردِعمل کا وقت (اوسط)	ان پٹ ٹوکنز	آؤٹ پٹ ٹوکنز	ریزننگ ٹوکنز
GPT-5.5	10.0	10.0	100.0%	0		4.96s	5,445	250	101
Laguna XS 2.1	10.0	10.0	100.0%	0		3.01s	7,638	309	748

معلومات عامہ	اسکور	تسلسل	فی کوشش کامیابی کی شرح	غیر مستحکم ٹیسٹ	درست ٹیسٹس	ردِعمل کا وقت (اوسط)	ان پٹ ٹوکنز	آؤٹ پٹ ٹوکنز	ریزننگ ٹوکنز
GPT-5.5	3.0	10.0	0.0%	0		10.06s	195	30	840
Laguna XS 2.1	3.0	10.0	0.0%	0		10.88s	255	16	4,437

فوری موازنہ

موازنہ کی جوڑی تبدیل کریں