AI BENCHY तुलना

OpenAI: GPT-5.5 vs Poolside: Laguna XS 2.1

सारांश

GPT-5.5 vs Laguna XS 2.1 benchmark तुलना: GPT-5.5 average score में आगे है: 9.3 vs 7.0. Laguna XS 2.1 की benchmark लागत कम है: $0.036 vs $0.907. GPT-5.5 तेज है: 9.76s vs 30.08s, pass rates 85.7% vs 44.4%.

अनुशंसित मॉडल: GPT-5.5 - It has the best score here (9.3), while responding about 3.1x faster than Laguna XS 2.1.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-07-02

मेट्रिक	GPT-5.5 GPT-5.5 low रिलीज़: 2026-04-24	Laguna XS 2.1 Laguna XS 2.1 medium रिलीज़: 2026-07-02 निःशुल्क उपलब्ध

मेट्रिक	GPT-5.5 GPT-5.5 low रिलीज़: 2026-04-24	Laguna XS 2.1 Laguna XS 2.1 medium रिलीज़: 2026-07-02 निःशुल्क उपलब्ध
स्कोर	9.3	7.0
रैंक	#4	#67
विश्वसनीयता	10.0	10.0
संगति	10.0	9.6
सही परीक्षण
प्रति प्रयास पास दर	85.7%	44.4%
अस्थिर टेस्ट	0	1
कुल रन	63	63
प्रति परिणाम लागत	5.035	0.392
कुल लागत	$0.907	$0.036
इनपुट कीमत	$5.000 / 1M	$0.060 / 1M
आउटपुट कीमत	$30.000 / 1M	$0.120 / 1M
कुल इनपुट टोकन	34,209	45,324
आउटपुट टोकन	2,046	25,761
रीजनिंग टोकन	22,460	268,677
प्रतिक्रिया समय (औसत)	9.76s	30.08s
प्रतिक्रिया समय (अधिकतम)	56.19s	155.23s
प्रतिक्रिया समय (कुल)	204.92s	631.77s

जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#4 GPT-5.5

low

लागत: $0.068
समय: 37.0s
टोकन: 2,339 tok

#67 Laguna XS 2.1

medium

लागत: $0.001
समय: 30.6s
टोकन: 4,678 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

एंटी-एआई ट्रिक्स	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
GPT-5.5	10.0	10.0	100.0%	0		4.41s	606	238	1,020
Laguna XS 2.1	4.8	10.0	25.0%	0		41.96s	774	353	73,090

कोडिंग	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
GPT-5.5	10.0	10.0	100.0%	0		15.04s	7,302	423	6,402
Laguna XS 2.1	5.5	10.0	33.3%	0		70.35s	7,995	23,767	83,258

संयुक्त	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
GPT-5.5	10.0	10.0	100.0%	0		9.56s	11,019	303	717
Laguna XS 2.1	9.6	10.0	100.0%	0		13.43s	18,033	507	5,908

डेटा पार्सिंग और निष्कर्षण	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
GPT-5.5	10.0	10.0	100.0%	0		3.28s	7,140	228	157
Laguna XS 2.1	10.0	10.0	100.0%	0		4.50s	7,734	234	3,129

डोमेन-विशिष्ट	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
GPT-5.5	5.3	10.0	33.3%	0		28.05s	723	69	11,609
Laguna XS 2.1	2.9	7.2	11.1%	1		65.66s	834	17	91,533

Samanya Buddhimatta	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
GPT-5.5	10.0	10.0	100.0%	0		5.17s	477	133	245
Laguna XS 2.1	5.0	10.0	0.0%	0		4.15s	537	119	1,375

निर्देश पालन	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
GPT-5.5	9.9	10.0	100.0%	0		3.74s	660	93	415
Laguna XS 2.1	9.8	10.0	100.0%	0		2.57s	753	82	1,844

पहेली समाधान	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
GPT-5.5	10.0	10.0	100.0%	0		4.74s	642	279	954
Laguna XS 2.1	5.3	10.0	33.3%	0		3.43s	771	357	3,355

टूल कॉलिंग	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
GPT-5.5	10.0	10.0	100.0%	0		4.96s	5,445	250	101
Laguna XS 2.1	10.0	10.0	100.0%	0		3.01s	7,638	309	748

सामान्य ज्ञान	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
GPT-5.5	3.0	10.0	0.0%	0		10.06s	195	30	840
Laguna XS 2.1	3.0	10.0	0.0%	0		10.88s	255	16	4,437

त्वरित तुलना

तुलना जोड़ी बदलें