AI BENCHY तुलना

Anthropic: Claude Sonnet 4.6 vs OpenAI: GPT-5.5

सारांश

Claude Sonnet 4.6 vs GPT-5.5 benchmark तुलना: GPT-5.5 average score में आगे है: 9.3 vs 7.8. GPT-5.5 की benchmark लागत कम है: $0.907 vs $1.418. GPT-5.5 तेज है: 9.76s vs 17.06s, pass rates 65.1% vs 85.7%.

अनुशंसित मॉडल: GPT-5.5 - It has the best score here (9.3), while costing about 1.6x less than Claude Sonnet 4.6.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-07-02

मेट्रिक	Claude Sonnet 4.6 Claude Sonnet 4.6 medium रिलीज़: 2026-02-17	GPT-5.5 GPT-5.5 low रिलीज़: 2026-04-24

मेट्रिक	Claude Sonnet 4.6 Claude Sonnet 4.6 medium रिलीज़: 2026-02-17	GPT-5.5 GPT-5.5 low रिलीज़: 2026-04-24
स्कोर	7.8	9.3
रैंक	#32	#4
विश्वसनीयता	10.0	10.0
संगति	9.1	10.0
सही परीक्षण
प्रति प्रयास पास दर	65.1%	85.7%
अस्थिर टेस्ट	2	0
कुल रन	63	63
प्रति परिणाम लागत	10.904	5.035
कुल लागत	$1.418	$0.907
इनपुट कीमत	$3.000 / 1M	$5.000 / 1M
आउटपुट कीमत	$15.000 / 1M	$30.000 / 1M
कुल इनपुट टोकन	49,112	34,209
आउटपुट टोकन	54,703	2,046
रीजनिंग टोकन	29,970	22,460
प्रतिक्रिया समय (औसत)	17.06s	9.76s
प्रतिक्रिया समय (अधिकतम)	46.35s	56.19s
प्रतिक्रिया समय (कुल)	221.83s	204.92s

जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#32 Claude Sonnet 4.6

medium

अमान्य SVG

लागत: $0.000
समय: 300.0s
टोकन: 0 tok

#4 GPT-5.5

low

लागत: $0.068
समय: 37.0s
टोकन: 2,339 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

एंटी-एआई ट्रिक्स	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Claude Sonnet 4.6	6.5	10.0	50.0%	0		2.98s	789	1,046	1,093
GPT-5.5	10.0	10.0	100.0%	0		4.41s	606	238	1,020

कोडिंग	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Claude Sonnet 4.6	5.7	6.6	44.4%	1		33.29s	6,995	16,089	3,686
GPT-5.5	10.0	10.0	100.0%	0		15.04s	7,302	423	6,402

संयुक्त	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Claude Sonnet 4.6	10.0	10.0	100.0%	0		46.35s	18,351	5,871	3,962
GPT-5.5	10.0	10.0	100.0%	0		9.56s	11,019	303	717

डेटा पार्सिंग और निष्कर्षण	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Claude Sonnet 4.6	10.0	10.0	100.0%	0		13.90s	8,676	649	742
GPT-5.5	10.0	10.0	100.0%	0		3.28s	7,140	228	157

डोमेन-विशिष्ट	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Claude Sonnet 4.6	2.9	7.2	11.1%	1		0ms	471	25,790	16,919
GPT-5.5	5.3	10.0	33.3%	0		28.05s	723	69	11,609

Samanya Buddhimatta	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Claude Sonnet 4.6	10.0	10.0	100.0%	0		4.94s	564	256	433
GPT-5.5	10.0	10.0	100.0%	0		5.17s	477	133	245

निर्देश पालन	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Claude Sonnet 4.6	10.0	10.0	100.0%	0		2.61s	792	318	552
GPT-5.5	9.9	10.0	100.0%	0		3.74s	660	93	415

पहेली समाधान	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Claude Sonnet 4.6	10.0	10.0	100.0%	0		5.31s	816	592	646
GPT-5.5	10.0	10.0	100.0%	0		4.74s	642	279	954

टूल कॉलिंग	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Claude Sonnet 4.6	10.0	10.0	100.0%	0		7.48s	11,454	655	351
GPT-5.5	10.0	10.0	100.0%	0		4.96s	5,445	250	101

सामान्य ज्ञान	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Claude Sonnet 4.6	3.0	10.0	0.0%	0		30.09s	204	3,437	1,586
GPT-5.5	3.0	10.0	0.0%	0		10.06s	195	30	840

त्वरित तुलना

तुलना जोड़ी बदलें

GPT-5.5lowvsQwen3.7 Maxmedium Claude Fable 5mediumvsGPT-5.5low Claude Sonnet 4.6mediumvsStep 3.7 Flashlow Gemini 3.1 Pro PreviewmediumvsGPT-5.5low Gemini 3.5 FlashmediumvsGPT-5.5low Claude Sonnet 4.6mediumvsDeepSeek V4 Prohigh Gemini 3 Flash PreviewmediumvsGPT-5.5low Claude Sonnet 4.6mediumvsGPT-5.3 Chatnone Claude Sonnet 4.6mediumvsDeepSeek V4 Flashhigh Claude Sonnet 4.6mediumvsGemini 3 Flash Previewlow GPT-5.5lowvsQwen3.6 Max Previewmedium Claude Opus 4.8mediumvsGPT-5.5low