AI BENCHY तुलना

Anthropic: Claude Sonnet 4.6 vs OpenAI: GPT-5.2

सारांश

Claude Sonnet 4.6 vs GPT-5.2 benchmark तुलना: GPT-5.2 average score में आगे है: 8.4 vs 7.3. Claude Sonnet 4.6 की benchmark लागत कम है: $0.316 vs $0.548. Claude Sonnet 4.6 तेज है: 5.04s vs 16.88s, pass rates 55.6% vs 71.4%.

अनुशंसित मॉडल: GPT-5.2 - It has the strongest score in this comparison (8.4) and the best overall balance of cost and response time across all 2 models.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-07-02

मेट्रिक	Claude Sonnet 4.6 Claude Sonnet 4.6 none रिलीज़: 2026-02-17	GPT-5.2 GPT-5.2 medium रिलीज़: 2025-12-11

मेट्रिक	Claude Sonnet 4.6 Claude Sonnet 4.6 none रिलीज़: 2026-02-17	GPT-5.2 GPT-5.2 medium रिलीज़: 2025-12-11
स्कोर	7.3	8.4
रैंक	#57	#22
विश्वसनीयता	10.0	10.0
संगति	9.7	8.4
सही परीक्षण
प्रति प्रयास पास दर	55.6%	71.4%
अस्थिर टेस्ट	1	4
कुल रन	63	63
प्रति परिणाम लागत	2.870	4.209
कुल लागत	$0.316	$0.548
इनपुट कीमत	$3.000 / 1M	$1.750 / 1M
आउटपुट कीमत	$15.000 / 1M	$14.000 / 1M
कुल इनपुट टोकन	57,886	33,967
आउटपुट टोकन	9,465	2,901
रीजनिंग टोकन	0	31,932
प्रतिक्रिया समय (औसत)	5.04s	16.88s
प्रतिक्रिया समय (अधिकतम)	23.84s	77.80s
प्रतिक्रिया समय (कुल)	70.60s	236.34s

जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#57 Claude Sonnet 4.6

none

लागत: $0.038
समय: 27.3s
टोकन: 2,598 tok

#22 GPT-5.2

medium

लागत: $0.047
समय: 49.2s
टोकन: 3,396 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

एंटी-एआई ट्रिक्स	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Claude Sonnet 4.6	4.8	10.0	25.0%	0		2.94s	636	1,214	0
GPT-5.2	6.5	8.0	58.3%	1		7.81s	606	567	2,002

कोडिंग	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Claude Sonnet 4.6	5.5	10.0	33.3%	0		5.19s	8,522	2,127	0
GPT-5.2	10.0	10.0	100.0%	0		22.73s	7,302	511	11,912

संयुक्त	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Claude Sonnet 4.6	9.5	10.0	100.0%	0		23.84s	26,024	3,766	0
GPT-5.2	10.0	10.0	100.0%	0		14.06s	11,019	291	1,757

डेटा पार्सिंग और निष्कर्षण	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Claude Sonnet 4.6	10.0	10.0	100.0%	0		3.43s	8,574	252	0
GPT-5.2	10.0	10.0	100.0%	0		3.15s	7,140	234	420

डोमेन-विशिष्ट	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Claude Sonnet 4.6	7.7	10.0	66.7%	0		3.54s	759	413	0
GPT-5.2	5.9	7.2	55.6%	1		77.80s	473	42	10,342

Samanya Buddhimatta	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Claude Sonnet 4.6	6.1	3.1	66.7%	1		2.56s	513	192	0
GPT-5.2	3.7	9.7	0.0%	0		4.32s	477	162	269

निर्देश पालन	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Claude Sonnet 4.6	6.5	10.0	50.0%	0		1.96s	690	90	0
GPT-5.2	9.9	10.0	100.0%	0		3.12s	660	94	614

पहेली समाधान	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Claude Sonnet 4.6	7.7	10.0	66.7%	0		2.53s	663	533	0
GPT-5.2	7.5	7.3	77.8%	1		5.80s	642	735	924

टूल कॉलिंग	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Claude Sonnet 4.6	10.0	10.0	100.0%	0		4.11s	11,301	447	0
GPT-5.2	4.7	1.6	66.7%	1		10.30s	5,453	239	469

सामान्य ज्ञान	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Claude Sonnet 4.6	3.0	10.0	0.0%	0		4.67s	204	431	0
GPT-5.2	3.0	10.0	0.0%	0		28.18s	195	26	3,223

त्वरित तुलना

तुलना जोड़ी बदलें