AI BENCHY Compare

Anthropic: Claude Opus 4.8 vs OpenAI: GPT-5.2 Chat

सारांश

Claude Opus 4.8 (medium) vs GPT-5.2 Chat benchmark तुलना: Claude Opus 4.8 (medium) average score मध्ये पुढे आहे: 8.8 vs 8.5. GPT-5.2 Chat चा benchmark खर्च कमी आहे: $0.393 vs $1.107. GPT-5.2 Chat वेगवान आहे: 7.13s vs 9.72s, pass rates 84.1% vs 74.6%.

शिफारस केलेले मॉडेल: GPT-5.2 Chat - Its score stays close to the best score here (8.5 vs 8.8), while costing about 2.8x less than Claude Opus 4.8 (medium).

AI BENCHY टेस्ट सूटमधून बेंचमार्क या वेळी तयार झाले: 2026-07-10

मेट्रिक	Claude Opus 4.8 Claude Opus 4.8 medium प्रकाशन: 2026-05-28	GPT-5.2 Chat GPT-5.2 Chat none प्रकाशन: 2025-12-11

मेट्रिक	Claude Opus 4.8 Claude Opus 4.8 medium प्रकाशन: 2026-05-28	GPT-5.2 Chat GPT-5.2 Chat none प्रकाशन: 2025-12-11
स्कोअर	8.8	8.5
क्रमांक	#15	#22
विश्वसनीयता	10.0	10.0
सुसंगतता	9.6	8.9
बरोबर चाचण्या
प्रति प्रयत्न पास दर	84.1%	74.6%
अस्थिर चाचण्या	1	3
एकूण रन	63	63
प्रति निकाल खर्च	6.512	2.803
एकूण खर्च	$1.107	$0.393
इनपुट किंमत	$5.000 / 1M	$1.750 / 1M
आउटपुट किंमत	$25.000 / 1M	$14.000 / 1M
एकूण इनपुट टोकन्स	61,007	34,212
आउटपुट टोकन्स	26,495	23,744
रिझनिंग टोकन्स	5,901	0
प्रतिसाद वेळ (सरासरी)	9.72s	7.13s
प्रतिसाद वेळ (कमाल)	38.03s	38.52s
प्रतिसाद वेळ (एकूण)	204.19s	149.69s

जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#15 Claude Opus 4.8

medium

खर्च: $0.057
वेळ: 23.1s
टोकन्स: 2,412 tok

#22 GPT-5.2 Chat

none

खर्च: $0.010
वेळ: 15.3s
टोकन्स: 797 tok

स्कोअरनुसार शीर्ष मॉडेल्स

स्कोअर विरुद्ध एकूण खर्च

प्रतिसाद वेळ (सरासरी)

स्कोअर vs प्रतिसाद वेळ (सरासरी)

एकूण आउटपुट टोकन्स

स्कोअर vs एकूण आउटपुट टोकन्स

श्रेणीवार तपशील

अँटी-एआय युक्त्या	स्कोअर	सुसंगतता	प्रति प्रयत्न पास दर	अस्थिर चाचण्या	बरोबर चाचण्या	प्रतिसाद वेळ (सरासरी)	इनपुट टोकन्स	आउटपुट टोकन्स	रिझनिंग टोकन्स
Claude Opus 4.8	10.0	10.0	100.0%	0		3.95s	834	1,179	478
GPT-5.2 Chat	8.7	7.9	91.7%	1		3.40s	606	1,807	0

कोडिंग	स्कोअर	सुसंगतता	प्रति प्रयत्न पास दर	अस्थिर चाचण्या	बरोबर चाचण्या	प्रतिसाद वेळ (सरासरी)	इनपुट टोकन्स	आउटपुट टोकन्स	रिझनिंग टोकन्स
Claude Opus 4.8	10.0	10.0	100.0%	0		15.33s	10,590	9,945	1,381
GPT-5.2 Chat	8.8	7.8	88.9%	1		9.82s	7,305	6,731	0

संयुक्त	स्कोअर	सुसंगतता	प्रति प्रयत्न पास दर	अस्थिर चाचण्या	बरोबर चाचण्या	प्रतिसाद वेळ (सरासरी)	इनपुट टोकन्स	आउटपुट टोकन्स	रिझनिंग टोकन्स
Claude Opus 4.8	9.8	10.0	100.0%	0		38.03s	23,561	5,260	1,588
GPT-5.2 Chat	10.0	10.0	100.0%	0		9.12s	11,019	1,243	0

डेटा पार्सिंग आणि निष्कर्षण	स्कोअर	सुसंगतता	प्रति प्रयत्न पास दर	अस्थिर चाचण्या	बरोबर चाचण्या	प्रतिसाद वेळ (सरासरी)	इनपुट टोकन्स	आउटपुट टोकन्स	रिझनिंग टोकन्स
Claude Opus 4.8	7.1	5.6	83.3%	1		12.29s	10,503	481	312
GPT-5.2 Chat	10.0	10.0	100.0%	0		3.05s	7,140	980	0

डोमेन-विशिष्ट	स्कोअर	सुसंगतता	प्रति प्रयत्न पास दर	अस्थिर चाचण्या	बरोबर चाचण्या	प्रतिसाद वेळ (सरासरी)	इनपुट टोकन्स	आउटपुट टोकन्स	रिझनिंग टोकन्स
Claude Opus 4.8	5.3	10.0	33.3%	0		14.59s	975	7,477	900
GPT-5.2 Chat	5.3	10.0	33.3%	0		17.78s	723	7,810	0

Samanya Buddhimatta	स्कोअर	सुसंगतता	प्रति प्रयत्न पास दर	अस्थिर चाचण्या	बरोबर चाचण्या	प्रतिसाद वेळ (सरासरी)	इनपुट टोकन्स	आउटपुट टोकन्स	रिझनिंग टोकन्स
Claude Opus 4.8	10.0	10.0	100.0%	0		2.46s	708	237	0
GPT-5.2 Chat	4.4	3.0	33.3%	1		3.20s	477	335	0

सूचनांचे पालन	स्कोअर	सुसंगतता	प्रति प्रयत्न पास दर	अस्थिर चाचण्या	बरोबर चाचण्या	प्रतिसाद वेळ (सरासरी)	इनपुट टोकन्स	आउटपुट टोकन्स	रिझनिंग टोकन्स
Claude Opus 4.8	10.0	10.0	100.0%	0		3.32s	909	373	320
GPT-5.2 Chat	9.8	10.0	100.0%	0		5.51s	660	1,441	0

कोडी सोडवणे	स्कोअर	सुसंगतता	प्रति प्रयत्न पास दर	अस्थिर चाचण्या	बरोबर चाचण्या	प्रतिसाद वेळ (सरासरी)	इनपुट टोकन्स	आउटपुट टोकन्स	रिझनिंग टोकन्स
Claude Opus 4.8	10.0	10.0	100.0%	0		3.95s	894	791	483
GPT-5.2 Chat	7.7	10.0	66.7%	0		4.10s	642	1,603	0

टूल कॉलिंग	स्कोअर	सुसंगतता	प्रति प्रयत्न पास दर	अस्थिर चाचण्या	बरोबर चाचण्या	प्रतिसाद वेळ (सरासरी)	इनपुट टोकन्स	आउटपुट टोकन्स	रिझनिंग टोकन्स
Claude Opus 4.8	10.0	10.0	100.0%	0		8.96s	11,775	301	225
GPT-5.2 Chat	10.0	10.0	100.0%	0		4.68s	5,445	555	0

सामान्य ज्ञान	स्कोअर	सुसंगतता	प्रति प्रयत्न पास दर	अस्थिर चाचण्या	बरोबर चाचण्या	प्रतिसाद वेळ (सरासरी)	इनपुट टोकन्स	आउटपुट टोकन्स	रिझनिंग टोकन्स
Claude Opus 4.8	3.0	10.0	0.0%	0		6.14s	258	451	214
GPT-5.2 Chat	3.0	10.0	0.0%	0		6.89s	195	1,239	0

झटपट तुलना

तुलना जोडी बदला

Seed-2.0-LitemediumvsGPT-5.2 Chatnone GPT-5.2 ChatnonevsStep 3.7 Flashmedium GPT-5.2 ChatnonevsGLM 5medium GPT-5.2 ChatnonevsGrok 4.5medium GPT-5.2 ChatnonevsGLM 5.2medium DeepSeek V4 FlashhighvsGPT-5.2 Chatnone Claude Opus 4.7mediumvsGPT-5.2 Chatnone Gemini 2.5 FlashmediumvsGPT-5.2 Chatnone GPT-5.2 ChatnonevsQwen3.7 Plusmedium Nemotron 3 Ultra 550b A55bmediumमोफत उपलब्धvsGPT-5.2 Chatnone GPT-5.2 ChatnonevsQwen3.6 Max Previewmedium Claude Opus 4.8mediumvsGemini 3.5 Flashlow