#32

GPT-5.2 Chat

OpenAI रिलीज़: 2025-12-11 परीक्षण किया गया: 2026-04-11 01:44 openai/gpt-5.2-chat::none

सारांश

GPT-5.2 Chat AI BENCHY पर 7.9 स्कोर करता है और #32 पर है। इसकी reliability लागू नहीं, pass rate 75.9%, कुल लागत $0.291, और औसत response time 6.84s है।

GPT-5.2 Chat को अलग क्या बनाता है: यह समान मॉडलों की तुलना में काफ़ी तेज है।

स्कोर

7.9

संगति

8.7

विश्वसनीयता

लागू नहीं

कुल लागत (वर्तमान कीमत)

$0.291

कुल आउटपुट टोकन

17,346

कुल इनपुट टोकन

इनपुट कीमत

$1.750 / 1M

आउटपुट कीमत

$14.000 / 1M

सही परीक्षण

गलत टेस्ट: 6

प्रति प्रयास पास दर: 75.9%

अस्थिर टेस्ट

अस्थिर टेस्ट में रनों के बीच मिले-जुले परिणाम रहे (कम से कम एक पास और एक फेल)।

प्रतिक्रिया समय (औसत)

6.84s

प्रतिक्रिया समय (अधिकतम): 38.52s

प्रतिक्रिया समय (कुल): 123.17s

गलत उत्तर: 5 निर्देशों का पालन नहीं किया: 1

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#32 GPT-5.2 Chat

none

लागत: $0.010
समय: 15.3s
टोकन: 797 tok

रन इतिहास

परीक्षण किया गया	स्कोर	विश्वसनीयता	कुल लागत	तुलना करें
2026-07-16 22:40 नया टेस्ट जोड़ा गया	8.0	10.0	$0.604	तुलना करें
2026-06-04 13:47 नया टेस्ट जोड़ा गया	7.9	10.0	$0.393	तुलना करें
2026-05-22 00:19 सूट बदला गया	7.6	10.0	$0.355	तुलना करें
2026-04-11 01:44 पहला दर्ज रन	7.9	लागू नहीं	$0.291	वर्तमान रन

रन तुलना

रन	स्कोर	संगति	विश्वसनीयता	सही परीक्षण	अस्थिर टेस्ट	कुल आउटपुट टोकन	कुल लागत	प्रतिक्रिया समय (औसत)
2026-04-11 01:44 · पहला दर्ज रन	7.9	8.7	लागू नहीं	12/18	3	17,346	$0.291	6.84s
2026-05-22 00:19 · सूट बदला गया	7.6	8.5	10.0	12/20	4	21,371	$0.355	6.86s
अंतर	+0.3	+0.2		0	-1	-4025	-$0.064	-16ms

इन दो रन में अलग-अलग बेंचमार्क सूट इस्तेमाल हुए थे, इसलिए अंतर मॉडल बदलाव और सूट बदलाव दोनों को दर्शाते हैं।

चार्ट

पहले मॉडल चुनें, फिर दूसरा मॉडल क्लिक करके साइड-बाय-साइड पेज खोलें।

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

त्वरित तुलना

GPT-5.2 ChatnonevsStep 3.7 Flashmedium GPT-5.2 ChatnonevsGLM 5.2high GPT-5.2 ChatnonevsMuse Spark 1.1high GPT-5.2 ChatnonevsKimi K3max GPT-5.2 ChatnonevsGPT-5 Minimedium GPT-5.2 ChatnonevsGPT-5.6 Terrahigh GPT-5.2 ChatnonevsGemini 3 Flash Previewmedium GPT-5.2 ChatnonevsGemini 3.5 Flashhigh GPT-5.2 ChatnonevsNemotron 3 Ultramediumनिःशुल्क उपलब्ध GPT-5.2 ChatnonevsGPT-5.5low

श्रेणी विवरण

श्रेणी	स्कोर	संगति
एंटी-एआई ट्रिक्स	8.7	7.9
कोडिंग	10.0	10.0
संयुक्त	10.0	10.0
डेटा पार्सिंग और निष्कर्षण	10.0	10.0
डोमेन-विशिष्ट	5.3	10.0
Samanya Buddhimatta	4.4	3.0
निर्देश पालन	7.5	6.1
पहेली समाधान	7.7	10.0
टूल कॉलिंग	10.0	10.0

GPT-5.2 Chat

Hamster playing table tennis

#32 GPT-5.2 Chat

चार्ट

स्कोर के अनुसार शीर्ष मॉडल

स्कोर vs कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

त्वरित तुलना

श्रेणी विवरण

तुलना किए गए मॉडल