AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com
#57

GPT-5.2

OpenAI रिलीज़: 2025-12-11 परीक्षण किया गया: 2026-05-22 00:19 openai/gpt-5.2::medium
~1.2T कुल (~80B सक्रिय)MoEबंद स्रोतअनुमानित

सारांश

GPT-5.2 AI BENCHY पर 7.4 स्कोर करता है और #57 पर है। इसकी reliability 10.0, pass rate 70.0%, कुल लागत $0.490, और औसत response time 16.44s है।

GPT-5.2 को अलग क्या बनाता है: यह डोमेन-विशिष्ट में सबसे अलग दिखता है, जहाँ इसकी रैंक #1 है; जबकि एंटी-एआई ट्रिक्स इसकी सबसे कमजोर जगह है, जहाँ यह #17 पर है।

मॉडल विवरण

शोध की तारीख: 2026-08-12

अनुमानित
पैरामीटर
~1.2T कुल (~80B सक्रिय)
आर्किटेक्चर
MoE
उपलब्धता
बंद स्रोत
लाइसेंस
-

सार्वजनिक साक्ष्यों पर आधारित सर्वोत्तम अनुमान; प्रदाता ने सभी मान जारी नहीं किए हैं।

संगति

8.3

कुल आउटपुट टोकन

31,057

कुल इनपुट टोकन

0

इनपुट कीमत

$1.750 / 1M

आउटपुट कीमत

$14.000 / 1M

कैश पढ़ने की कीमत

लागू नहीं

कैश लिखने की कीमत

लागू नहीं

कैश की कीमतें इनपुट टोकन पर लागू होती हैं। पढ़ने पर कैश किए गए प्रॉम्प्ट का दोबारा उपयोग होता है; लिखने पर वे सहेजे जाते हैं और अतिरिक्त लागत हो सकती है। आउटपुट टोकन पर आउटपुट की कीमत लागू होती है।

सही परीक्षण

गलत टेस्ट: 8

प्रति प्रयास पास दर: 70.0%

अस्थिर टेस्ट

4

अस्थिर टेस्ट में रनों के बीच मिले-जुले परिणाम रहे (कम से कम एक पास और एक फेल)।

प्रतिक्रिया समय (औसत)

16.44s

प्रतिक्रिया समय (अधिकतम): 77.80s

प्रतिक्रिया समय (कुल): 213.77s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#57 GPT-5.2

medium
लागत
$0.047
समय
49.2s
टोकन
3,396 tok

रन इतिहास

परीक्षण किया गया स्कोर विश्वसनीयता सही परीक्षण कुल लागत तुलना करें
2026-08-14 02:17 दोबारा परीक्षण 8.4 10.0 $1.182 तुलना करें
2026-07-16 22:37 नया टेस्ट जोड़ा गया 8.4 10.0 $0.951 तुलना करें
2026-06-04 13:45 नया टेस्ट जोड़ा गया 7.5 10.0 $0.548 तुलना करें
2026-05-22 00:19 दोबारा परीक्षण 7.4 10.0 $0.490 वर्तमान रन
2026-04-11 01:44 पहला दर्ज रन 7.5 लागू नहीं $0.352 तुलना करें

रन तुलना

रनबेंचमार्क कवरेजस्कोरसंगतिविश्वसनीयतासही परीक्षणअस्थिर टेस्टकुल आउटपुट टोकनकुल इनपुट टोकनकुल लागतप्रतिक्रिया समय (औसत)
2026-05-22 00:19 · दोबारा परीक्षण60/60 प्रयास7.48.310.012/20431,0570$0.49016.44s
2026-04-11 01:44 · पहला दर्ज रन54/54 प्रयास7.58.1लागू नहीं11/18421,6820$0.35214.04s
अंतर—-0.1+0.2+10+93750+$0.139+2407ms

बेंचमार्क कवरेज अलग है: 60/60 प्रयास (लक्ष्य: प्रति टेस्ट 3 दोहराव) बनाम 54/54 प्रयास (लक्ष्य: प्रति टेस्ट 3 दोहराव)। कुल और दोहराव-संवेदनशील मेट्रिक सीधे तुलना योग्य नहीं हैं।

इन दो रन में अलग-अलग बेंचमार्क सूट इस्तेमाल हुए थे, इसलिए अंतर मॉडल बदलाव और सूट बदलाव दोनों को दर्शाते हैं।

चार्ट

पहले मॉडल चुनें, फिर दूसरा मॉडल क्लिक करके साइड-बाय-साइड पेज खोलें।

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

त्वरित तुलना

श्रेणी विवरण

श्रेणी स्कोर संगति सही परीक्षण
एंटी-एआई ट्रिक्स 6.5 8.0
कोडिंग 10.0 10.0
संयुक्त 10.0 10.0
डेटा पार्सिंग और निष्कर्षण 10.0 10.0
डोमेन-विशिष्ट 5.9 7.2
Samanya Buddhimatta 3.7 9.7
निर्देश पालन 9.9 10.0
पहेली समाधान 7.6 7.3
टूल कॉलिंग 4.7 1.6
सामान्य ज्ञान 3.0 10.0

तुलना किए गए मॉडल