AI BENCHY
Advertise here
#22

GPT-5.2

OpenAI प्रकाशन: 2025-12-11 चाचणी तारीख: 2026-06-04 13:45 openai/gpt-5.2::medium

सारांश

GPT-5.2 AI BENCHY वर 8.4 स्कोर करते आणि #22 वर आहे. याची reliability 10.0, pass rate 71.4%, एकूण खर्च $0.548, आणि सरासरी response time 16.88s आहे.

GPT-5.2 खास का आहे: हे कोडिंग मध्ये सर्वाधिक उठून दिसते, जिथे त्याचा rank #1 आहे; तर अँटी-एआय युक्त्या हा सर्वात कमकुवत भाग आहे, rank #16.

सुसंगतता

8.4

एकूण आउटपुट टोकन्स

34,833

एकूण इनपुट टोकन्स

33,967

इनपुट किंमत

$1.750 / 1M

आउटपुट किंमत

$14.000 / 1M

बरोबर चाचण्या

चुकीच्या चाचण्या: 8

प्रति प्रयत्न पास दर: 71.4%

अस्थिर चाचण्या

4

अस्थिर चाचण्यांत रन्समध्ये मिश्र निकाल असतात (किमान एक पास आणि एक फेल).

प्रतिसाद वेळ (सरासरी)

16.88s

प्रतिसाद वेळ (कमाल): 77.80s

प्रतिसाद वेळ (एकूण): 236.34s

जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#22 GPT-5.2

medium
खर्च
$0.047
वेळ
49.2s
टोकन्स
3,396 tok

रन इतिहास

चाचणी तारीख स्कोअर विश्वसनीयता बरोबर चाचण्या एकूण खर्च तुलना करा
2026-06-04 13:45 नवीन चाचणी जोडली 7.5 10.0 $0.548 सध्याची रन
2026-05-22 00:19 पुन्हा चाचणी 7.4 10.0 $0.490 तुलना करा
2026-04-11 01:44 पहिली नोंदलेली रन 7.5 लागू नाही $0.352 तुलना करा

या रनमध्ये वेगळा बेंचमार्क सूट वापरला गेला. ऐतिहासिक बदल वाचताना सूटमधील बदल लक्षात घ्या.

रन तुलना

रनस्कोअरसुसंगतताविश्वसनीयताबरोबर चाचण्याअस्थिर चाचण्याएकूण आउटपुट टोकन्सएकूण इनपुट टोकन्सएकूण खर्चप्रतिसाद वेळ (सरासरी)
2026-06-04 13:45 · सध्याची रन8.48.410.013/21434,83333,967$0.54816.88s
2026-05-22 00:19 · पुन्हा चाचणी7.48.310.012/20431,0570$0.49016.44s
फरक+1.0+0.10.0+10+3776+33967+$0.058+437ms

या दोन रनमध्ये वेगवेगळे बेंचमार्क सूट वापरले गेले, त्यामुळे फरकांमध्ये मॉडेलमधील आणि सूटमधील दोन्ही बदल दिसतात.

किंमत इतिहास

OpenRouter मधील या मॉडेलचा ऐतिहासिक किंमत डेटा.

तारीख इनपुट किंमत आउटपुट किंमत
2026-06-04 15:40 $1.750 / 1M $14.000 / 1M

चार्ट्स

पहिले मॉडेल निवडा, नंतर दुसरे मॉडेल क्लिक करून बाजू-बाजूची तुलना पेज उघडा.

एकूण आउटपुट टोकन्स

स्कोअर vs एकूण आउटपुट टोकन्स

झटपट तुलना

श्रेणीवार तपशील

श्रेणी स्कोअर सुसंगतता बरोबर चाचण्या
अँटी-एआय युक्त्या 6.5 8.0
कोडिंग 10.0 10.0
संयुक्त 10.0 10.0
डेटा पार्सिंग आणि निष्कर्षण 10.0 10.0
डोमेन-विशिष्ट 5.9 7.2
Samanya Buddhimatta 3.7 9.7
सूचनांचे पालन 9.9 10.0
कोडी सोडवणे 7.5 7.3
टूल कॉलिंग 4.7 1.6
सामान्य ज्ञान 3.0 10.0

तुलना केलेली मॉडेल्स