AI BENCHY
Advertise here
#116

GPT-5.6 Sol

OpenAI प्रकाशन: 2026-07-09 चाचणी तारीख: 2026-08-14 02:21 openai/gpt-5.6-sol::none
~2T एकूण (~150B सक्रिय)MoEबंद स्रोतअंदाजित

सारांश

GPT-5.6 Sol AI BENCHY वर 7.0 स्कोर करते आणि #116 वर आहे. याची reliability 10.0, pass rate 63.6%, एकूण खर्च $0.262, आणि सरासरी response time 2.17s आहे.

GPT-5.6 Sol खास का आहे: हे डोमेन-विशिष्ट मध्ये सर्वाधिक उठून दिसते, जिथे त्याचा rank #1 आहे; तर कोडिंग हा सर्वात कमकुवत भाग आहे, rank #15. समान मॉडेल्सच्या तुलनेत हे लक्षणीय वेगवान आहे.

मॉडेलची माहिती

संशोधन दिनांक: 2026-08-12

अंदाजित
पॅरामीटर्स
~2T एकूण (~150B सक्रिय)
आर्किटेक्चर
MoE
उपलब्धता
बंद स्रोत
परवाना
-

सार्वजनिक पुराव्यावर आधारित सर्वोत्तम अंदाज; प्रदात्याने सर्व मूल्ये जाहीर केलेली नाहीत.

सुसंगतता

9.0

एकूण खर्च (सध्याची किंमत)

$0.262 ↓ -50.0%

या किमतीवर चाचणी केली: $0.524

एकूण आउटपुट टोकन्स

4,357

एकूण इनपुट टोकन्स

78,602

इनपुट किंमत

$2.500 / 1M

आउटपुट किंमत

$15.000 / 1M

बरोबर चाचण्या

चुकीच्या चाचण्या: 10

प्रति प्रयत्न पास दर: 63.6%

अस्थिर चाचण्या

3

अस्थिर चाचण्यांत रन्समध्ये मिश्र निकाल असतात (किमान एक पास आणि एक फेल).

प्रतिसाद वेळ (सरासरी)

2.17s

प्रतिसाद वेळ (कमाल): 12.81s

प्रतिसाद वेळ (एकूण): 47.66s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#116 GPT-5.6 Sol

none
खर्च
$0.116
वेळ
78.7s
टोकन्स
3,944 tok

रन इतिहास

चाचणी तारीख स्कोअर विश्वसनीयता बरोबर चाचण्या एकूण खर्च तुलना करा
2026-08-14 02:21 पुन्हा चाचणी 7.0 10.0 $0.524 सध्याची रन
2026-07-16 22:37 नवीन चाचणी जोडली 6.9 10.0 $0.524 तुलना करा
2026-07-09 21:15 पहिला रन 6.3 10.0 $0.225 तुलना करा

या रनमध्ये वेगळा बेंचमार्क सूट वापरला गेला. ऐतिहासिक बदल वाचताना सूटमधील बदल लक्षात घ्या.

रन तुलना

रनबेंचमार्क कव्हरेजस्कोअरसुसंगतताविश्वसनीयताबरोबर चाचण्याअस्थिर चाचण्याएकूण आउटपुट टोकन्सएकूण इनपुट टोकन्सएकूण खर्चप्रतिसाद वेळ (सरासरी)
2026-08-14 02:21 · सध्याची रन66/66 प्रयत्न7.09.010.012/2234,35778,602$0.2622.17s
2026-07-09 21:15 · पहिला रन63/63 प्रयत्न6.39.010.010/2131,77634,218$0.2251.66s
फरक+0.70.00.0+20+2581+44384+$0.038+509ms

बेंचमार्क कव्हरेज वेगळे आहे: 66/66 प्रयत्न (लक्ष्य: प्रत्येक चाचणीसाठी 3 पुनरावृत्ती) विरुद्ध 63/63 प्रयत्न (लक्ष्य: प्रत्येक चाचणीसाठी 3 पुनरावृत्ती). एकूण मूल्ये आणि पुनरावृत्तीवर अवलंबून मेट्रिक्स थेट तुलना करता येत नाहीत.

या दोन रनमध्ये वेगवेगळे बेंचमार्क सूट वापरले गेले, त्यामुळे फरकांमध्ये मॉडेलमधील आणि सूटमधील दोन्ही बदल दिसतात.

किंमत इतिहास

OpenRouter मधील या मॉडेलचा ऐतिहासिक किंमत डेटा.

तारीख इनपुट किंमत आउटपुट किंमत
2026-08-14 12:51 $5.000 / 1M $30.000 / 1M
2026-08-20 12:51 $2.500 / 1M $15.000 / 1M

चार्ट्स

पहिले मॉडेल निवडा, नंतर दुसरे मॉडेल क्लिक करून बाजू-बाजूची तुलना पेज उघडा.

एकूण आउटपुट टोकन्स

स्कोअर vs एकूण आउटपुट टोकन्स

झटपट तुलना

श्रेणीवार तपशील

श्रेणी स्कोअर सुसंगतता बरोबर चाचण्या
अँटी-एआय युक्त्या 8.3 10.0
कोडिंग 5.5 10.0
संयुक्त 6.5 10.0
डेटा पार्सिंग आणि निष्कर्षण 10.0 10.0
डोमेन-विशिष्ट 5.9 7.2
Samanya Buddhimatta 6.5 3.4
सूचनांचे पालन 8.5 6.8
कोडी सोडवणे 7.7 10.0
टूल कॉलिंग 10.0 10.0
सामान्य ज्ञान 3.0 10.0

तुलना केलेली मॉडेल्स