AI BENCHY
Advertise here
#78

GPT-5.6 Luna

OpenAI प्रकाशन: 2026-07-09 चाचणी तारीख: 2026-08-14 02:21 openai/gpt-5.6-luna::high
~400B एकूण (~17B सक्रिय)MoEबंद स्रोतअंदाजित

सारांश

GPT-5.6 Luna AI BENCHY वर 7.6 स्कोर करते आणि #78 वर आहे. याची reliability 10.0, pass rate 69.7%, एकूण खर्च $0.179, आणि सरासरी response time 16.49s आहे.

GPT-5.6 Luna खास का आहे: हे डोमेन-विशिष्ट मध्ये सर्वाधिक उठून दिसते, जिथे त्याचा rank #4 आहे; तर कोडिंग हा सर्वात कमकुवत भाग आहे, rank #16.

मॉडेलची माहिती

संशोधन दिनांक: 2026-08-12

अंदाजित
पॅरामीटर्स
~400B एकूण (~17B सक्रिय)
आर्किटेक्चर
MoE
उपलब्धता
बंद स्रोत
परवाना
-

सार्वजनिक पुराव्यावर आधारित सर्वोत्तम अंदाज; प्रदात्याने सर्व मूल्ये जाहीर केलेली नाहीत.

सुसंगतता

8.5

एकूण खर्च (सध्याची किंमत)

$0.179 ↓ -79.1%

या किमतीवर चाचणी केली: $0.854

एकूण आउटपुट टोकन्स

135,315

एकूण इनपुट टोकन्स

80,927

इनपुट किंमत

$0.200 / 1M

आउटपुट किंमत

$1.200 / 1M

बरोबर चाचण्या

चुकीच्या चाचण्या: 8

प्रति प्रयत्न पास दर: 69.7%

अस्थिर चाचण्या

4

अस्थिर चाचण्यांत रन्समध्ये मिश्र निकाल असतात (किमान एक पास आणि एक फेल).

प्रतिसाद वेळ (सरासरी)

16.49s

प्रतिसाद वेळ (कमाल): 111.09s

प्रतिसाद वेळ (एकूण): 362.78s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#78 GPT-5.6 Luna

high
खर्च
$0.033
वेळ
34.2s
टोकन्स
5,484 tok

रन इतिहास

चाचणी तारीख स्कोअर विश्वसनीयता बरोबर चाचण्या एकूण खर्च तुलना करा
2026-08-14 02:21 पुन्हा चाचणी 7.6 10.0 $0.090 सध्याची रन
2026-07-16 22:38 नवीन चाचणी जोडली 7.7 10.0 $1.017 तुलना करा
2026-07-09 21:32 पहिला रन 7.7 10.0 $0.924 तुलना करा

या रनमध्ये वेगळा बेंचमार्क सूट वापरला गेला. ऐतिहासिक बदल वाचताना सूटमधील बदल लक्षात घ्या.

रन तुलना

रनबेंचमार्क कव्हरेजस्कोअरसुसंगतताविश्वसनीयताबरोबर चाचण्याअस्थिर चाचण्याएकूण आउटपुट टोकन्सएकूण इनपुट टोकन्सएकूण खर्चप्रतिसाद वेळ (सरासरी)
2026-08-14 02:21 · सध्याची रन66/66 प्रयत्न7.68.510.014/224135,31580,927$0.17916.49s
2026-07-09 21:32 · पहिला रन63/63 प्रयत्न7.78.810.014/213147,89535,699$0.92418.39s
फरक-0.1-0.30.00+1-12580+45228-$0.745-1903ms

बेंचमार्क कव्हरेज वेगळे आहे: 66/66 प्रयत्न (लक्ष्य: प्रत्येक चाचणीसाठी 3 पुनरावृत्ती) विरुद्ध 63/63 प्रयत्न (लक्ष्य: प्रत्येक चाचणीसाठी 3 पुनरावृत्ती). एकूण मूल्ये आणि पुनरावृत्तीवर अवलंबून मेट्रिक्स थेट तुलना करता येत नाहीत.

या दोन रनमध्ये वेगवेगळे बेंचमार्क सूट वापरले गेले, त्यामुळे फरकांमध्ये मॉडेलमधील आणि सूटमधील दोन्ही बदल दिसतात.

किंमत इतिहास

OpenRouter मधील या मॉडेलचा ऐतिहासिक किंमत डेटा.

तारीख इनपुट किंमत आउटपुट किंमत
2026-07-09 21:33 $1.000 / 1M $6.000 / 1M
2026-07-28 08:40 $0.500 / 1M $3.000 / 1M
2026-07-31 10:14 $0.100 / 1M $0.601 / 1M
2026-08-14 12:51 $0.100 / 1M $0.600 / 1M
2026-08-20 12:51 $0.200 / 1M $1.200 / 1M

चार्ट्स

पहिले मॉडेल निवडा, नंतर दुसरे मॉडेल क्लिक करून बाजू-बाजूची तुलना पेज उघडा.

एकूण आउटपुट टोकन्स

स्कोअर vs एकूण आउटपुट टोकन्स

झटपट तुलना

श्रेणीवार तपशील

श्रेणी स्कोअर सुसंगतता बरोबर चाचण्या
अँटी-एआय युक्त्या 8.3 10.0
कोडिंग 5.5 4.7
संयुक्त 10.0 10.0
डेटा पार्सिंग आणि निष्कर्षण 10.0 10.0
डोमेन-विशिष्ट 5.3 7.2
Samanya Buddhimatta 5.0 10.0
सूचनांचे पालन 9.9 10.0
कोडी सोडवणे 7.6 7.2
टूल कॉलिंग 10.0 10.0
सामान्य ज्ञान 3.0 10.0

तुलना केलेली मॉडेल्स