#54 GPT-5.6 Luna
medium- खर्च
- $0.014
- वेळ
- 14.6s
- टोकन्स
- 2,362 tok
सारांश
GPT-5.6 Luna AI BENCHY वर 7.6 स्कोर करते आणि #54 वर आहे. याची reliability 10.0, pass rate 63.5%, एकूण खर्च $0.258, आणि सरासरी response time 6.70s आहे.
GPT-5.6 Luna खास का आहे: हे डोमेन-विशिष्ट मध्ये सर्वाधिक उठून दिसते, जिथे त्याचा rank #2 आहे; तर कोडिंग हा सर्वात कमकुवत भाग आहे, rank #17. या score range साठी एकूण benchmark खर्च असामान्यपणे कमी आहे. समान मॉडेल्सच्या तुलनेत हे लक्षणीय वेगवान आहे.
संशोधन दिनांक: 2026-08-12
सार्वजनिक पुराव्यावर आधारित सर्वोत्तम अंदाज; प्रदात्याने सर्व मूल्ये जाहीर केलेली नाहीत.
7.6
सुसंगतता
9.6
10.0
$0.258
एकूण आउटपुट टोकन्स
36,888
एकूण इनपुट टोकन्स
35,699
इनपुट किंमत
$1.000 / 1M
आउटपुट किंमत
$6.000 / 1M
कॅश वाचण्याची किंमत
लागू नाही
कॅश लिहिण्याची किंमत
लागू नाही
कॅशच्या किमती इनपुट टोकनला लागू होतात. वाचताना साठवलेले प्रॉम्प्ट पुन्हा वापरले जातात; लिहिताना ते साठवले जातात आणि अधिक खर्च होऊ शकतो. आउटपुट टोकनला आउटपुट किंमत लागू होते.
अस्थिर चाचण्या
1
अस्थिर चाचण्यांत रन्समध्ये मिश्र निकाल असतात (किमान एक पास आणि एक फेल).
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
रन इतिहास
| चाचणी तारीख | स्कोअर | विश्वसनीयता | बरोबर चाचण्या | एकूण खर्च | तुलना करा |
|---|---|---|---|---|---|
| 2026-08-14 02:20 पुन्हा चाचणी | 7.4 | 10.0 | $0.036 ↓ | तुलना करा | |
| 2026-07-16 22:37 नवीन चाचणी जोडली | 7.6 | 10.0 | $0.352 | तुलना करा | |
| 2026-07-09 21:16 पहिला रन | 7.6 | 10.0 | $0.258 | सध्याची रन |
रन तुलना
| रन | बेंचमार्क कव्हरेज | स्कोअर | सुसंगतता | विश्वसनीयता | बरोबर चाचण्या | अस्थिर चाचण्या | एकूण आउटपुट टोकन्स | एकूण इनपुट टोकन्स | एकूण खर्च | प्रतिसाद वेळ (सरासरी) |
|---|---|---|---|---|---|---|---|---|---|---|
| 2026-07-09 21:16 · पहिला रन | 63/63 प्रयत्न | 7.6 | 9.6 | 10.0 | 13/21 | 1 | 36,888 | 35,699 | $0.258 | 6.70s |
| 2026-07-16 22:37 · नवीन चाचणी जोडली | 66/66 प्रयत्न | 7.6 | 9.6 | 10.0 | 14/22 | 1 | 43,679 | 89,676 | $0.352 | 7.28s |
| फरक | — | 0.0 | 0.0 | 0.0 | -1 | 0 | -6791 | -53977 | -$0.095 | -589ms |
बेंचमार्क कव्हरेज वेगळे आहे: 63/63 प्रयत्न (लक्ष्य: प्रत्येक चाचणीसाठी 3 पुनरावृत्ती) विरुद्ध 66/66 प्रयत्न (लक्ष्य: प्रत्येक चाचणीसाठी 3 पुनरावृत्ती). एकूण मूल्ये आणि पुनरावृत्तीवर अवलंबून मेट्रिक्स थेट तुलना करता येत नाहीत.
या दोन रनमध्ये वेगवेगळे बेंचमार्क सूट वापरले गेले, त्यामुळे फरकांमध्ये मॉडेलमधील आणि सूटमधील दोन्ही बदल दिसतात.
किंमत इतिहास
OpenRouter मधील या मॉडेलचा ऐतिहासिक किंमत डेटा.
| तारीख | इनपुट किंमत | आउटपुट किंमत | कॅश वाचण्याची किंमत | कॅश लिहिण्याची किंमत |
|---|---|---|---|---|
| 2026-07-09 21:18 | $1.000 / 1M | $6.000 / 1M | लागू नाही | लागू नाही |
पहिले मॉडेल निवडा, नंतर दुसरे मॉडेल क्लिक करून बाजू-बाजूची तुलना पेज उघडा.
| श्रेणी | स्कोअर | सुसंगतता | बरोबर चाचण्या |
|---|---|---|---|
| अँटी-एआय युक्त्या | 8.3 | 10.0 | |
| कोडिंग | 5.4 | 7.2 | |
| संयुक्त | 10.0 | 10.0 | |
| डेटा पार्सिंग आणि निष्कर्षण | 10.0 | 10.0 | |
| डोमेन-विशिष्ट | 5.3 | 10.0 | |
| Samanya Buddhimatta | 5.1 | 10.0 | |
| सूचनांचे पालन | 9.9 | 10.0 | |
| कोडी सोडवणे | 7.8 | 10.0 | |
| टूल कॉलिंग | 10.0 | 10.0 | |
| सामान्य ज्ञान | 3.0 | 10.0 |