Advertise here
#178

Grok Build 0.1

X AI प्रकाशन: 2026-05-21 चाचणी तारीख: 2026-10-01 02:37 x-ai/grok-build-0.1::medium
~300B एकूण (~30B सक्रिय)MoEबंद स्रोतअंदाजित
(medium) (none)

सारांश

Grok Build 0.1 AI BENCHY वर 6.7 स्कोर करते आणि #178 वर आहे. याची reliability 10.0, pass rate 58.0%, एकूण खर्च $1.419, आणि सरासरी response time 55.13s आहे.

Grok Build 0.1 खास का आहे: हे सूचनांचे पालन मध्ये सर्वाधिक उठून दिसते, जिथे त्याचा rank #4 आहे; तर Samanya Buddhimatta हा सर्वात कमकुवत भाग आहे, rank #16. हे असामान्यपणे जास्त reasoning tokens वापरते, ज्यामुळे runs हळू किंवा महाग होऊ शकतात.

मॉडेलची माहिती

संशोधन दिनांक: 2026-08-12

अंदाजित
पॅरामीटर्स
~300B एकूण (~30B सक्रिय)
आर्किटेक्चर
MoE
उपलब्धता
बंद स्रोत
परवाना
-

सार्वजनिक पुराव्यावर आधारित सर्वोत्तम अंदाज; प्रदात्याने सर्व मूल्ये जाहीर केलेली नाहीत.

सुसंगतता

9.6

एकूण आउटपुट टोकन्स

529,806

एकूण इनपुट टोकन्स

358,616

इनपुट किंमत

$1.000 / 1M

आउटपुट किंमत

$2.000 / 1M

कॅश वाचण्याची किंमत

$0.200 / 1M

कॅश लिहिण्याची किंमत

लागू नाही

कॅशच्या किमती इनपुट टोकनला लागू होतात. वाचताना साठवलेले प्रॉम्प्ट पुन्हा वापरले जातात; लिहिताना ते साठवले जातात आणि अधिक खर्च होऊ शकतो. आउटपुट टोकनला आउटपुट किंमत लागू होते.

बरोबर चाचण्या

चुकीच्या चाचण्या: 10

प्रति प्रयत्न पास दर: 58.0%

अस्थिर चाचण्या

1

अस्थिर चाचण्यांत रन्समध्ये मिश्र निकाल असतात (किमान एक पास आणि एक फेल).

प्रतिसाद वेळ (सरासरी)

55.13s

प्रतिसाद वेळ (कमाल): 252.69s

प्रतिसाद वेळ (एकूण): 1268.10s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#178 SpaceXAI: Grok Build 0.1

medium
खर्च
$0.028
वेळ
81.3s
टोकन्स
14,009 tok

रन इतिहास

चाचणी तारीख स्कोअर विश्वसनीयता बरोबर चाचण्या एकूण खर्च तुलना करा
2026-10-01 02:37 पुन्हा चाचणी 6.7 10.0 $1.419 सध्याची रन
2026-07-16 23:10 नवीन चाचणी जोडली 7.6 10.0 $1.097 तुलना करा
2026-06-04 14:22 नवीन चाचणी जोडली 7.4 10.0 $0.927 तुलना करा
2026-05-26 13:30 पुन्हा चाचणी 7.7 10.0 $0.729 तुलना करा
2026-05-22 00:36 सूट बदलला 7.6 10.0 $0.633 तुलना करा

या रनमध्ये वेगळा बेंचमार्क सूट वापरला गेला. ऐतिहासिक बदल वाचताना सूटमधील बदल लक्षात घ्या.

रन तुलना

रनबेंचमार्क कव्हरेजस्कोअरसुसंगतताविश्वसनीयताबरोबर चाचण्याअस्थिर चाचण्याएकूण आउटपुट टोकन्सएकूण इनपुट टोकन्सएकूण खर्चप्रतिसाद वेळ (सरासरी)
2026-10-01 02:37 · सध्याची रन69/69 प्रयत्न6.79.610.013/231529,806358,616$1.41955.13s
2026-05-26 13:30 · पुन्हा चाचणी60/60 प्रयत्न7.79.910.013/200343,6390$0.72942.39s
फरक—-0.9-0.30.00+1+186167+358616+$0.690+12747ms

बेंचमार्क कव्हरेज वेगळे आहे: 69/69 प्रयत्न (लक्ष्य: प्रत्येक चाचणीसाठी 3 पुनरावृत्ती) विरुद्ध 60/60 प्रयत्न (लक्ष्य: प्रत्येक चाचणीसाठी 3 पुनरावृत्ती). एकूण मूल्ये आणि पुनरावृत्तीवर अवलंबून मेट्रिक्स थेट तुलना करता येत नाहीत.

या दोन रनमध्ये वेगवेगळे बेंचमार्क सूट वापरले गेले, त्यामुळे फरकांमध्ये मॉडेलमधील आणि सूटमधील दोन्ही बदल दिसतात.

किंमत इतिहास

OpenRouter मधील या मॉडेलचा ऐतिहासिक किंमत डेटा.

तारीख इनपुट किंमत आउटपुट किंमत कॅश वाचण्याची किंमत कॅश लिहिण्याची किंमत
2026-08-14 12:51 $1.000 / 1M $2.000 / 1M लागू नाही लागू नाही
2026-10-01 18:33 $1.000 / 1M $2.000 / 1M $0.200 / 1M लागू नाही

चार्ट्स

पहिले मॉडेल निवडा, नंतर दुसरे मॉडेल क्लिक करून बाजू-बाजूची तुलना पेज उघडा.

एकूण आउटपुट टोकन्स

स्कोअर vs एकूण आउटपुट टोकन्स

झटपट तुलना

श्रेणीवार तपशील

श्रेणी स्कोअर सुसंगतता बरोबर चाचण्या
स्वायत्त एजंट कार्ये 3.4 9.6
अँटी-एआय युक्त्या 8.3 10.0
कोडिंग 5.7 9.7
संयुक्त 10.0 10.0
डेटा पार्सिंग आणि निष्कर्षण 10.0 10.0
डोमेन-विशिष्ट 2.9 7.2
Samanya Buddhimatta 4.4 9.9
सूचनांचे पालन 9.8 10.0
कोडी सोडवणे 7.7 10.0
टूल कॉलिंग 10.0 10.0
सामान्य ज्ञान 3.0 10.0

तुलना केलेली मॉडेल्स