Advertise here
#23

Grok 4.5

X AI रिलीज़: 2026-07-08 परीक्षण किया गया: 2026-07-08 23:28 x-ai/grok-4.5::medium
~1.7T कुल (~170B सक्रिय)MoEबंद स्रोतअनुमानित
(high) (medium) (low)

सारांश

Grok 4.5 AI BENCHY पर 8.3 स्कोर करता है और #23 पर है। इसकी reliability 9.9, pass rate 77.8%, कुल लागत $1.696, और औसत response time 62.63s है।

मॉडल विवरण

शोध की तारीख: 2026-08-12

अनुमानित
पैरामीटर
~1.7T कुल (~170B सक्रिय)
आर्किटेक्चर
MoE
उपलब्धता
बंद स्रोत
लाइसेंस
-

सार्वजनिक साक्ष्यों पर आधारित सर्वोत्तम अनुमान; प्रदाता ने सभी मान जारी नहीं किए हैं।

संगति

8.9

कुल आउटपुट टोकन

264,748

कुल इनपुट टोकन

53,500

इनपुट कीमत

$2.000 / 1M

आउटपुट कीमत

$6.000 / 1M

कैश पढ़ने की कीमत

लागू नहीं

कैश लिखने की कीमत

लागू नहीं

कैश की कीमतें इनपुट टोकन पर लागू होती हैं। पढ़ने पर कैश किए गए प्रॉम्प्ट का दोबारा उपयोग होता है; लिखने पर वे सहेजे जाते हैं और अतिरिक्त लागत हो सकती है। आउटपुट टोकन पर आउटपुट की कीमत लागू होती है।

सही परीक्षण

गलत टेस्ट: 6

प्रति प्रयास पास दर: 77.8%

अस्थिर टेस्ट

3

अस्थिर टेस्ट में रनों के बीच मिले-जुले परिणाम रहे (कम से कम एक पास और एक फेल)।

प्रतिक्रिया समय (औसत)

62.63s

प्रतिक्रिया समय (अधिकतम): 436.38s

प्रतिक्रिया समय (कुल): 1315.20s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#23 xAI: Grok 4.5

medium
लागत
$0.044
समय
59.4s
टोकन
7,512 tok

रन इतिहास

परीक्षण किया गया स्कोर विश्वसनीयता सही परीक्षण कुल लागत तुलना करें
2026-08-14 03:04 दोबारा परीक्षण 8.5 10.0 $2.042 तुलना करें
2026-07-16 23:09 नया टेस्ट जोड़ा गया 8.3 10.0 $1.928 तुलना करें
2026-07-08 23:28 दोबारा परीक्षण 8.3 9.9 $1.696 वर्तमान रन
2026-07-08 21:34 पहला रन 8.3 9.6 $1.327 तुलना करें

रन तुलना

रनबेंचमार्क कवरेजस्कोरसंगतिविश्वसनीयतासही परीक्षणअस्थिर टेस्टकुल आउटपुट टोकनकुल इनपुट टोकनकुल लागतप्रतिक्रिया समय (औसत)
2026-07-08 23:28 · दोबारा परीक्षण63/63 प्रयास8.38.99.915/213264,74853,500$1.69662.63s
2026-07-16 23:09 · नया टेस्ट जोड़ा गया66/66 प्रयास8.38.910.016/223280,567122,146$1.92861.71s
अंतर—0.00.0-0.1-10-15819-68646-$0.233+921ms

बेंचमार्क कवरेज अलग है: 63/63 प्रयास (लक्ष्य: प्रति टेस्ट 3 दोहराव) बनाम 66/66 प्रयास (लक्ष्य: प्रति टेस्ट 3 दोहराव)। कुल और दोहराव-संवेदनशील मेट्रिक सीधे तुलना योग्य नहीं हैं।

इन दो रन में अलग-अलग बेंचमार्क सूट इस्तेमाल हुए थे, इसलिए अंतर मॉडल बदलाव और सूट बदलाव दोनों को दर्शाते हैं।

कीमत का इतिहास

OpenRouter से इस मॉडल का ऐतिहासिक मूल्य डेटा।

तारीख इनपुट कीमत आउटपुट कीमत कैश पढ़ने की कीमत कैश लिखने की कीमत
2026-07-08 21:47 $2.000 / 1M $6.000 / 1M लागू नहीं लागू नहीं

चार्ट

पहले मॉडल चुनें, फिर दूसरा मॉडल क्लिक करके साइड-बाय-साइड पेज खोलें।

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

त्वरित तुलना

श्रेणी विवरण

श्रेणी स्कोर संगति सही परीक्षण
एंटी-एआई ट्रिक्स 10.0 10.0
कोडिंग 7.6 7.2
संयुक्त 10.0 10.0
डेटा पार्सिंग और निष्कर्षण 10.0 10.0
डोमेन-विशिष्ट 2.9 7.2
Samanya Buddhimatta 6.5 3.4
निर्देश पालन 9.8 10.0
पहेली समाधान 10.0 10.0
टूल कॉलिंग 10.0 10.0
सामान्य ज्ञान 3.0 10.0

तुलना किए गए मॉडल