नेविगेशन
AI BENCHY
Advertise here

Claude Opus 4.8 (medium) vs Grok 4.5 (high)

Grok 4.5 (high) average score में आगे है: 9.0 vs 8.8. Claude Opus 4.8 (medium) की benchmark लागत कम है: $1.983 vs $2.252. Claude Opus 4.8 (medium) तेज है: 12.97s vs 72.30s, pass rates 83.3% vs 86.4%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-08-29

रैंक
#26
कुल आउटपुट टोकन
51,927
प्रतिक्रिया समय (औसत)
12.97s
कुल लागत
$1.983
रैंक
#21
कुल आउटपुट टोकन
324,462
प्रतिक्रिया समय (औसत)
72.30s
कुल लागत
$2.252
अनुशंसित मॉडल Claude Opus 4.8 (medium)

Its score stays close to the best score here (8.8 vs 9.0), while responding about 5.6x faster than Grok 4.5 (high).

विस्तृत तुलना

मेट्रिक Claude Opus 4.8 Claude Opus 4.8 medium रिलीज़: 2026-05-28 Grok 4.5 Grok 4.5 high रिलीज़: 2026-07-08
स्कोर 8.8 9.0
रैंक #26 #21
विश्वसनीयता 10.0 10.0
संगति 9.2 8.9
प्रयास 66/66 66/66
सही परीक्षण
प्रति प्रयास पास दर 83.3% 86.4%
अस्थिर टेस्ट 2 3
कुल रन 66 66
प्रति परिणाम लागत 11.662 12.565
कुल लागत $1.983 $2.252
इनपुट कीमत $5.000 / 1M $2.000 / 1M
आउटपुट कीमत $25.000 / 1M $6.000 / 1M
कुल इनपुट टोकन 138,448 152,175
आउटपुट टोकन 40,765 5,655
रीजनिंग टोकन 11,162 318,807
प्रतिक्रिया समय (औसत) 12.97s 72.30s
प्रतिक्रिया समय (अधिकतम) 70.54s 676.83s
प्रतिक्रिया समय (कुल) 285.29s 1590.56s
पैरामीटर ~5T कुल (~500B सक्रिय) ~1.7T कुल (~170B सक्रिय)
उपलब्धता बंद स्रोत बंद स्रोत

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#26 Claude Opus 4.8

medium
लागत
$0.057
समय
23.1s
टोकन
2,412 tok

#21 SpaceXAI: Grok 4.5

high
लागत
$0.015
समय
29.7s
टोकन
2,737 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Claude Opus 4.8 10.0 10.0 100.0% 0 15.33s 10,590 9,945 1,381
Grok 4.5 10.0 10.0 100.0% 0 155.16s 9,579 357 100,752

त्वरित तुलना

तुलना जोड़ी बदलें