नेविगेशन
Advertise here

Claude Opus 4.8 vs Grok 4.6 (low)

Grok 4.6 (low) average score में आगे है: 6.9 vs 6.9. Grok 4.6 (low) की benchmark लागत कम है: $0.781 vs $2.334. Claude Opus 4.8 तेज है: 7.54s vs 16.44s, pass rates 60.9% vs 66.7%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-10-01

तुलना किए गए मॉडल

रैंक
#167
कुल आउटपुट टोकन
24,343
प्रतिक्रिया समय (औसत)
7.54s
कुल लागत
$2.334
रैंक
#159
कुल आउटपुट टोकन
42,315
प्रतिक्रिया समय (औसत)
16.44s
कुल लागत
$0.781
अनुशंसित मॉडल Grok 4.6 (low)

It has the best score here (6.9), while costing about 3.0x less than Claude Opus 4.8.

विस्तृत तुलना

मेट्रिक Claude Opus 4.8 Claude Opus 4.8 none रिलीज़: 2026-05-28 Grok 4.6 Grok 4.6 low रिलीज़: 2026-08-12
स्कोर 6.9 6.9
रैंक #167 #159
विश्वसनीयता 10.0 10.0
संगति 9.3 9.6
प्रयास 69/69 69/69
सही परीक्षण
प्रति प्रयास पास दर 60.9% 66.7%
अस्थिर टेस्ट 2 1
कुल रन 69 69
प्रति परिणाम लागत 17.953 5.205
कुल लागत $2.334 $0.781
इनपुट कीमत $5.000 / 1M $2.000 / 1M
आउटपुट कीमत $25.000 / 1M $6.000 / 1M
कुल इनपुट टोकन 345,059 263,427
आउटपुट टोकन 24,343 6,006
रीजनिंग टोकन 0 36,309
प्रतिक्रिया समय (औसत) 7.54s 16.44s
प्रतिक्रिया समय (अधिकतम) 65.07s 57.97s
प्रतिक्रिया समय (कुल) 173.31s 378.14s
पैरामीटर ~5T कुल (~500B सक्रिय) ~1.7T कुल (~170B सक्रिय)
उपलब्धता बंद स्रोत बंद स्रोत

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#167 Claude Opus 4.8

none
लागत
$0.053
समय
22.0s
टोकन
2,253 tok

#159 SpaceXAI: Grok 4.6

low
लागत
$0.011
समय
26.0s
टोकन
1,941 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Claude Opus 4.8 5.5 10.0 33.3% 0 3.29s 10,590 1,332 0
Grok 4.6 5.5 7.1 44.4% 1 21.69s 9,579 349 7,740

त्वरित तुलना

तुलना जोड़ी बदलें