नेविगेशन
AI BENCHY
Advertise here

Anthropic: Claude Opus 4.8 vs xAI: Grok 4.5

Claude Opus 4.8 (medium) average score में आगे है: 8.8 vs 8.4. Grok 4.5 (low) की benchmark लागत कम है: $0.935 vs $1.931. Claude Opus 4.8 (medium) तेज है: 12.49s vs 15.56s, pass rates 84.9% vs 75.8%.

अनुशंसित मॉडलClaude Opus 4.8 (medium)It has the strongest score in this comparison (8.8) and the best overall balance of cost and response time across all 2 models.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-07-21

मेट्रिक Claude Opus 4.8 Claude Opus 4.8 medium रिलीज़: 2026-05-28 Grok 4.5 Grok 4.5 low रिलीज़: 2026-07-08
स्कोर 8.8 8.4
रैंक #17 #23
विश्वसनीयता 10.0 10.0
संगति 9.6 9.7
सही परीक्षण
प्रति प्रयास पास दर 84.9% 75.8%
अस्थिर टेस्ट 1 1
कुल रन 66 66
प्रति परिणाम लागत 10.724 5.844
कुल लागत $1.931 $0.935
इनपुट कीमत $5.000 / 1M $2.000 / 1M
आउटपुट कीमत $25.000 / 1M $6.000 / 1M
कुल इनपुट टोकन 138,451 125,596
आउटपुट टोकन 40,766 7,505
रीजनिंग टोकन 9,075 106,446
प्रतिक्रिया समय (औसत) 12.49s 15.56s
प्रतिक्रिया समय (अधिकतम) 70.54s 205.28s
प्रतिक्रिया समय (कुल) 274.72s 342.32s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#17 Claude Opus 4.8

medium
लागत
$0.057
समय
23.1s
टोकन
2,412 tok

#23 xAI: Grok 4.5

low
लागत
$0.011
समय
12.4s
टोकन
2,018 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Claude Opus 4.8 10.0 10.0 100.0% 0 15.33s 10,590 9,945 1,381
Grok 4.5 10.0 10.0 100.0% 0 13.72s 9,579 303 15,641

त्वरित तुलना

तुलना जोड़ी बदलें