नेव्हिगेशन
AI BENCHY
Advertise here

Anthropic: Claude Opus 4.8 vs xAI: Grok 4.5

Claude Opus 4.8 (medium) average score मध्ये पुढे आहे: 8.8 vs 8.4. Grok 4.5 (low) चा benchmark खर्च कमी आहे: $0.935 vs $1.931. Claude Opus 4.8 (medium) वेगवान आहे: 12.49s vs 15.56s, pass rates 84.9% vs 75.8%.

शिफारस केलेले मॉडेलClaude Opus 4.8 (medium)It has the strongest score in this comparison (8.8) and the best overall balance of cost and response time across all 2 models.

AI BENCHY टेस्ट सूटमधून बेंचमार्क या वेळी तयार झाले: 2026-07-21

मेट्रिक Claude Opus 4.8 Claude Opus 4.8 medium प्रकाशन: 2026-05-28 Grok 4.5 Grok 4.5 low प्रकाशन: 2026-07-08
स्कोअर 8.8 8.4
क्रमांक #17 #23
विश्वसनीयता 10.0 10.0
सुसंगतता 9.6 9.7
बरोबर चाचण्या
प्रति प्रयत्न पास दर 84.9% 75.8%
अस्थिर चाचण्या 1 1
एकूण रन 66 66
प्रति निकाल खर्च 10.724 5.844
एकूण खर्च $1.931 $0.935
इनपुट किंमत $5.000 / 1M $2.000 / 1M
आउटपुट किंमत $25.000 / 1M $6.000 / 1M
एकूण इनपुट टोकन्स 138,451 125,596
आउटपुट टोकन्स 40,766 7,505
रिझनिंग टोकन्स 9,075 106,446
प्रतिसाद वेळ (सरासरी) 12.49s 15.56s
प्रतिसाद वेळ (कमाल) 70.54s 205.28s
प्रतिसाद वेळ (एकूण) 274.72s 342.32s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#17 Claude Opus 4.8

medium
खर्च
$0.057
वेळ
23.1s
टोकन्स
2,412 tok

#23 xAI: Grok 4.5

low
खर्च
$0.011
वेळ
12.4s
टोकन्स
2,018 tok

स्कोअरनुसार शीर्ष मॉडेल्स

स्कोअर विरुद्ध एकूण खर्च

प्रतिसाद वेळ (सरासरी)

स्कोअर vs प्रतिसाद वेळ (सरासरी)

एकूण आउटपुट टोकन्स

स्कोअर vs एकूण आउटपुट टोकन्स

श्रेणीवार तपशील

कोडिंग स्कोअर सुसंगतता प्रति प्रयत्न पास दर अस्थिर चाचण्या बरोबर चाचण्या प्रतिसाद वेळ (सरासरी) इनपुट टोकन्स आउटपुट टोकन्स रिझनिंग टोकन्स
Claude Opus 4.8 10.0 10.0 100.0% 0 15.33s 10,590 9,945 1,381
Grok 4.5 10.0 10.0 100.0% 0 13.72s 9,579 303 15,641

झटपट तुलना

तुलना जोडी बदला