नेव्हिगेशन
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Anthropic: Claude Opus 4.8 vs OpenAI: GPT-5.4

Claude Opus 4.8 (medium) average score मध्ये पुढे आहे: 8.8 vs 8.5. GPT-5.4 (medium) चा benchmark खर्च कमी आहे: $1.533 vs $1.931. Claude Opus 4.8 (medium) वेगवान आहे: 12.49s vs 23.10s, pass rates 84.9% vs 77.3%.

शिफारस केलेले मॉडेलClaude Opus 4.8 (medium)It has the best score here (8.8), while responding about 1.9x faster than GPT-5.4 (medium).

AI BENCHY टेस्ट सूटमधून बेंचमार्क या वेळी तयार झाले: 2026-07-22

मेट्रिक Claude Opus 4.8 Claude Opus 4.8 medium प्रकाशन: 2026-05-28 GPT-5.4 GPT-5.4 medium प्रकाशन: 2026-03-05
स्कोअर 8.8 8.5
क्रमांक #17 #21
विश्वसनीयता 10.0 10.0
सुसंगतता 9.6 8.6
बरोबर चाचण्या
प्रति प्रयत्न पास दर 84.9% 77.3%
अस्थिर चाचण्या 1 4
एकूण रन 66 66
प्रति निकाल खर्च 10.724 10.220
एकूण खर्च $1.931 $1.533
इनपुट किंमत $5.000 / 1M $2.500 / 1M
आउटपुट किंमत $25.000 / 1M $15.000 / 1M
एकूण इनपुट टोकन्स 138,451 81,127
आउटपुट टोकन्स 40,766 6,155
रिझनिंग टोकन्स 9,075 82,515
प्रतिसाद वेळ (सरासरी) 12.49s 23.10s
प्रतिसाद वेळ (कमाल) 70.54s 100.41s
प्रतिसाद वेळ (एकूण) 274.72s 508.26s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#17 Claude Opus 4.8

medium
खर्च
$0.057
वेळ
23.1s
टोकन्स
2,412 tok

#21 GPT-5.4

medium
खर्च
$0.214
वेळ
199.6s
टोकन्स
14,349 tok

स्कोअरनुसार शीर्ष मॉडेल्स

स्कोअर विरुद्ध एकूण खर्च

प्रतिसाद वेळ (सरासरी)

स्कोअर vs प्रतिसाद वेळ (सरासरी)

एकूण आउटपुट टोकन्स

स्कोअर vs एकूण आउटपुट टोकन्स

श्रेणीवार तपशील

कोडिंग स्कोअर सुसंगतता प्रति प्रयत्न पास दर अस्थिर चाचण्या बरोबर चाचण्या प्रतिसाद वेळ (सरासरी) इनपुट टोकन्स आउटपुट टोकन्स रिझनिंग टोकन्स
Claude Opus 4.8 10.0 10.0 100.0% 0 15.33s 10,590 9,945 1,381
GPT-5.4 8.8 7.8 88.9% 1 44.36s 7,305 433 24,216

झटपट तुलना

तुलना जोडी बदला