नेव्हिगेशन
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Anthropic: Claude Opus 4.7 vs OpenAI: GPT-5.4

Claude Opus 4.7 (medium) average score मध्ये पुढे आहे: 8.7 vs 8.5. Claude Opus 4.7 (medium) चा benchmark खर्च कमी आहे: $1.477 vs $1.533. Claude Opus 4.7 (medium) वेगवान आहे: 7.61s vs 23.10s, pass rates 83.3% vs 77.3%.

शिफारस केलेले मॉडेलClaude Opus 4.7 (medium)It has the best score here (8.7), while responding about 3.0x faster than GPT-5.4 (medium).

AI BENCHY टेस्ट सूटमधून बेंचमार्क या वेळी तयार झाले: 2026-07-18

मेट्रिक Claude Opus 4.7 Claude Opus 4.7 medium प्रकाशन: 2026-04-16 GPT-5.4 GPT-5.4 medium प्रकाशन: 2026-03-05
स्कोअर 8.7 8.5
क्रमांक #15 #18
विश्वसनीयता 10.0 10.0
सुसंगतता 9.6 8.6
बरोबर चाचण्या
प्रति प्रयत्न पास दर 83.3% 77.3%
अस्थिर चाचण्या 1 4
एकूण रन 66 66
प्रति निकाल खर्च 8.201 10.220
एकूण खर्च $1.477 $1.533
इनपुट किंमत $5.000 / 1M $2.500 / 1M
आउटपुट किंमत $25.000 / 1M $15.000 / 1M
एकूण इनपुट टोकन्स 145,252 81,127
आउटपुट टोकन्स 24,948 6,155
रिझनिंग टोकन्स 5,042 82,515
प्रतिसाद वेळ (सरासरी) 7.61s 23.10s
प्रतिसाद वेळ (कमाल) 65.40s 100.41s
प्रतिसाद वेळ (एकूण) 159.91s 508.26s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#15 Claude Opus 4.7

medium
खर्च
$0.059
वेळ
26.8s
टोकन्स
2,475 tok

#18 GPT-5.4

medium
खर्च
$0.214
वेळ
199.6s
टोकन्स
14,349 tok

स्कोअरनुसार शीर्ष मॉडेल्स

स्कोअर विरुद्ध एकूण खर्च

प्रतिसाद वेळ (सरासरी)

स्कोअर vs प्रतिसाद वेळ (सरासरी)

एकूण आउटपुट टोकन्स

स्कोअर vs एकूण आउटपुट टोकन्स

श्रेणीवार तपशील

कोडिंग स्कोअर सुसंगतता प्रति प्रयत्न पास दर अस्थिर चाचण्या बरोबर चाचण्या प्रतिसाद वेळ (सरासरी) इनपुट टोकन्स आउटपुट टोकन्स रिझनिंग टोकन्स
Claude Opus 4.7 7.6 7.2 77.8% 1 12.96s 10,635 7,629 1,114
GPT-5.4 8.8 7.8 88.9% 1 44.36s 7,305 433 24,216

झटपट तुलना

तुलना जोडी बदला