नेव्हिगेशन
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Anthropic: Claude Opus 4.6 vs OpenAI: GPT-5.3 Chat

Claude Opus 4.6 (medium) average score मध्ये पुढे आहे: 7.7 vs 7.5. GPT-5.3 Chat चा benchmark खर्च कमी आहे: $0.571 vs $3.059. GPT-5.3 Chat वेगवान आहे: 6.88s vs 34.27s, pass rates 63.6% vs 68.2%.

शिफारस केलेले मॉडेलGPT-5.3 ChatIts score stays close to the best score here (7.5 vs 7.7), while costing about 5.4x less than Claude Opus 4.6 (medium).

AI BENCHY टेस्ट सूटमधून बेंचमार्क या वेळी तयार झाले: 2026-07-25

मेट्रिक Claude Opus 4.6 Claude Opus 4.6 medium प्रकाशन: 2026-02-05 GPT-5.3 Chat GPT-5.3 Chat none प्रकाशन: 2026-03-03
स्कोअर 7.7 7.5
क्रमांक #50 #62
विश्वसनीयता 10.0 10.0
सुसंगतता 8.8 8.2
बरोबर चाचण्या
प्रति प्रयत्न पास दर 63.6% 68.2%
अस्थिर चाचण्या 3 5
एकूण रन 66 66
प्रति निकाल खर्च 23.524 4.387
एकूण खर्च $3.059 $0.571
इनपुट किंमत $5.000 / 1M $1.750 / 1M
आउटपुट किंमत $25.000 / 1M $14.000 / 1M
एकूण इनपुट टोकन्स 108,615 78,990
आउटपुट टोकन्स 72,286 30,854
रिझनिंग टोकन्स 28,315 0
प्रतिसाद वेळ (सरासरी) 34.27s 6.88s
प्रतिसाद वेळ (कमाल) 151.51s 18.33s
प्रतिसाद वेळ (एकूण) 513.99s 151.31s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#50 Claude Opus 4.6

medium
अवैध SVG
खर्च
$0.000
वेळ
300.0s
टोकन्स
0 tok

#62 GPT-5.3 Chat

none
खर्च
$0.008
वेळ
8.1s
टोकन्स
634 tok

स्कोअरनुसार शीर्ष मॉडेल्स

स्कोअर विरुद्ध एकूण खर्च

प्रतिसाद वेळ (सरासरी)

स्कोअर vs प्रतिसाद वेळ (सरासरी)

एकूण आउटपुट टोकन्स

स्कोअर vs एकूण आउटपुट टोकन्स

श्रेणीवार तपशील

कोडिंग स्कोअर सुसंगतता प्रति प्रयत्न पास दर अस्थिर चाचण्या बरोबर चाचण्या प्रतिसाद वेळ (सरासरी) इनपुट टोकन्स आउटपुट टोकन्स रिझनिंग टोकन्स
Claude Opus 4.6 5.7 7.1 44.4% 1 30.10s 8,522 13,057 4,121
GPT-5.3 Chat 5.6 4.7 55.6% 2 10.52s 7,302 6,632 0

झटपट तुलना

तुलना जोडी बदला