नेविगेशन
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Anthropic: Claude Opus 4.6 vs OpenAI: GPT-5.3 Chat

Claude Opus 4.6 (medium) average score में आगे है: 7.7 vs 7.5. GPT-5.3 Chat की benchmark लागत कम है: $0.571 vs $3.059. GPT-5.3 Chat तेज है: 6.88s vs 34.27s, pass rates 63.6% vs 68.2%.

अनुशंसित मॉडलGPT-5.3 ChatIts score stays close to the best score here (7.5 vs 7.7), while costing about 5.4x less than Claude Opus 4.6 (medium).

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-07-25

मेट्रिक Claude Opus 4.6 Claude Opus 4.6 medium रिलीज़: 2026-02-05 GPT-5.3 Chat GPT-5.3 Chat none रिलीज़: 2026-03-03
स्कोर 7.7 7.5
रैंक #50 #62
विश्वसनीयता 10.0 10.0
संगति 8.8 8.2
सही परीक्षण
प्रति प्रयास पास दर 63.6% 68.2%
अस्थिर टेस्ट 3 5
कुल रन 66 66
प्रति परिणाम लागत 23.524 4.387
कुल लागत $3.059 $0.571
इनपुट कीमत $5.000 / 1M $1.750 / 1M
आउटपुट कीमत $25.000 / 1M $14.000 / 1M
कुल इनपुट टोकन 108,615 78,990
आउटपुट टोकन 72,286 30,854
रीजनिंग टोकन 28,315 0
प्रतिक्रिया समय (औसत) 34.27s 6.88s
प्रतिक्रिया समय (अधिकतम) 151.51s 18.33s
प्रतिक्रिया समय (कुल) 513.99s 151.31s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#50 Claude Opus 4.6

medium
अमान्य SVG
लागत
$0.000
समय
300.0s
टोकन
0 tok

#62 GPT-5.3 Chat

none
लागत
$0.008
समय
8.1s
टोकन
634 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Claude Opus 4.6 5.7 7.1 44.4% 1 30.10s 8,522 13,057 4,121
GPT-5.3 Chat 5.6 4.7 55.6% 2 10.52s 7,302 6,632 0

त्वरित तुलना

तुलना जोड़ी बदलें