नेविगेशन
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

तुलना किए गए मॉडल

Claude Opus 4.6 (medium) vs Claude Sonnet 4.6 (medium) vs GPT-5.3-Codex (medium) vs Gemini 3.1 Pro Preview (medium) benchmark तुलना: GPT-5.3-Codex (medium) स्कोर में 9.1 के साथ आगे है। Claude Opus 4.6 (medium) विश्वसनीयता में 10.0 के साथ आगे है। GPT-5.3-Codex (medium) का कुल लागत सबसे कम है: $1.318. GPT-5.3-Codex (medium) 18.87s पर सबसे तेज है।

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-10-06

तुलना किए गए मॉडल

रैंक
#228
कुल आउटपुट टोकन
96,722
प्रतिक्रिया समय (औसत)
32.23s
कुल लागत
$2.961
रैंक
#212
कुल आउटपुट टोकन
120,427
प्रतिक्रिया समय (औसत)
28.08s
कुल लागत
$2.126
रैंक
#34
कुल आउटपुट टोकन
66,287
प्रतिक्रिया समय (औसत)
18.87s
कुल लागत
$1.318
रैंक
#71
कुल आउटपुट टोकन
102,691
प्रतिक्रिया समय (औसत)
22.71s
कुल लागत
$1.585
अनुशंसित मॉडल GPT-5.3-Codex (medium)

It has the best score here (9.1), while costing about 1.7x less than इस तुलना के बाकी मॉडल.

विस्तृत तुलना

मेट्रिक Claude Opus 4.6 Claude Opus 4.6 medium रिलीज़: 2026-02-05 Claude Sonnet 4.6 Claude Sonnet 4.6 medium रिलीज़: 2026-02-17 GPT-5.3-Codex GPT-5.3-Codex medium रिलीज़: 2026-02-05 Gemini 3.1 Pro Preview Gemini 3.1 Pro Preview medium रिलीज़: 2026-02-19
स्कोर 6.3 6.4 9.1 8.4
रैंक #228 #212 #34 #71
विश्वसनीयता 10.0 10.0 10.0 9.8
संगति 8.5 9.1 8.6 9.6
प्रयास 66/69 66/69 69/69 69/69
सही परीक्षण
प्रति प्रयास पास दर 60.9% 62.3% 84.1% 89.9%
अस्थिर टेस्ट 3 1 4 1
कुल रन 66 66 69 69
प्रति परिणाम लागत 22.777 15.182 7.753 7.924
कुल लागत $2.961 $2.126 $1.318 $1.585
इनपुट कीमत $5.000 / 1M $3.000 / 1M $1.750 / 1M $2.000 / 1M
आउटपुट कीमत $25.000 / 1M $15.000 / 1M $14.000 / 1M $12.000 / 1M
कैश पढ़ने की कीमत $0.500 / 1M $0.300 / 1M $0.175 / 1M $0.200 / 1M
कैश लिखने की कीमत $6.250 / 1M $3.750 / 1M लागू नहीं $0.375 / 1M
कुल इनपुट टोकन 108,573 106,316 222,794 176,208
आउटपुट टोकन 69,994 79,338 7,357 6,093
रीजनिंग टोकन 26,728 41,089 58,930 96,598
प्रतिक्रिया समय (औसत) 32.23s 28.08s 18.87s 22.71s
प्रतिक्रिया समय (अधिकतम) 151.51s 140.96s 100.93s 88.68s
प्रतिक्रिया समय (कुल) 515.65s 421.15s 433.94s 386.11s
पैरामीटर ~5T कुल (~500B सक्रिय) ~1T कुल (~100B सक्रिय) ~1.2T कुल (~80B सक्रिय) ~1.2T कुल (~20B सक्रिय)
उपलब्धता बंद स्रोत बंद स्रोत बंद स्रोत बंद स्रोत

कैश की कीमतें इनपुट टोकन पर लागू होती हैं। पढ़ने पर कैश किए गए प्रॉम्प्ट का दोबारा उपयोग होता है; लिखने पर वे सहेजे जाते हैं और अतिरिक्त लागत हो सकती है। आउटपुट टोकन पर आउटपुट की कीमत लागू होती है।

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#228 Claude Opus 4.6

medium
Reached the allocated time limit (300 seconds) without receiving showcase output.
लागत
$0.000
समय
300.0s
टोकन
0 tok

#212 Claude Sonnet 4.6

medium
Reached the allocated time limit (300 seconds) without receiving showcase output.
लागत
$0.000
समय
300.0s
टोकन
0 tok

#34 GPT-5.3-Codex

medium
लागत
$0.049
समय
54.9s
टोकन
3,580 tok

#71 Gemini 3.1 Pro Preview

medium
लागत
$0.115
समय
87.2s
टोकन
9,629 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Claude Opus 4.6 5.7 7.1 44.4% 1 30.10s 8,522 13,057 4,121
Claude Sonnet 4.6 5.7 6.6 44.4% 1 33.29s 6,995 16,089 3,686
GPT-5.3-Codex 10.0 10.0 100.0% 0 19.50s 7,302 535 10,890
Gemini 3.1 Pro Preview 7.9 9.9 66.7% 0 40.17s 8,124 435 41,247

त्वरित तुलना

तुलना जोड़ी बदलें