नेव्हिगेशन
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

तुलना केलेली मॉडेल्स

Claude Opus 4.6 (medium) vs Claude Sonnet 4.6 (medium) vs GPT-5.3-Codex (medium) vs Gemini 3.1 Pro Preview (medium) benchmark तुलना: GPT-5.3-Codex (medium) स्कोअर मध्ये 9.1 सह आघाडीवर आहे. Claude Opus 4.6 (medium) विश्वसनीयता मध्ये 10.0 सह आघाडीवर आहे. GPT-5.3-Codex (medium) चे एकूण खर्च सर्वात कमी आहे: $1.318. GPT-5.3-Codex (medium) 18.87s वर सर्वात जलद आहे.

AI BENCHY टेस्ट सूटमधून बेंचमार्क या वेळी तयार झाले: 2026-10-06

तुलना केलेली मॉडेल्स

क्रमांक
#228
एकूण आउटपुट टोकन्स
96,722
प्रतिसाद वेळ (सरासरी)
32.23s
एकूण खर्च
$2.961
क्रमांक
#212
एकूण आउटपुट टोकन्स
120,427
प्रतिसाद वेळ (सरासरी)
28.08s
एकूण खर्च
$2.126
क्रमांक
#34
एकूण आउटपुट टोकन्स
66,287
प्रतिसाद वेळ (सरासरी)
18.87s
एकूण खर्च
$1.318
क्रमांक
#71
एकूण आउटपुट टोकन्स
102,691
प्रतिसाद वेळ (सरासरी)
22.71s
एकूण खर्च
$1.585
शिफारस केलेले मॉडेल GPT-5.3-Codex (medium)

It has the best score here (9.1), while costing about 1.7x less than या तुलनेतील इतर मॉडेल.

तपशीलवार तुलना

मेट्रिक Claude Opus 4.6 Claude Opus 4.6 medium प्रकाशन: 2026-02-05 Claude Sonnet 4.6 Claude Sonnet 4.6 medium प्रकाशन: 2026-02-17 GPT-5.3-Codex GPT-5.3-Codex medium प्रकाशन: 2026-02-05 Gemini 3.1 Pro Preview Gemini 3.1 Pro Preview medium प्रकाशन: 2026-02-19
स्कोअर 6.3 6.4 9.1 8.4
क्रमांक #228 #212 #34 #71
विश्वसनीयता 10.0 10.0 10.0 9.8
सुसंगतता 8.5 9.1 8.6 9.6
प्रयत्न 66/69 66/69 69/69 69/69
बरोबर चाचण्या
प्रति प्रयत्न पास दर 60.9% 62.3% 84.1% 89.9%
अस्थिर चाचण्या 3 1 4 1
एकूण रन 66 66 69 69
प्रति निकाल खर्च 22.777 15.182 7.753 7.924
एकूण खर्च $2.961 $2.126 $1.318 $1.585
इनपुट किंमत $5.000 / 1M $3.000 / 1M $1.750 / 1M $2.000 / 1M
आउटपुट किंमत $25.000 / 1M $15.000 / 1M $14.000 / 1M $12.000 / 1M
कॅश वाचण्याची किंमत $0.500 / 1M $0.300 / 1M $0.175 / 1M $0.200 / 1M
कॅश लिहिण्याची किंमत $6.250 / 1M $3.750 / 1M लागू नाही $0.375 / 1M
एकूण इनपुट टोकन्स 108,573 106,316 222,794 176,208
आउटपुट टोकन्स 69,994 79,338 7,357 6,093
रिझनिंग टोकन्स 26,728 41,089 58,930 96,598
प्रतिसाद वेळ (सरासरी) 32.23s 28.08s 18.87s 22.71s
प्रतिसाद वेळ (कमाल) 151.51s 140.96s 100.93s 88.68s
प्रतिसाद वेळ (एकूण) 515.65s 421.15s 433.94s 386.11s
पॅरामीटर्स ~5T एकूण (~500B सक्रिय) ~1T एकूण (~100B सक्रिय) ~1.2T एकूण (~80B सक्रिय) ~1.2T एकूण (~20B सक्रिय)
उपलब्धता बंद स्रोत बंद स्रोत बंद स्रोत बंद स्रोत

कॅशच्या किमती इनपुट टोकनला लागू होतात. वाचताना साठवलेले प्रॉम्प्ट पुन्हा वापरले जातात; लिहिताना ते साठवले जातात आणि अधिक खर्च होऊ शकतो. आउटपुट टोकनला आउटपुट किंमत लागू होते.

मॉडेल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#228 Claude Opus 4.6

medium
Reached the allocated time limit (300 seconds) without receiving showcase output.
खर्च
$0.000
वेळ
300.0s
टोकन्स
0 tok

#212 Claude Sonnet 4.6

medium
Reached the allocated time limit (300 seconds) without receiving showcase output.
खर्च
$0.000
वेळ
300.0s
टोकन्स
0 tok

#34 GPT-5.3-Codex

medium
खर्च
$0.049
वेळ
54.9s
टोकन्स
3,580 tok

#71 Gemini 3.1 Pro Preview

medium
खर्च
$0.115
वेळ
87.2s
टोकन्स
9,629 tok

स्कोअरनुसार शीर्ष मॉडेल्स

स्कोअर विरुद्ध एकूण खर्च

प्रतिसाद वेळ (सरासरी)

स्कोअर vs प्रतिसाद वेळ (सरासरी)

एकूण आउटपुट टोकन्स

स्कोअर vs एकूण आउटपुट टोकन्स

श्रेणीवार तपशील

कोडिंग स्कोअर सुसंगतता प्रति प्रयत्न पास दर अस्थिर चाचण्या बरोबर चाचण्या प्रतिसाद वेळ (सरासरी) इनपुट टोकन्स आउटपुट टोकन्स रिझनिंग टोकन्स
Claude Opus 4.6 5.7 7.1 44.4% 1 30.10s 8,522 13,057 4,121
Claude Sonnet 4.6 5.7 6.6 44.4% 1 33.29s 6,995 16,089 3,686
GPT-5.3-Codex 10.0 10.0 100.0% 0 19.50s 7,302 535 10,890
Gemini 3.1 Pro Preview 7.9 9.9 66.7% 0 40.17s 8,124 435 41,247

झटपट तुलना

तुलना जोडी बदला