नेविगेशन
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

OpenAI: GPT-5.3-Codex vs OpenAI: GPT-5.4

GPT-5.3-Codex (medium) average score में आगे है: 8.9 vs 8.5. GPT-5.3-Codex (medium) की benchmark लागत कम है: $0.920 vs $1.533. GPT-5.3-Codex (medium) तेज है: 16.96s vs 23.10s, pass rates 83.3% vs 77.3%.

अनुशंसित मॉडलGPT-5.3-Codex (medium)It has the best score here (8.9), while costing about 1.7x less than GPT-5.4 (medium).

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-07-22

मेट्रिक GPT-5.3-Codex GPT-5.3-Codex medium रिलीज़: 2026-02-05 GPT-5.4 GPT-5.4 medium रिलीज़: 2026-03-05
स्कोर 8.9 8.5
रैंक #16 #21
विश्वसनीयता 10.0 10.0
संगति 8.6 8.6
सही परीक्षण
प्रति प्रयास पास दर 83.3% 77.3%
अस्थिर टेस्ट 4 4
कुल रन 66 66
प्रति परिणाम लागत 5.748 10.220
कुल लागत $0.920 $1.533
इनपुट कीमत $1.750 / 1M $2.500 / 1M
आउटपुट कीमत $14.000 / 1M $15.000 / 1M
कुल इनपुट टोकन 81,268 81,127
आउटपुट टोकन 6,251 6,155
रीजनिंग टोकन 49,274 82,515
प्रतिक्रिया समय (औसत) 16.96s 23.10s
प्रतिक्रिया समय (अधिकतम) 100.93s 100.41s
प्रतिक्रिया समय (कुल) 373.19s 508.26s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#16 GPT-5.3-Codex

medium
लागत
$0.049
समय
54.9s
टोकन
3,580 tok

#21 GPT-5.4

medium
लागत
$0.214
समय
199.6s
टोकन
14,349 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
GPT-5.3-Codex 10.0 10.0 100.0% 0 19.50s 7,302 535 10,890
GPT-5.4 8.8 7.8 88.9% 1 44.36s 7,305 433 24,216

त्वरित तुलना

तुलना जोड़ी बदलें