नेविगेशन
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

OpenAI: GPT-5.3-Codex vs Qwen: Qwen3.7 Max

GPT-5.3-Codex (medium) average score में आगे है: 8.9 vs 7.4. Qwen3.7 Max की benchmark लागत कम है: $0.197 vs $0.920. Qwen3.7 Max तेज है: 4.52s vs 16.96s, pass rates 83.3% vs 68.2%.

अनुशंसित मॉडलQwen3.7 MaxIt offers the best overall trade-off: a competitive score (7.4), lower cost than GPT-5.3-Codex (medium), and balanced response time.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-07-25

मेट्रिक GPT-5.3-Codex GPT-5.3-Codex medium रिलीज़: 2026-02-05 Qwen3.7 Max Qwen3.7 Max none रिलीज़: 2026-05-22
स्कोर 8.9 7.4
रैंक #18 #67
विश्वसनीयता 10.0 9.9
संगति 8.6 10.0
सही परीक्षण
प्रति प्रयास पास दर 83.3% 68.2%
अस्थिर टेस्ट 4 0
कुल रन 66 66
प्रति परिणाम लागत 5.748 1.582
कुल लागत $0.920 $0.197
इनपुट कीमत $1.750 / 1M $1.475 / 1M
आउटपुट कीमत $14.000 / 1M $4.425 / 1M
कुल इनपुट टोकन 81,268 95,983
आउटपुट टोकन 6,251 12,446
रीजनिंग टोकन 49,274 0
प्रतिक्रिया समय (औसत) 16.96s 4.52s
प्रतिक्रिया समय (अधिकतम) 100.93s 72.30s
प्रतिक्रिया समय (कुल) 373.19s 99.52s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#18 GPT-5.3-Codex

medium
लागत
$0.049
समय
54.9s
टोकन
3,580 tok

#67 Qwen3.7 Max

none
लागत
$0.046
समय
195.0s
टोकन
12,171 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
GPT-5.3-Codex 10.0 10.0 100.0% 0 19.50s 7,302 535 10,890
Qwen3.7 Max 5.5 10.0 33.3% 0 1.35s 7,911 582 0

त्वरित तुलना

तुलना जोड़ी बदलें