नेविगेशन
AI BENCHY
Advertise here

AI BENCHY तुलना

OpenAI: GPT-5.3-Codex vs Qwen: Qwen3.7 Plus

सारांश

GPT-5.3-Codex vs Qwen3.7 Plus benchmark तुलना: GPT-5.3-Codex average score में आगे है: 8.4 vs 8.2. Qwen3.7 Plus की benchmark लागत कम है: $0.221 vs $0.740. GPT-5.3-Codex तेज है: 16.22s vs 38.95s, pass rates 82.5% vs 77.8%.

अनुशंसित मॉडल: Qwen3.7 Plus - Its score stays close to the best score here (8.2 vs 8.4), while costing about 3.3x less than GPT-5.3-Codex.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-06-10

मेट्रिक GPT-5.3-Codex GPT-5.3-Codex medium रिलीज़: 2026-02-05 Qwen3.7 Plus Qwen3.7 Plus medium रिलीज़: 2026-06-03
स्कोर 8.4 8.2
रैंक #16 #19
विश्वसनीयता 10.0 10.0
संगति 8.5 9.1
सही परीक्षण
प्रति प्रयास पास दर 82.5% 77.8%
अस्थिर टेस्ट 4 2
कुल रन 63 63
प्रति परिणाम लागत 4.932 1.474
कुल लागत $0.740 $0.221
इनपुट कीमत $1.750 / 1M $0.400 / 1M
आउटपुट कीमत $14.000 / 1M $1.600 / 1M
कुल इनपुट टोकन 34,299 40,939
आउटपुट टोकन 2,357 2,125
रीजनिंग टोकन 46,189 125,754
प्रतिक्रिया समय (औसत) 16.22s 38.95s
प्रतिक्रिया समय (अधिकतम) 100.93s 178.04s
प्रतिक्रिया समय (कुल) 340.67s 817.85s

Generation showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#16 GPT-5.3-Codex

medium
Cost
$0.049
Time
54.9s
Tokens
3,580 tok

#19 Qwen3.7 Plus

medium
Cost
$0.018
Time
193.2s
Tokens
10,821 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

एंटी-एआई ट्रिक्स स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
GPT-5.3-Codex 8.7 7.9 91.7% 1 4.16s 606 240 1,722
Qwen3.7 Plus 10.0 10.0 100.0% 0 8.58s 672 195 5,065
कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
GPT-5.3-Codex 10.0 10.0 100.0% 0 19.50s 7,302 535 10,890
Qwen3.7 Plus 6.1 6.6 55.6% 1 108.60s 6,472 414 43,576
संयुक्त स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
GPT-5.3-Codex 10.0 10.0 100.0% 0 19.56s 11,019 364 2,731
Qwen3.7 Plus 10.0 10.0 100.0% 0 65.24s 14,934 366 10,132
डेटा पार्सिंग और निष्कर्षण स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
GPT-5.3-Codex 10.0 10.0 100.0% 0 3.07s 7,140 234 728
Qwen3.7 Plus 10.0 10.0 100.0% 0 21.75s 7,782 270 6,713
डोमेन-विशिष्ट स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
GPT-5.3-Codex 5.9 7.2 55.6% 1 64.31s 813 64 25,308
Qwen3.7 Plus 3.6 7.2 22.2% 1 45.35s 771 57 27,073
Samanya Buddhimatta स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
GPT-5.3-Codex 4.6 10.0 0.0% 0 4.87s 477 187 331
Qwen3.7 Plus 10.0 10.0 100.0% 0 25.48s 516 123 3,998
निर्देश पालन स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
GPT-5.3-Codex 10.0 10.0 100.0% 0 3.04s 660 93 693
Qwen3.7 Plus 10.0 10.0 100.0% 0 16.13s 699 102 5,013
पहेली समाधान स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
GPT-5.3-Codex 9.0 7.9 88.9% 1 5.05s 642 356 1,593
Qwen3.7 Plus 10.0 10.0 100.0% 0 16.38s 696 280 7,312
टूल कॉलिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
GPT-5.3-Codex 10.0 10.0 100.0% 0 6.37s 5,445 254 492
Qwen3.7 Plus 10.0 10.0 100.0% 0 15.02s 8,193 292 1,831
सामान्य ज्ञान स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
GPT-5.3-Codex 2.8 1.6 33.3% 1 14.43s 195 30 1,701
Qwen3.7 Plus 3.0 10.0 0.0% 0 91.07s 204 26 15,041

त्वरित तुलना

तुलना जोड़ी बदलें