नेविगेशन
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

gpt-oss-120b (medium) vs Qwen3.5 Plus 2026-04-20

average score लगभग बराबर है: 6.1 vs 6.1. gpt-oss-120b (medium) की benchmark लागत कम है: $0.019 vs $0.122. Qwen3.5 Plus 2026-04-20 तेज है: 13.56s vs 21.91s, pass rates 50.0% vs 43.9%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-07-25

रैंक
#132
कुल आउटपुट टोकन
97,816
प्रतिक्रिया समय (औसत)
21.91s
कुल लागत
$0.019
रैंक
#137
कुल आउटपुट टोकन
51,487
प्रतिक्रिया समय (औसत)
13.56s
कुल लागत
$0.122
अनुशंसित मॉडल gpt-oss-120b (medium)

It has the best score here (6.1), while costing about 6.5x less than Qwen3.5 Plus 2026-04-20.

विस्तृत तुलना

मेट्रिक gpt-oss-120b gpt-oss-120b medium रिलीज़: 2025-08-05 Qwen3.5 Plus 2026-04-20 Qwen3.5 Plus 2026-04-20 none रिलीज़: 2026-04-20
स्कोर 6.1 6.1
रैंक #132 #137
विश्वसनीयता 10.0 10.0
संगति 8.0 8.7
सही परीक्षण
प्रति प्रयास पास दर 50.0% 43.9%
अस्थिर टेस्ट 5 4
कुल रन 66 66
प्रति परिणाम लागत 0.221 1.636
कुल लागत $0.019 $0.122
इनपुट कीमत $0.037 / 1M $0.300 / 1M
आउटपुट कीमत $0.170 / 1M $1.800 / 1M
कुल इनपुट टोकन 108,747 94,468
आउटपुट टोकन 29,772 51,487
रीजनिंग टोकन 68,044 0
प्रतिक्रिया समय (औसत) 21.91s 13.56s
प्रतिक्रिया समय (अधिकतम) 68.16s 206.05s
प्रतिक्रिया समय (कुल) 328.70s 298.31s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#132 gpt-oss-120b

medium
लागत
$0.001
समय
26.7s
टोकन
555 tok

#137 Qwen3.5 Plus 2026-04-20

none
लागत
$0.008
समय
77.0s
टोकन
4,369 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
gpt-oss-120b 5.9 7.0 55.6% 1 38.37s 7,782 3,365 11,973
Qwen3.5 Plus 2026-04-20 3.9 7.8 11.1% 1 1.69s 7,913 480 0

त्वरित तुलना

तुलना जोड़ी बदलें