नेविगेशन
Advertise here

Qwen3.8 Max (medium) vs Pareto

Qwen3.8 Max (medium) average score में आगे है: 9.0 vs 8.9. Qwen3.8 Max (medium) की benchmark लागत कम है: $0.771 vs $1.172. Qwen3.8 Max (medium) तेज है: 23.34s vs 31.51s, pass rates 80.3% vs 86.4%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-09-18

तुलना किए गए मॉडल

रैंक
#29
कुल आउटपुट टोकन
92,047
प्रतिक्रिया समय (औसत)
23.34s
कुल लागत
$0.771
रैंक
#34
कुल आउटपुट टोकन
119,230
प्रतिक्रिया समय (औसत)
31.51s
कुल लागत
$1.172
अनुशंसित मॉडल Qwen3.8 Max (medium)

It has the best score here (9.0), while costing about 1.5x less than Pareto.

विस्तृत तुलना

मेट्रिक Qwen3.8 Max Qwen3.8 Max medium रिलीज़: 2026-08-04 Pareto Pareto none रिलीज़: 2026-09-18
स्कोर 9.0 8.9
रैंक #29 #34
विश्वसनीयता 10.0 10.0
संगति 9.7 9.2
प्रयास 66/66 66/66
सही परीक्षण
प्रति प्रयास पास दर 80.3% 86.4%
अस्थिर टेस्ट 1 2
कुल रन 66 66
प्रति परिणाम लागत 4.532 6.506
कुल लागत $0.771 $1.172
इनपुट कीमत $2.000 / 1M $2.500 / 1M
आउटपुट कीमत $6.000 / 1M $7.500 / 1M
कुल इनपुट टोकन 109,055 110,734
आउटपुट टोकन 6,566 119,230
रीजनिंग टोकन 85,481 0
प्रतिक्रिया समय (औसत) 23.34s 31.51s
प्रतिक्रिया समय (अधिकतम) 126.60s 143.33s
प्रतिक्रिया समय (कुल) 513.47s 693.29s
पैरामीटर 2.4T कुल (~100B सक्रिय) -
उपलब्धता बंद स्रोत बंद स्रोत

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#29 Qwen3.8 Max

medium
लागत
$0.028
समय
71.9s
टोकन
4,750 tok

#34 Pareto

none
लागत
$0.034
समय
170.7s
टोकन
4,581 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Qwen3.8 Max 10.0 10.0 100.0% 0 41.35s 7,893 430 23,804
Pareto 10.0 10.0 100.0% 0 50.12s 7,471 1,949 0

त्वरित तुलना

तुलना जोड़ी बदलें