नेविगेशन
Advertise here

Qwen3.8 Max (0902) (high) vs Pareto

average score लगभग बराबर है: 8.9 vs 8.9. Pareto की benchmark लागत कम है: $1.172 vs $2.736. Pareto तेज है: 31.51s vs 185.56s, pass rates 86.4% vs 86.4%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-09-18

तुलना किए गए मॉडल

रैंक
#31
कुल आउटपुट टोकन
419,443
प्रतिक्रिया समय (औसत)
185.56s
कुल लागत
$2.736
रैंक
#34
कुल आउटपुट टोकन
119,230
प्रतिक्रिया समय (औसत)
31.51s
कुल लागत
$1.172
अनुशंसित मॉडल Pareto

It has the best score here (8.9), while costing about 2.3x less than Qwen3.8 Max (0902) (high).

विस्तृत तुलना

मेट्रिक Qwen3.8 Max (0902) Qwen3.8 Max (0902) high रिलीज़: 2026-09-07 Pareto Pareto none रिलीज़: 2026-09-18
स्कोर 8.9 8.9
रैंक #31 #34
विश्वसनीयता 9.8 10.0
संगति 9.0 9.2
प्रयास 66/66 66/66
सही परीक्षण
प्रति प्रयास पास दर 86.4% 86.4%
अस्थिर टेस्ट 3 2
कुल रन 66 66
प्रति परिणाम लागत 16.089 6.506
कुल लागत $2.736 $1.172
इनपुट कीमत $2.000 / 1M $2.500 / 1M
आउटपुट कीमत $6.000 / 1M $7.500 / 1M
कुल इनपुट टोकन 109,226 110,734
आउटपुट टोकन 6,890 119,230
रीजनिंग टोकन 412,553 0
प्रतिक्रिया समय (औसत) 185.56s 31.51s
प्रतिक्रिया समय (अधिकतम) 912.78s 143.33s
प्रतिक्रिया समय (कुल) 4082.41s 693.29s
पैरामीटर 2.4T कुल (~100B सक्रिय) -
उपलब्धता बंद स्रोत बंद स्रोत

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#31 Qwen3.8 Max (0902)

high
Reached the allocated time limit (600 seconds) without receiving showcase output.
लागत
$0.000
समय
600.0s
टोकन
0 tok

#34 Pareto

none
लागत
$0.034
समय
170.7s
टोकन
4,581 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Qwen3.8 Max (0902) 10.0 10.0 100.0% 0 253.22s 8,235 418 91,734
Pareto 10.0 10.0 100.0% 0 50.12s 7,471 1,949 0

त्वरित तुलना

तुलना जोड़ी बदलें