नेविगेशन
AI BENCHY
Advertise here

Qwen3.8 Max (medium) vs Grok 4.6 (high)

Grok 4.6 (high) average score में आगे है: 9.2 vs 9.1. Qwen3.8 Max (medium) की benchmark लागत कम है: $0.728 vs $1.809. Qwen3.8 Max (medium) तेज है: 21.53s vs 79.38s, pass rates 84.9% vs 84.9%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-08-12

रैंक
#16
कुल आउटपुट टोकन
84,826
प्रतिक्रिया समय (औसत)
21.53s
कुल लागत
$0.728
रैंक
#11
कुल आउटपुट टोकन
265,604
प्रतिक्रिया समय (औसत)
79.38s
कुल लागत
$1.809
अनुशंसित मॉडल Qwen3.8 Max (medium)

Its score stays close to the best score here (9.1 vs 9.2), while costing about 2.5x less than Grok 4.6 (high).

विस्तृत तुलना

मेट्रिक Qwen3.8 Max Qwen3.8 Max medium रिलीज़: 2026-08-04 Grok 4.6 Grok 4.6 high रिलीज़: 2026-08-12
स्कोर 9.1 9.2
रैंक #16 #11
विश्वसनीयता 10.0 10.0
संगति 9.7 9.6
प्रयास 66/66 66/66
सही परीक्षण
प्रति प्रयास पास दर 84.9% 84.9%
अस्थिर टेस्ट 1 1
कुल रन 66 66
प्रति परिणाम लागत 4.040 10.046
कुल लागत $0.728 $1.809
इनपुट कीमत $2.000 / 1M $2.000 / 1M
आउटपुट कीमत $6.000 / 1M $6.000 / 1M
कुल इनपुट टोकन 109,046 107,266
आउटपुट टोकन 6,567 5,094
रीजनिंग टोकन 78,259 260,510
प्रतिक्रिया समय (औसत) 21.53s 79.38s
प्रतिक्रिया समय (अधिकतम) 126.60s 618.49s
प्रतिक्रिया समय (कुल) 473.75s 1746.29s
पैरामीटर 2.4T कुल (~100B सक्रिय) ~1.7T कुल (~170B सक्रिय)
उपलब्धता बंद स्रोत बंद स्रोत

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#16 Qwen3.8 Max

medium
लागत
$0.028
समय
71.9s
टोकन
4,750 tok

#11 SpaceXAI: Grok 4.6

high
लागत
$0.107
समय
265.1s
टोकन
18,001 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Qwen3.8 Max 10.0 10.0 100.0% 0 41.35s 7,893 430 23,804
Grok 4.6 10.0 10.0 100.0% 0 102.20s 9,579 379 51,829

त्वरित तुलना

तुलना जोड़ी बदलें