नेविगेशन
AI BENCHY
Advertise here

Qwen3.8 2.4T A95B (low) vs Grok 4.6 (high)

Grok 4.6 (high) average score में आगे है: 9.2 vs 8.2. Grok 4.6 (high) की benchmark लागत कम है: $1.809 vs $3.113. Grok 4.6 (high) तेज है: 79.38s vs 132.39s, pass rates 78.8% vs 84.9%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-08-12

रैंक
#46
कुल आउटपुट टोकन
554,485
प्रतिक्रिया समय (औसत)
132.39s
कुल लागत
$3.113
रैंक
#11
कुल आउटपुट टोकन
265,604
प्रतिक्रिया समय (औसत)
79.38s
कुल लागत
$1.809
अनुशंसित मॉडल Grok 4.6 (high)

It has the best score here (9.2), while costing about 1.7x less than Qwen3.8 2.4T A95B (low).

विस्तृत तुलना

मेट्रिक Qwen3.8 2.4T A95B Qwen3.8 2.4T A95B low रिलीज़: 2026-08-12 Grok 4.6 Grok 4.6 high रिलीज़: 2026-08-12
स्कोर 8.2 9.2
रैंक #46 #11
विश्वसनीयता 9.1 10.0
संगति 8.9 9.6
प्रयास 66/66 66/66
सही परीक्षण
प्रति प्रयास पास दर 78.8% 84.9%
अस्थिर टेस्ट 3 1
कुल रन 66 66
प्रति परिणाम लागत 19.453 10.046
कुल लागत $3.113 $1.809
इनपुट कीमत $2.000 / 1M $2.000 / 1M
आउटपुट कीमत $6.000 / 1M $6.000 / 1M
कुल इनपुट टोकन 113,340 107,266
आउटपुट टोकन 107,311 5,094
रीजनिंग टोकन 447,174 260,510
प्रतिक्रिया समय (औसत) 132.39s 79.38s
प्रतिक्रिया समय (अधिकतम) 534.21s 618.49s
प्रतिक्रिया समय (कुल) 2912.56s 1746.29s
पैरामीटर 2.4T कुल (95B सक्रिय) ~1.7T कुल (~170B सक्रिय)
उपलब्धता वेट उपलब्ध बंद स्रोत

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#46 Qwen3.8 2.4T A95B

low
लागत
$0.100
समय
193.2s
टोकन
16,767 tok

#11 SpaceXAI: Grok 4.6

high
लागत
$0.107
समय
265.1s
टोकन
18,001 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Qwen3.8 2.4T A95B 7.6 7.2 77.8% 1 172.53s 6,716 21,405 57,399
Grok 4.6 10.0 10.0 100.0% 0 102.20s 9,579 379 51,829

त्वरित तुलना

तुलना जोड़ी बदलें