नेविगेशन
Advertise here

तुलना किए गए मॉडल

Qwen3.8 2.4T A95B (low) vs Qwen3.8 2.4T A95B (high) vs Grok 4.6 (high) benchmark तुलना: Grok 4.6 (high) स्कोर में 9.3 के साथ आगे है। Grok 4.6 (high) विश्वसनीयता में 10.0 के साथ आगे है। Grok 4.6 (high) का कुल लागत सबसे कम है: $1.908. Grok 4.6 (high) 84.15s पर सबसे तेज है।

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-09-24

तुलना किए गए मॉडल

रैंक
#78
कुल आउटपुट टोकन
495,541
प्रतिक्रिया समय (औसत)
118.97s
कुल लागत
$2.672
रैंक
#133
कुल आउटपुट टोकन
456,028
प्रतिक्रिया समय (औसत)
120.59s
कुल लागत
$2.357
रैंक
#19
कुल आउटपुट टोकन
282,217
प्रतिक्रिया समय (औसत)
84.15s
कुल लागत
$1.908
अनुशंसित मॉडल Grok 4.6 (high)

It has the strongest score in this comparison (9.3) and the best overall balance of cost and response time across all 3 models.

विस्तृत तुलना

मेट्रिक Qwen3.8 2.4T A95B Qwen3.8 2.4T A95B low रिलीज़: 2026-08-12 Qwen3.8 2.4T A95B Qwen3.8 2.4T A95B high रिलीज़: 2026-08-12 Grok 4.6 Grok 4.6 high रिलीज़: 2026-08-12
स्कोर 8.1 7.4 9.3
रैंक #78 #133 #19
विश्वसनीयता 9.4 9.4 10.0
संगति 9.2 8.3 10.0
प्रयास 66/66 66/66 66/66
सही परीक्षण
प्रति प्रयास पास दर 72.7% 74.2% 86.4%
अस्थिर टेस्ट 2 4 0
कुल रन 66 66 66
प्रति परिणाम लागत 17.812 16.832 10.042
कुल लागत $2.672 $2.357 $1.908
इनपुट कीमत $2.000 / 1M $2.000 / 1M $2.000 / 1M
आउटपुट कीमत $6.000 / 1M $6.000 / 1M $6.000 / 1M
कुल इनपुट टोकन 113,279 108,931 107,275
आउटपुट टोकन 121,045 112,801 5,094
रीजनिंग टोकन 374,496 343,227 277,123
प्रतिक्रिया समय (औसत) 118.97s 120.59s 84.15s
प्रतिक्रिया समय (अधिकतम) 534.21s 532.28s 618.49s
प्रतिक्रिया समय (कुल) 2617.41s 2653.05s 1851.26s
पैरामीटर 2.4T कुल (95B सक्रिय) 2.4T कुल (95B सक्रिय) ~1.7T कुल (~170B सक्रिय)
उपलब्धता वेट उपलब्ध वेट उपलब्ध बंद स्रोत

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#78 Qwen3.8 2.4T A95B

low
लागत
$0.100
समय
193.2s
टोकन
16,767 tok

#133 Qwen3.8 2.4T A95B

high
Reached the allocated time limit (600 seconds) without receiving showcase output.
लागत
$0.000
समय
600.0s
टोकन
0 tok

#19 SpaceXAI: Grok 4.6

high
लागत
$0.107
समय
265.1s
टोकन
18,001 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Qwen3.8 2.4T A95B 7.8 9.3 66.7% 0 172.53s 6,716 21,405 57,399
Qwen3.8 2.4T A95B 5.9 6.3 55.6% 1 160.52s 6,399 3,310 48,078
Grok 4.6 10.0 10.0 100.0% 0 102.20s 9,579 379 51,829

त्वरित तुलना

तुलना जोड़ी बदलें