नेव्हिगेशन
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

तुलना केलेली मॉडेल्स

Qwen3.8 2.4T A95B (low) vs Qwen3.8 2.4T A95B (high) vs Grok 4.6 (high) benchmark तुलना: Grok 4.6 (high) स्कोअर मध्ये 9.3 सह आघाडीवर आहे. Grok 4.6 (high) विश्वसनीयता मध्ये 10.0 सह आघाडीवर आहे. Grok 4.6 (high) चे एकूण खर्च सर्वात कमी आहे: $1.908. Grok 4.6 (high) 84.15s वर सर्वात जलद आहे.

AI BENCHY टेस्ट सूटमधून बेंचमार्क या वेळी तयार झाले: 2026-09-24

तुलना केलेली मॉडेल्स

क्रमांक
#78
एकूण आउटपुट टोकन्स
495,541
प्रतिसाद वेळ (सरासरी)
118.97s
एकूण खर्च
$2.672
क्रमांक
#133
एकूण आउटपुट टोकन्स
456,028
प्रतिसाद वेळ (सरासरी)
120.59s
एकूण खर्च
$2.357
क्रमांक
#19
एकूण आउटपुट टोकन्स
282,217
प्रतिसाद वेळ (सरासरी)
84.15s
एकूण खर्च
$1.908
शिफारस केलेले मॉडेल Grok 4.6 (high)

It has the strongest score in this comparison (9.3) and the best overall balance of cost and response time across all 3 models.

तपशीलवार तुलना

मेट्रिक Qwen3.8 2.4T A95B Qwen3.8 2.4T A95B low प्रकाशन: 2026-08-12 Qwen3.8 2.4T A95B Qwen3.8 2.4T A95B high प्रकाशन: 2026-08-12 Grok 4.6 Grok 4.6 high प्रकाशन: 2026-08-12
स्कोअर 8.1 7.4 9.3
क्रमांक #78 #133 #19
विश्वसनीयता 9.4 9.4 10.0
सुसंगतता 9.2 8.3 10.0
प्रयत्न 66/66 66/66 66/66
बरोबर चाचण्या
प्रति प्रयत्न पास दर 72.7% 74.2% 86.4%
अस्थिर चाचण्या 2 4 0
एकूण रन 66 66 66
प्रति निकाल खर्च 17.812 16.832 10.042
एकूण खर्च $2.672 $2.357 $1.908
इनपुट किंमत $2.000 / 1M $2.000 / 1M $2.000 / 1M
आउटपुट किंमत $6.000 / 1M $6.000 / 1M $6.000 / 1M
एकूण इनपुट टोकन्स 113,279 108,931 107,275
आउटपुट टोकन्स 121,045 112,801 5,094
रिझनिंग टोकन्स 374,496 343,227 277,123
प्रतिसाद वेळ (सरासरी) 118.97s 120.59s 84.15s
प्रतिसाद वेळ (कमाल) 534.21s 532.28s 618.49s
प्रतिसाद वेळ (एकूण) 2617.41s 2653.05s 1851.26s
पॅरामीटर्स 2.4T एकूण (95B सक्रिय) 2.4T एकूण (95B सक्रिय) ~1.7T एकूण (~170B सक्रिय)
उपलब्धता वेट्स उपलब्ध वेट्स उपलब्ध बंद स्रोत

मॉडेल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#78 Qwen3.8 2.4T A95B

low
खर्च
$0.100
वेळ
193.2s
टोकन्स
16,767 tok

#133 Qwen3.8 2.4T A95B

high
Reached the allocated time limit (600 seconds) without receiving showcase output.
खर्च
$0.000
वेळ
600.0s
टोकन्स
0 tok

#19 SpaceXAI: Grok 4.6

high
खर्च
$0.107
वेळ
265.1s
टोकन्स
18,001 tok

स्कोअरनुसार शीर्ष मॉडेल्स

स्कोअर विरुद्ध एकूण खर्च

प्रतिसाद वेळ (सरासरी)

स्कोअर vs प्रतिसाद वेळ (सरासरी)

एकूण आउटपुट टोकन्स

स्कोअर vs एकूण आउटपुट टोकन्स

श्रेणीवार तपशील

कोडिंग स्कोअर सुसंगतता प्रति प्रयत्न पास दर अस्थिर चाचण्या बरोबर चाचण्या प्रतिसाद वेळ (सरासरी) इनपुट टोकन्स आउटपुट टोकन्स रिझनिंग टोकन्स
Qwen3.8 2.4T A95B 7.8 9.3 66.7% 0 172.53s 6,716 21,405 57,399
Qwen3.8 2.4T A95B 5.9 6.3 55.6% 1 160.52s 6,399 3,310 48,078
Grok 4.6 10.0 10.0 100.0% 0 102.20s 9,579 379 51,829

झटपट तुलना

तुलना जोडी बदला