नेव्हिगेशन
AI BENCHY
Advertise here

Qwen3.8 Max (low) vs Grok 4.5 (medium)

Qwen3.8 Max (low) average score मध्ये पुढे आहे: 8.6 vs 8.5. Qwen3.8 Max (low) चा benchmark खर्च कमी आहे: $0.702 vs $2.042. Qwen3.8 Max (low) वेगवान आहे: 21.83s vs 68.59s, pass rates 80.3% vs 83.3%.

AI BENCHY टेस्ट सूटमधून बेंचमार्क या वेळी तयार झाले: 2026-08-15

क्रमांक
#35
एकूण आउटपुट टोकन्स
83,821
प्रतिसाद वेळ (सरासरी)
21.83s
एकूण खर्च
$0.702
क्रमांक
#37
एकूण आउटपुट टोकन्स
299,460
प्रतिसाद वेळ (सरासरी)
68.59s
एकूण खर्च
$2.042
शिफारस केलेले मॉडेल Qwen3.8 Max (low)

It has the best score here (8.6), while costing about 2.9x less than Grok 4.5 (medium).

तपशीलवार तुलना

मेट्रिक Qwen3.8 Max Qwen3.8 Max low प्रकाशन: 2026-08-04 Grok 4.5 Grok 4.5 medium प्रकाशन: 2026-07-08
स्कोअर 8.6 8.5
क्रमांक #35 #37
विश्वसनीयता 10.0 10.0
सुसंगतता 9.0 8.9
प्रयत्न 66/66 66/66
बरोबर चाचण्या
प्रति प्रयत्न पास दर 80.3% 83.3%
अस्थिर चाचण्या 3 3
एकूण रन 66 66
प्रति निकाल खर्च 4.384 12.007
एकूण खर्च $0.702 $2.042
इनपुट किंमत $2.000 / 1M $2.000 / 1M
आउटपुट किंमत $6.000 / 1M $6.000 / 1M
एकूण इनपुट टोकन्स 99,181 122,155
आउटपुट टोकन्स 6,132 5,514
रिझनिंग टोकन्स 77,689 293,946
प्रतिसाद वेळ (सरासरी) 21.83s 68.59s
प्रतिसाद वेळ (कमाल) 155.75s 436.38s
प्रतिसाद वेळ (एकूण) 480.37s 1508.91s
पॅरामीटर्स 2.4T एकूण (~100B सक्रिय) ~1.7T एकूण (~170B सक्रिय)
उपलब्धता बंद स्रोत बंद स्रोत

मॉडेल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#35 Qwen3.8 Max

low
खर्च
$0.026
वेळ
68.5s
टोकन्स
4,280 tok

#37 SpaceXAI: Grok 4.5

medium
खर्च
$0.044
वेळ
59.4s
टोकन्स
7,512 tok

स्कोअरनुसार शीर्ष मॉडेल्स

स्कोअर विरुद्ध एकूण खर्च

प्रतिसाद वेळ (सरासरी)

स्कोअर vs प्रतिसाद वेळ (सरासरी)

एकूण आउटपुट टोकन्स

स्कोअर vs एकूण आउटपुट टोकन्स

श्रेणीवार तपशील

कोडिंग स्कोअर सुसंगतता प्रति प्रयत्न पास दर अस्थिर चाचण्या बरोबर चाचण्या प्रतिसाद वेळ (सरासरी) इनपुट टोकन्स आउटपुट टोकन्स रिझनिंग टोकन्स
Qwen3.8 Max 8.4 7.4 88.9% 1 28.69s 8,127 512 15,952
Grok 4.5 7.6 7.2 77.8% 1 155.69s 9,579 390 104,634

झटपट तुलना

तुलना जोडी बदला