नेव्हिगेशन
AI BENCHY
Advertise here

Qwen3.8 Max (medium) vs Grok 4.5 (high)

Qwen3.8 Max (medium) average score मध्ये पुढे आहे: 9.1 vs 8.9. Qwen3.8 Max (medium) चा benchmark खर्च कमी आहे: $0.728 vs $1.707. Qwen3.8 Max (medium) वेगवान आहे: 21.53s vs 76.50s, pass rates 84.9% vs 83.3%.

AI BENCHY टेस्ट सूटमधून बेंचमार्क या वेळी तयार झाले: 2026-08-04

क्रमांक
#14
एकूण आउटपुट टोकन्स
84,826
प्रतिसाद वेळ (सरासरी)
21.53s
एकूण खर्च
$0.728
क्रमांक
#17
एकूण आउटपुट टोकन्स
253,195
प्रतिसाद वेळ (सरासरी)
76.50s
एकूण खर्च
$1.707
शिफारस केलेले मॉडेल Qwen3.8 Max (medium)

It has the best score here (9.1), while costing about 2.3x less than Grok 4.5 (high).

तपशीलवार तुलना

मेट्रिक Qwen3.8 Max Qwen3.8 Max medium प्रकाशन: 2026-08-04 Grok 4.5 Grok 4.5 high प्रकाशन: 2026-07-08
स्कोअर 9.1 8.9
क्रमांक #14 #17
विश्वसनीयता 10.0 10.0
सुसंगतता 9.7 9.2
बेंचमार्क कव्हरेज 22/22 चाचण्या · 66/66 प्रयत्न 22/22 चाचण्या · 66/66 प्रयत्न
बरोबर चाचण्या
प्रति प्रयत्न पास दर 84.9% 83.3%
अस्थिर चाचण्या 1 2
एकूण रन 66 66
प्रति निकाल खर्च 4.040 10.041
एकूण खर्च $0.728 $1.707
इनपुट किंमत $2.000 / 1M $2.000 / 1M
आउटपुट किंमत $6.000 / 1M $6.000 / 1M
एकूण इनपुट टोकन्स 109,046 151,562
आउटपुट टोकन्स 6,567 5,655
रिझनिंग टोकन्स 78,259 247,540
प्रतिसाद वेळ (सरासरी) 21.53s 76.50s
प्रतिसाद वेळ (कमाल) 126.60s 676.83s
प्रतिसाद वेळ (एकूण) 473.75s 1683.07s

मॉडेल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#14 Qwen3.8 Max

medium
खर्च
$0.028
वेळ
71.9s
टोकन्स
4,750 tok

#17 xAI: Grok 4.5

high
खर्च
$0.015
वेळ
29.7s
टोकन्स
2,737 tok

स्कोअरनुसार शीर्ष मॉडेल्स

स्कोअर विरुद्ध एकूण खर्च

प्रतिसाद वेळ (सरासरी)

स्कोअर vs प्रतिसाद वेळ (सरासरी)

एकूण आउटपुट टोकन्स

स्कोअर vs एकूण आउटपुट टोकन्स

श्रेणीवार तपशील

कोडिंग स्कोअर सुसंगतता प्रति प्रयत्न पास दर अस्थिर चाचण्या बरोबर चाचण्या प्रतिसाद वेळ (सरासरी) इनपुट टोकन्स आउटपुट टोकन्स रिझनिंग टोकन्स
Qwen3.8 Max 10.0 10.0 100.0% 0 41.35s 7,893 430 23,804
Grok 4.5 10.0 10.0 100.0% 0 155.16s 9,579 357 100,752

झटपट तुलना

तुलना जोडी बदला