नेव्हिगेशन
AI BENCHY
Advertise here

Qwen3.8 Max (low) vs Grok 4.5 (high)

Grok 4.5 (high) average score मध्ये पुढे आहे: 8.9 vs 8.7. Qwen3.8 Max (low) चा benchmark खर्च कमी आहे: $0.687 vs $1.707. Qwen3.8 Max (low) वेगवान आहे: 21.19s vs 76.50s, pass rates 84.9% vs 83.3%.

AI BENCHY टेस्ट सूटमधून बेंचमार्क या वेळी तयार झाले: 2026-08-04

क्रमांक
#23
एकूण आउटपुट टोकन्स
81,411
प्रतिसाद वेळ (सरासरी)
21.19s
एकूण खर्च
$0.687
क्रमांक
#17
एकूण आउटपुट टोकन्स
253,195
प्रतिसाद वेळ (सरासरी)
76.50s
एकूण खर्च
$1.707
शिफारस केलेले मॉडेल Qwen3.8 Max (low)

Its score stays close to the best score here (8.7 vs 8.9), while costing about 2.5x less than Grok 4.5 (high).

तपशीलवार तुलना

मेट्रिक Qwen3.8 Max Qwen3.8 Max low प्रकाशन: 2026-08-04 Grok 4.5 Grok 4.5 high प्रकाशन: 2026-07-08
स्कोअर 8.7 8.9
क्रमांक #23 #17
विश्वसनीयता 10.0 10.0
सुसंगतता 9.0 9.2
बेंचमार्क कव्हरेज 22/22 चाचण्या · 66/66 प्रयत्न 22/22 चाचण्या · 66/66 प्रयत्न
बरोबर चाचण्या
प्रति प्रयत्न पास दर 84.9% 83.3%
अस्थिर चाचण्या 3 2
एकूण रन 66 66
प्रति निकाल खर्च 4.041 10.041
एकूण खर्च $0.687 $1.707
इनपुट किंमत $2.000 / 1M $2.000 / 1M
आउटपुट किंमत $6.000 / 1M $6.000 / 1M
एकूण इनपुट टोकन्स 99,172 151,562
आउटपुट टोकन्स 6,132 5,655
रिझनिंग टोकन्स 75,279 247,540
प्रतिसाद वेळ (सरासरी) 21.19s 76.50s
प्रतिसाद वेळ (कमाल) 155.75s 676.83s
प्रतिसाद वेळ (एकूण) 466.14s 1683.07s

मॉडेल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#23 Qwen3.8 Max

low
खर्च
$0.026
वेळ
68.5s
टोकन्स
4,280 tok

#17 xAI: Grok 4.5

high
खर्च
$0.015
वेळ
29.7s
टोकन्स
2,737 tok

स्कोअरनुसार शीर्ष मॉडेल्स

स्कोअर विरुद्ध एकूण खर्च

प्रतिसाद वेळ (सरासरी)

स्कोअर vs प्रतिसाद वेळ (सरासरी)

एकूण आउटपुट टोकन्स

स्कोअर vs एकूण आउटपुट टोकन्स

श्रेणीवार तपशील

कोडिंग स्कोअर सुसंगतता प्रति प्रयत्न पास दर अस्थिर चाचण्या बरोबर चाचण्या प्रतिसाद वेळ (सरासरी) इनपुट टोकन्स आउटपुट टोकन्स रिझनिंग टोकन्स
Qwen3.8 Max 8.4 7.4 88.9% 1 28.69s 8,127 512 15,952
Grok 4.5 10.0 10.0 100.0% 0 155.16s 9,579 357 100,752

झटपट तुलना

तुलना जोडी बदला