नेव्हिगेशन
AI BENCHY
Advertise here

Qwen3.7 Max vs Grok Build 0.1 (medium)

average score जवळपास समान आहे: 7.4 vs 7.5. Qwen3.7 Max चा benchmark खर्च कमी आहे: $0.197 vs $1.130. Qwen3.7 Max वेगवान आहे: 4.56s vs 54.50s, pass rates 68.2% vs 60.6%.

AI BENCHY टेस्ट सूटमधून बेंचमार्क या वेळी तयार झाले: 2026-08-29

क्रमांक
#92
एकूण आउटपुट टोकन्स
12,446
प्रतिसाद वेळ (सरासरी)
4.56s
एकूण खर्च
$0.197
क्रमांक
#90
एकूण आउटपुट टोकन्स
511,406
प्रतिसाद वेळ (सरासरी)
54.50s
एकूण खर्च
$1.130
शिफारस केलेले मॉडेल Qwen3.7 Max

It has the best score here (7.4), while costing about 5.7x less than Grok Build 0.1 (medium).

तपशीलवार तुलना

मेट्रिक Qwen3.7 Max Qwen3.7 Max none प्रकाशन: 2026-05-22 Grok Build 0.1 Grok Build 0.1 medium प्रकाशन: 2026-05-21
स्कोअर 7.4 7.5
क्रमांक #92 #90
विश्वसनीयता 9.9 10.0
सुसंगतता 10.0 9.6
प्रयत्न 66/66 66/66
बरोबर चाचण्या
प्रति प्रयत्न पास दर 68.2% 60.6%
अस्थिर चाचण्या 0 1
एकूण रन 66 66
प्रति निकाल खर्च 1.581 8.691
एकूण खर्च $0.197 $1.130
इनपुट किंमत $1.475 / 1M $1.000 / 1M
आउटपुट किंमत $4.425 / 1M $2.000 / 1M
एकूण इनपुट टोकन्स 95,992 106,946
आउटपुट टोकन्स 12,446 7,993
रिझनिंग टोकन्स 0 503,413
प्रतिसाद वेळ (सरासरी) 4.56s 54.50s
प्रतिसाद वेळ (कमाल) 72.30s 252.69s
प्रतिसाद वेळ (एकूण) 100.30s 1199.07s
पॅरामीटर्स ~1T एकूण (~40B सक्रिय) ~300B एकूण (~30B सक्रिय)
उपलब्धता बंद स्रोत बंद स्रोत

मॉडेल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#92 Qwen3.7 Max

none
खर्च
$0.046
वेळ
195.0s
टोकन्स
12,171 tok

#90 SpaceXAI: Grok Build 0.1

medium
खर्च
$0.028
वेळ
81.3s
टोकन्स
14,009 tok

स्कोअरनुसार शीर्ष मॉडेल्स

स्कोअर विरुद्ध एकूण खर्च

प्रतिसाद वेळ (सरासरी)

स्कोअर vs प्रतिसाद वेळ (सरासरी)

एकूण आउटपुट टोकन्स

स्कोअर vs एकूण आउटपुट टोकन्स

श्रेणीवार तपशील

कोडिंग स्कोअर सुसंगतता प्रति प्रयत्न पास दर अस्थिर चाचण्या बरोबर चाचण्या प्रतिसाद वेळ (सरासरी) इनपुट टोकन्स आउटपुट टोकन्स रिझनिंग टोकन्स
Qwen3.7 Max 5.5 10.0 33.3% 0 1.35s 7,911 582 0
Grok Build 0.1 5.7 9.7 33.3% 0 108.46s 8,304 1,138 161,452

झटपट तुलना

तुलना जोडी बदला