नेविगेशन
AI BENCHY
Advertise here

Qwen3.8 Max (low) vs Grok 4.5 (high)

Grok 4.5 (high) average score में आगे है: 8.9 vs 8.7. Qwen3.8 Max (low) की benchmark लागत कम है: $0.687 vs $1.707. Qwen3.8 Max (low) तेज है: 21.19s vs 76.50s, pass rates 84.9% vs 83.3%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-08-04

रैंक
#23
कुल आउटपुट टोकन
81,411
प्रतिक्रिया समय (औसत)
21.19s
कुल लागत
$0.687
रैंक
#17
कुल आउटपुट टोकन
253,195
प्रतिक्रिया समय (औसत)
76.50s
कुल लागत
$1.707
अनुशंसित मॉडल Qwen3.8 Max (low)

Its score stays close to the best score here (8.7 vs 8.9), while costing about 2.5x less than Grok 4.5 (high).

विस्तृत तुलना

मेट्रिक Qwen3.8 Max Qwen3.8 Max low रिलीज़: 2026-08-04 Grok 4.5 Grok 4.5 high रिलीज़: 2026-07-08
स्कोर 8.7 8.9
रैंक #23 #17
विश्वसनीयता 10.0 10.0
संगति 9.0 9.2
बेंचमार्क कवरेज 22/22 टेस्ट · 66/66 प्रयास 22/22 टेस्ट · 66/66 प्रयास
सही परीक्षण
प्रति प्रयास पास दर 84.9% 83.3%
अस्थिर टेस्ट 3 2
कुल रन 66 66
प्रति परिणाम लागत 4.041 10.041
कुल लागत $0.687 $1.707
इनपुट कीमत $2.000 / 1M $2.000 / 1M
आउटपुट कीमत $6.000 / 1M $6.000 / 1M
कुल इनपुट टोकन 99,172 151,562
आउटपुट टोकन 6,132 5,655
रीजनिंग टोकन 75,279 247,540
प्रतिक्रिया समय (औसत) 21.19s 76.50s
प्रतिक्रिया समय (अधिकतम) 155.75s 676.83s
प्रतिक्रिया समय (कुल) 466.14s 1683.07s

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#23 Qwen3.8 Max

low
लागत
$0.026
समय
68.5s
टोकन
4,280 tok

#17 xAI: Grok 4.5

high
लागत
$0.015
समय
29.7s
टोकन
2,737 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Qwen3.8 Max 8.4 7.4 88.9% 1 28.69s 8,127 512 15,952
Grok 4.5 10.0 10.0 100.0% 0 155.16s 9,579 357 100,752

त्वरित तुलना

तुलना जोड़ी बदलें