नेविगेशन
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Qwen: Qwen3.7 Plus vs xAI: Grok 4.5

Grok 4.5 (medium) average score में आगे है: 8.3 vs 7.9. Qwen3.7 Plus (medium) की benchmark लागत कम है: $0.267 vs $1.928. Qwen3.7 Plus (medium) तेज है: 51.51s vs 61.71s, pass rates 75.8% vs 78.8%.

अनुशंसित मॉडलQwen3.7 Plus (medium)Its score stays close to the best score here (7.9 vs 8.3), while costing about 7.2x less than Grok 4.5 (medium).

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-07-25

मेट्रिक Qwen3.7 Plus Qwen3.7 Plus medium रिलीज़: 2026-06-03 Grok 4.5 Grok 4.5 medium रिलीज़: 2026-07-08
स्कोर 7.9 8.3
रैंक #43 #28
विश्वसनीयता 10.0 10.0
संगति 8.9 8.9
सही परीक्षण
प्रति प्रयास पास दर 75.8% 78.8%
अस्थिर टेस्ट 3 3
कुल रन 66 66
प्रति परिणाम लागत 2.072 12.049
कुल लागत $0.267 $1.928
इनपुट कीमत $0.320 / 1M $2.000 / 1M
आउटपुट कीमत $1.280 / 1M $6.000 / 1M
कुल इनपुट टोकन 115,233 122,146
आउटपुट टोकन 6,162 5,514
रीजनिंग टोकन 173,267 275,053
प्रतिक्रिया समय (औसत) 51.51s 61.71s
प्रतिक्रिया समय (अधिकतम) 315.30s 436.38s
प्रतिक्रिया समय (कुल) 1133.15s 1357.56s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#43 Qwen3.7 Plus

medium
लागत
$0.018
समय
193.2s
टोकन
10,821 tok

#28 xAI: Grok 4.5

medium
लागत
$0.044
समय
59.4s
टोकन
7,512 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Qwen3.7 Plus 6.1 6.6 55.6% 1 108.60s 6,472 414 43,576
Grok 4.5 7.6 7.2 77.8% 1 155.69s 9,579 390 104,634

त्वरित तुलना

तुलना जोड़ी बदलें