नेविगेशन
AI BENCHY
Advertise here

Qwen: Qwen3.5-9B vs xAI: Grok 4.20

Grok 4.20 average score में आगे है: 4.1 vs 3.8. Qwen3.5-9B (medium) की benchmark लागत कम है: $0.036 vs $0.057. Grok 4.20 तेज है: 1.11s vs 82.24s, pass rates 25.8% vs 27.3%.

अनुशंसित मॉडलGrok 4.20It has the best score here (4.1), while responding about 74.2x faster than Qwen3.5-9B (medium).

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-07-25

तुलना सारांश

रैंक
#220
कुल आउटपुट टोकन
238,561
प्रतिक्रिया समय (औसत)
82.24s
कुल लागत
$0.036
रैंक
#213
कुल आउटपुट टोकन
1,923
प्रतिक्रिया समय (औसत)
1.11s
कुल लागत
$0.057

विस्तृत तुलना

मेट्रिक Qwen3.5-9B Qwen3.5-9B medium रिलीज़: 2026-03-02 Grok 4.20 Grok 4.20 none रिलीज़: 2026-03-31
स्कोर 3.8 4.1
रैंक #220 #213
विश्वसनीयता 5.0 लागू नहीं
संगति 8.1 8.1
सही परीक्षण
प्रति प्रयास पास दर 25.8% 27.3%
अस्थिर टेस्ट 5 0
कुल रन 66 54
प्रति परिणाम लागत 1.187 1.570
कुल लागत $0.036 $0.057
इनपुट कीमत $0.100 / 1M $1.250 / 1M
आउटपुट कीमत $0.150 / 1M $2.500 / 1M
कुल इनपुट टोकन 17,070 41,313
आउटपुट टोकन 29,045 1,923
रीजनिंग टोकन 209,516 0
प्रतिक्रिया समय (औसत) 82.24s 1.11s
प्रतिक्रिया समय (अधिकतम) 226.38s 6.04s
प्रतिक्रिया समय (कुल) 1315.88s 19.96s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#220 Qwen3.5-9B

medium
लागत
$0.001
समय
35.9s
टोकन
3,030 tok

#213 xAI: Grok 4.20

none
लागत
$0.004
समय
6.5s
टोकन
1,367 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Qwen3.5-9B 2.9 10.0 0.0% 0 100.88s 2,396 7,890 41,129
Grok 4.20 1.1 3.1 0.0% 0 1.22s 1,074 312 0

त्वरित तुलना

तुलना जोड़ी बदलें