नेविगेशन
AI BENCHY
Advertise here

Grok 4.20 (medium) vs Grok 4.3 (medium)

average score लगभग बराबर है: 7.1 vs 7.1. Grok 4.20 (medium) की benchmark लागत कम है: $0.777 vs $0.779. Grok 4.20 (medium) तेज है: 29.47s vs 47.45s, pass rates 63.6% vs 68.2%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-08-11

रैंक
#101
कुल आउटपुट टोकन
259,340
प्रतिक्रिया समय (औसत)
29.47s
कुल लागत
$0.777
रैंक
#98
कुल आउटपुट टोकन
241,421
प्रतिक्रिया समय (औसत)
47.45s
कुल लागत
$0.779
अनुशंसित मॉडल Grok 4.20 (medium)

It has the best score here (7.1), while responding about 1.6x faster than Grok 4.3 (medium).

विस्तृत तुलना

मेट्रिक Grok 4.20 Grok 4.20 medium रिलीज़: 2026-03-31 Grok 4.3 Grok 4.3 medium रिलीज़: 2026-05-01
स्कोर 7.1 7.1
रैंक #101 #98
विश्वसनीयता 10.0 10.0
संगति 8.5 8.6
बेंचमार्क कवरेज 22/22 टेस्ट · 66/66 प्रयास 22/22 टेस्ट · 66/66 प्रयास
सही परीक्षण
प्रति प्रयास पास दर 63.6% 68.2%
अस्थिर टेस्ट 4 4
कुल रन 66 66
प्रति परिणाम लागत 9.709 5.990
कुल लागत $0.777 $0.779
इनपुट कीमत $1.250 / 1M $1.250 / 1M
आउटपुट कीमत $2.500 / 1M $2.500 / 1M
कुल इनपुट टोकन 102,791 140,031
आउटपुट टोकन 5,363 13,739
रीजनिंग टोकन 253,977 227,682
प्रतिक्रिया समय (औसत) 29.47s 47.45s
प्रतिक्रिया समय (अधिकतम) 199.66s 216.69s
प्रतिक्रिया समय (कुल) 648.35s 1043.83s

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#101 xAI: Grok 4.20

medium
लागत
$0.041
समय
110.3s
टोकन
16,336 tok

#98 xAI: Grok 4.3

medium
लागत
$0.009
समय
19.0s
टोकन
3,661 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Grok 4.20 6.3 6.6 55.6% 1 109.93s 8,307 268 103,150
Grok 4.3 5.9 7.7 44.4% 1 41.23s 8,340 1,028 31,226

त्वरित तुलना

तुलना जोड़ी बदलें