नेविगेशन
AI BENCHY
Advertise here

Seed-2.0-Code (high) vs Grok 4.20 (medium)

Grok 4.20 (medium) average score में आगे है: 7.0 vs 6.9. Grok 4.20 (medium) की benchmark लागत कम है: $0.805 vs $1.273. Grok 4.20 (medium) तेज है: 32.56s vs 124.18s, pass rates 63.6% vs 60.6%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-08-15

रैंक
#125
कुल आउटपुट टोकन
410,575
प्रतिक्रिया समय (औसत)
124.18s
कुल लागत
$1.273
रैंक
#120
कुल आउटपुट टोकन
270,259
प्रतिक्रिया समय (औसत)
32.56s
कुल लागत
$0.805
अनुशंसित मॉडल Grok 4.20 (medium)

It has the best score here (7.0), while costing about 1.6x less than Seed-2.0-Code (high).

विस्तृत तुलना

मेट्रिक Seed-2.0-Code Seed-2.0-Code high रिलीज़: 2026-08-12 Grok 4.20 Grok 4.20 medium रिलीज़: 2026-03-31
स्कोर 6.9 7.0
रैंक #125 #120
विश्वसनीयता 8.6 10.0
संगति 7.8 8.2
प्रयास 66/66 66/66
सही परीक्षण
प्रति प्रयास पास दर 63.6% 60.6%
अस्थिर टेस्ट 5 5
कुल रन 66 66
प्रति परिणाम लागत 11.571 10.365
कुल लागत $1.273 $0.805
इनपुट कीमत $0.500 / 1M $1.250 / 1M
आउटपुट कीमत $3.000 / 1M $2.500 / 1M
कुल इनपुट टोकन 81,970 102,986
आउटपुट टोकन 7,186 5,860
रीजनिंग टोकन 403,389 264,399
प्रतिक्रिया समय (औसत) 124.18s 32.56s
प्रतिक्रिया समय (अधिकतम) 675.30s 199.66s
प्रतिक्रिया समय (कुल) 2732.03s 716.36s
पैरामीटर ~200B कुल (~20B सक्रिय) ~1T कुल (~100B सक्रिय)
उपलब्धता बंद स्रोत बंद स्रोत

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#125 Seed-2.0-Code

high
लागत
$0.037
समय
183.6s
टोकन
12,388 tok

#120 SpaceXAI: Grok 4.20

medium
लागत
$0.041
समय
110.3s
टोकन
16,336 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Seed-2.0-Code 6.2 6.5 55.6% 1 266.74s 6,750 432 124,956
Grok 4.20 6.3 6.6 55.6% 1 109.93s 8,307 268 103,150

त्वरित तुलना

तुलना जोड़ी बदलें