नेविगेशन
AI BENCHY
Advertise here

Seed-2.0-Mini (medium) vs Grok 4.20 (medium)

average score लगभग बराबर है: 7.0 vs 7.0. Seed-2.0-Mini (medium) की benchmark लागत कम है: $0.116 vs $0.805. Grok 4.20 (medium) तेज है: 32.56s vs 93.10s, pass rates 57.6% vs 60.6%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-08-15

रैंक
#121
कुल आउटपुट टोकन
258,322
प्रतिक्रिया समय (औसत)
93.10s
कुल लागत
$0.116
रैंक
#120
कुल आउटपुट टोकन
270,259
प्रतिक्रिया समय (औसत)
32.56s
कुल लागत
$0.805
अनुशंसित मॉडल Seed-2.0-Mini (medium)

It has the best score here (7.0), while costing about 6.9x less than Grok 4.20 (medium).

विस्तृत तुलना

मेट्रिक Seed-2.0-Mini Seed-2.0-Mini medium रिलीज़: 2026-02-14 Grok 4.20 Grok 4.20 medium रिलीज़: 2026-03-31
स्कोर 7.0 7.0
रैंक #121 #120
विश्वसनीयता 8.7 10.0
संगति 8.9 8.2
प्रयास 66/66 66/66
सही परीक्षण
प्रति प्रयास पास दर 57.6% 60.6%
अस्थिर टेस्ट 3 5
कुल रन 66 66
प्रति परिणाम लागत 1.054 10.365
कुल लागत $0.116 $0.805
इनपुट कीमत $0.100 / 1M $1.250 / 1M
आउटपुट कीमत $0.400 / 1M $2.500 / 1M
कुल इनपुट टोकन 125,704 102,986
आउटपुट टोकन 10,781 5,860
रीजनिंग टोकन 247,541 264,399
प्रतिक्रिया समय (औसत) 93.10s 32.56s
प्रतिक्रिया समय (अधिकतम) 301.78s 199.66s
प्रतिक्रिया समय (कुल) 1768.91s 716.36s
पैरामीटर ~50B कुल (~5B सक्रिय) ~1T कुल (~100B सक्रिय)
उपलब्धता बंद स्रोत बंद स्रोत

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#121 Seed-2.0-Mini

medium
लागत
$0.002
समय
161.7s
टोकन
4,379 tok

#120 SpaceXAI: Grok 4.20

medium
लागत
$0.041
समय
110.3s
टोकन
16,336 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Seed-2.0-Mini 5.5 9.8 33.3% 0 220.48s 3,823 464 34,964
Grok 4.20 6.3 6.6 55.6% 1 109.93s 8,307 268 103,150

त्वरित तुलना

तुलना जोड़ी बदलें