नेविगेशन
AI BENCHY
Advertise here

Seed-2.0-Code (high) vs Grok 4.3 (medium)

Grok 4.3 (medium) average score में आगे है: 7.0 vs 6.9. Grok 4.3 (medium) की benchmark लागत कम है: $0.741 vs $1.273. Grok 4.3 (medium) तेज है: 44.21s vs 124.18s, pass rates 63.6% vs 66.7%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-08-29

रैंक
#128
कुल आउटपुट टोकन
410,575
प्रतिक्रिया समय (औसत)
124.18s
कुल लागत
$1.273
रैंक
#117
कुल आउटपुट टोकन
225,904
प्रतिक्रिया समय (औसत)
44.21s
कुल लागत
$0.741
अनुशंसित मॉडल Grok 4.3 (medium)

It has the best score here (7.0), while costing about 1.7x less than Seed-2.0-Code (high).

विस्तृत तुलना

मेट्रिक Seed-2.0-Code Seed-2.0-Code high रिलीज़: 2026-08-12 Grok 4.3 Grok 4.3 medium रिलीज़: 2026-05-01
स्कोर 6.9 7.0
रैंक #128 #117
विश्वसनीयता 8.6 10.0
संगति 7.8 8.2
प्रयास 66/66 66/66
सही परीक्षण
प्रति प्रयास पास दर 63.6% 66.7%
अस्थिर टेस्ट 5 5
कुल रन 66 66
प्रति परिणाम लागत 11.571 6.168
कुल लागत $1.273 $0.741
इनपुट कीमत $0.500 / 1M $1.250 / 1M
आउटपुट कीमत $3.000 / 1M $2.500 / 1M
कुल इनपुट टोकन 81,970 140,244
आउटपुट टोकन 7,186 13,739
रीजनिंग टोकन 403,389 212,165
प्रतिक्रिया समय (औसत) 124.18s 44.21s
प्रतिक्रिया समय (अधिकतम) 675.30s 216.69s
प्रतिक्रिया समय (कुल) 2732.03s 972.64s
पैरामीटर ~200B कुल (~20B सक्रिय) ~1.5T कुल (~150B सक्रिय)
उपलब्धता बंद स्रोत बंद स्रोत

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#128 Seed-2.0-Code

high
लागत
$0.037
समय
183.6s
टोकन
12,388 tok

#117 SpaceXAI: Grok 4.3

medium
लागत
$0.009
समय
19.0s
टोकन
3,661 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Seed-2.0-Code 6.2 6.5 55.6% 1 266.74s 6,750 432 124,956
Grok 4.3 5.9 7.7 44.4% 1 41.23s 8,340 1,028 31,226

त्वरित तुलना

तुलना जोड़ी बदलें