नेविगेशन
AI BENCHY
Advertise here

Seed-2.0-Code vs Mistral Small 4

Seed-2.0-Code average score में आगे है: 5.3 vs 5.1. Mistral Small 4 की benchmark लागत कम है: $0.022 vs $0.151. Mistral Small 4 तेज है: 1.20s vs 14.67s, pass rates 34.9% vs 25.8%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-08-12

रैंक
#219
कुल आउटपुट टोकन
23,432
प्रतिक्रिया समय (औसत)
14.67s
कुल लागत
$0.151
रैंक
#222
कुल आउटपुट टोकन
9,812
प्रतिक्रिया समय (औसत)
1.20s
कुल लागत
$0.022
अनुशंसित मॉडल Mistral Small 4

Its score stays close to the best score here (5.1 vs 5.3), while costing about 7.0x less than Seed-2.0-Code.

विस्तृत तुलना

मेट्रिक Seed-2.0-Code Seed-2.0-Code none रिलीज़: 2026-08-12 Mistral Small 4 Mistral Small 4 none रिलीज़: 2026-03-16
स्कोर 5.3 5.1
रैंक #219 #222
विश्वसनीयता 6.7 10.0
संगति 8.1 9.6
प्रयास 66/66 66/66
सही परीक्षण
प्रति प्रयास पास दर 34.9% 25.8%
अस्थिर टेस्ट 5 1
कुल रन 66 66
प्रति परिणाम लागत 2.503 0.432
कुल लागत $0.151 $0.022
इनपुट कीमत $0.500 / 1M $0.150 / 1M
आउटपुट कीमत $3.000 / 1M $0.600 / 1M
कुल इनपुट टोकन 159,740 104,708
आउटपुट टोकन 23,432 9,812
रीजनिंग टोकन 0 0
प्रतिक्रिया समय (औसत) 14.67s 1.20s
प्रतिक्रिया समय (अधिकतम) 132.84s 13.16s
प्रतिक्रिया समय (कुल) 322.75s 26.38s
पैरामीटर ~200B कुल (~20B सक्रिय) 119B कुल (6B सक्रिय)
उपलब्धता बंद स्रोत मुक्त स्रोत

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#219 Seed-2.0-Code

none
लागत
$0.030
समय
140.6s
टोकन
9,924 tok

#222 Mistral Small 4

none
लागत
$0.002
समय
10.4s
टोकन
2,370 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Seed-2.0-Code 3.6 9.8 0.0% 0 13.42s 7,230 505 0
Mistral Small 4 3.7 9.7 0.0% 0 901ms 7,636 619 0

त्वरित तुलना

तुलना जोड़ी बदलें