नेविगेशन
Advertise here

Seed-2.0-Mini (medium) vs Mercury 2.5 (high)

Mercury 2.5 (high) average score में आगे है: 7.1 vs 7.0. Mercury 2.5 (high) की benchmark लागत कम है: $0.031 vs $0.116. Mercury 2.5 (high) तेज है: 4.32s vs 93.10s, pass rates 57.6% vs 62.1%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-09-10

तुलना किए गए मॉडल

रैंक
#146
कुल आउटपुट टोकन
258,322
प्रतिक्रिया समय (औसत)
93.10s
कुल लागत
$0.116
रैंक
#138
कुल आउटपुट टोकन
174,547
प्रतिक्रिया समय (औसत)
4.32s
कुल लागत
$0.031
अनुशंसित मॉडल Mercury 2.5 (high)

It has the best score here (7.1), while costing about 3.7x less than Seed-2.0-Mini (medium).

विस्तृत तुलना

मेट्रिक Seed-2.0-Mini Seed-2.0-Mini medium रिलीज़: 2026-02-14 Mercury 2.5 Mercury 2.5 high रिलीज़: 2026-09-08
स्कोर 7.0 7.1
रैंक #146 #138
विश्वसनीयता 8.7 9.7
संगति 8.9 8.6
प्रयास 66/66 66/66
सही परीक्षण
प्रति प्रयास पास दर 57.6% 62.1%
अस्थिर टेस्ट 3 4
कुल रन 66 66
प्रति परिणाम लागत 1.054 0.259
कुल लागत $0.116 $0.031
इनपुट कीमत $0.100 / 1M $0.040 / 1M
आउटपुट कीमत $0.400 / 1M $0.150 / 1M
कुल इनपुट टोकन 125,704 120,068
आउटपुट टोकन 10,781 3,402
रीजनिंग टोकन 247,541 171,145
प्रतिक्रिया समय (औसत) 93.10s 4.32s
प्रतिक्रिया समय (अधिकतम) 301.78s 23.63s
प्रतिक्रिया समय (कुल) 1768.91s 95.06s
पैरामीटर ~50B कुल (~5B सक्रिय) ~100B
उपलब्धता बंद स्रोत बंद स्रोत

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#146 Seed-2.0-Mini

medium
लागत
$0.002
समय
161.7s
टोकन
4,379 tok

#138 Mercury 2.5

high
लागत
$0.001
समय
3.5s
टोकन
2,447 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Seed-2.0-Mini 5.5 9.8 33.3% 0 220.48s 3,823 464 34,964
Mercury 2.5 6.4 7.8 44.4% 1 6.58s 7,757 415 44,012

त्वरित तुलना

तुलना जोड़ी बदलें