AI BENCHY
Advertise here
#68

Seed-2.0-Mini

Bytedance Seed रिलीज़: 2026-02-14 परीक्षण किया गया: 2026-05-22 00:44 bytedance-seed/seed-2.0-mini::medium
~50B कुल (~5B सक्रिय)MoEबंद स्रोतअनुमानित

सारांश

Seed-2.0-Mini AI BENCHY पर 7.1 स्कोर करता है और #68 पर है। इसकी reliability 5.0, pass rate 60.0%, कुल लागत $0.044, और औसत response time 79.17s है।

Seed-2.0-Mini को अलग क्या बनाता है: इस score range के लिए इसकी कुल benchmark लागत असामान्य रूप से कम है।

मॉडल विवरण

शोध की तारीख: 2026-08-12

अनुमानित
पैरामीटर
~50B कुल (~5B सक्रिय)
आर्किटेक्चर
MoE
उपलब्धता
बंद स्रोत
लाइसेंस
-

सार्वजनिक साक्ष्यों पर आधारित सर्वोत्तम अनुमान; प्रदाता ने सभी मान जारी नहीं किए हैं।

संगति

9.2

कुल आउटपुट टोकन

97,852

कुल इनपुट टोकन

0

इनपुट कीमत

$0.100 / 1M

आउटपुट कीमत

$0.400 / 1M

सही परीक्षण

गलत टेस्ट: 9

प्रति प्रयास पास दर: 60.0%

अस्थिर टेस्ट

2

अस्थिर टेस्ट में रनों के बीच मिले-जुले परिणाम रहे (कम से कम एक पास और एक फेल)।

प्रतिक्रिया समय (औसत)

79.17s

प्रतिक्रिया समय (अधिकतम): 262.83s

प्रतिक्रिया समय (कुल): 1345.89s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#68 Seed-2.0-Mini

medium
लागत
$0.002
समय
161.7s
टोकन
4,379 tok

रन इतिहास

परीक्षण किया गया स्कोर विश्वसनीयता सही परीक्षण कुल लागत तुलना करें
2026-08-14 03:01 दोबारा परीक्षण 7.0 8.7 $0.116 तुलना करें
2026-07-16 23:23 नया टेस्ट जोड़ा गया 7.0 8.5 $0.101 तुलना करें
2026-06-04 14:36 नया टेस्ट जोड़ा गया 6.9 6.7 $0.044 तुलना करें
2026-05-22 00:44 सूट बदला गया 7.1 5.0 $0.044 वर्तमान रन
2026-04-11 01:44 पहला दर्ज रन 7.5 लागू नहीं $0.037 तुलना करें

इस रन में अलग बेंचमार्क सूट इस्तेमाल हुआ था। ऐतिहासिक बदलाव पढ़ते समय सूट बदलाव को ध्यान में रखें।

रन तुलना

रनबेंचमार्क कवरेजस्कोरसंगतिविश्वसनीयतासही परीक्षणअस्थिर टेस्टकुल आउटपुट टोकनकुल इनपुट टोकनकुल लागतप्रतिक्रिया समय (औसत)
2026-05-22 00:44 · सूट बदला गया60/60 प्रयास7.19.25.011/20297,8520$0.04479.17s
2026-07-16 23:23 · नया टेस्ट जोड़ा गया66/66 प्रयास7.08.98.511/223220,634125,467$0.10192.53s
अंतर+0.1+0.3-3.50-1-122782-125467-$0.058-13358ms

बेंचमार्क कवरेज अलग है: 60/60 प्रयास (लक्ष्य: प्रति टेस्ट 3 दोहराव) बनाम 66/66 प्रयास (लक्ष्य: प्रति टेस्ट 3 दोहराव)। कुल और दोहराव-संवेदनशील मेट्रिक सीधे तुलना योग्य नहीं हैं।

इन दो रन में अलग-अलग बेंचमार्क सूट इस्तेमाल हुए थे, इसलिए अंतर मॉडल बदलाव और सूट बदलाव दोनों को दर्शाते हैं।

चार्ट

पहले मॉडल चुनें, फिर दूसरा मॉडल क्लिक करके साइड-बाय-साइड पेज खोलें।

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

त्वरित तुलना

श्रेणी विवरण

श्रेणी स्कोर संगति सही परीक्षण
एंटी-एआई ट्रिक्स 6.6 10.0
कोडिंग 6.8 9.8
संयुक्त 10.0 10.0
डेटा पार्सिंग और निष्कर्षण 10.0 10.0
डोमेन-विशिष्ट 3.0 10.0
Samanya Buddhimatta 5.1 3.4
निर्देश पालन 10.0 10.0
पहेली समाधान 8.2 7.2
टूल कॉलिंग 10.0 10.0
सामान्य ज्ञान 3.0 10.0

तुलना किए गए मॉडल