AI BENCHY
Advertise here
#143

Mercury 2

Inception प्रकाशन: 2026-02-24 चाचणी तारीख: 2026-05-22 00:39 inception/mercury-2::none
~100Bइतरबंद स्रोतअंदाजित
(medium) (none)

सारांश

Mercury 2 AI BENCHY वर 4.6 स्कोर करते आणि #143 वर आहे. याची reliability 10.0, pass rate 25.0%, एकूण खर्च $0.009, आणि सरासरी response time 614ms आहे.

Mercury 2 खास का आहे: या score range साठी एकूण benchmark खर्च असामान्यपणे कमी आहे. समान मॉडेल्सच्या तुलनेत हे लक्षणीय वेगवान आहे.

मॉडेलची माहिती

संशोधन दिनांक: 2026-08-12

अंदाजित
पॅरामीटर्स
~100B
आर्किटेक्चर
इतर
उपलब्धता
बंद स्रोत
परवाना
-

सार्वजनिक पुराव्यावर आधारित सर्वोत्तम अंदाज; प्रदात्याने सर्व मूल्ये जाहीर केलेली नाहीत.

सुसंगतता

9.1

एकूण आउटपुट टोकन्स

2,984

एकूण इनपुट टोकन्स

0

इनपुट किंमत

$0.250 / 1M

आउटपुट किंमत

$0.750 / 1M

बरोबर चाचण्या

चुकीच्या चाचण्या: 16

प्रति प्रयत्न पास दर: 25.0%

अस्थिर चाचण्या

2

अस्थिर चाचण्यांत रन्समध्ये मिश्र निकाल असतात (किमान एक पास आणि एक फेल).

प्रतिसाद वेळ (सरासरी)

614ms

प्रतिसाद वेळ (कमाल): 1.27s

प्रतिसाद वेळ (एकूण): 12.28s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#143 Mercury 2

none
खर्च
$0.002
वेळ
1.8s
टोकन्स
1,514 tok

रन इतिहास

चाचणी तारीख स्कोअर विश्वसनीयता बरोबर चाचण्या एकूण खर्च तुलना करा
2026-08-14 03:05 पुन्हा चाचणी 4.7 10.0 $0.030 तुलना करा
2026-07-16 23:13 नवीन चाचणी जोडली 4.6 10.0 $0.030 तुलना करा
2026-06-04 14:27 नवीन चाचणी जोडली 4.5 10.0 $0.011 तुलना करा
2026-05-22 00:39 सूट बदलला 4.6 10.0 $0.009 सध्याची रन
2026-04-11 01:44 पहिली नोंदलेली रन 4.8 लागू नाही $0.007 तुलना करा

या रनमध्ये वेगळा बेंचमार्क सूट वापरला गेला. ऐतिहासिक बदल वाचताना सूटमधील बदल लक्षात घ्या.

रन तुलना

रनबेंचमार्क कव्हरेजस्कोअरसुसंगतताविश्वसनीयताबरोबर चाचण्याअस्थिर चाचण्याएकूण आउटपुट टोकन्सएकूण इनपुट टोकन्सएकूण खर्चप्रतिसाद वेळ (सरासरी)
2026-05-22 00:39 · सूट बदलला60/60 प्रयत्न4.69.110.04/2022,9840$0.009614ms
2026-06-04 14:27 · नवीन चाचणी जोडली63/63 प्रयत्न4.59.210.04/2124,43928,113$0.011653ms
फरक+0.1-0.10.000-1455-28113-$0.002-39ms

बेंचमार्क कव्हरेज वेगळे आहे: 60/60 प्रयत्न (लक्ष्य: प्रत्येक चाचणीसाठी 3 पुनरावृत्ती) विरुद्ध 63/63 प्रयत्न (लक्ष्य: प्रत्येक चाचणीसाठी 3 पुनरावृत्ती). एकूण मूल्ये आणि पुनरावृत्तीवर अवलंबून मेट्रिक्स थेट तुलना करता येत नाहीत.

या दोन रनमध्ये वेगवेगळे बेंचमार्क सूट वापरले गेले, त्यामुळे फरकांमध्ये मॉडेलमधील आणि सूटमधील दोन्ही बदल दिसतात.

चार्ट्स

पहिले मॉडेल निवडा, नंतर दुसरे मॉडेल क्लिक करून बाजू-बाजूची तुलना पेज उघडा.

एकूण आउटपुट टोकन्स

स्कोअर vs एकूण आउटपुट टोकन्स

झटपट तुलना

श्रेणीवार तपशील

श्रेणी स्कोअर सुसंगतता बरोबर चाचण्या
अँटी-एआय युक्त्या 3.0 10.0
कोडिंग 3.5 9.4
संयुक्त 3.0 10.0
डेटा पार्सिंग आणि निष्कर्षण 7.3 5.9
डोमेन-विशिष्ट 5.3 7.2
Samanya Buddhimatta 4.8 10.0
सूचनांचे पालन 6.5 10.0
कोडी सोडवणे 3.1 10.0
टूल कॉलिंग 10.0 10.0
सामान्य ज्ञान 3.0 10.0

तुलना केलेली मॉडेल्स