AI BENCHY
Advertise here
#125

Mercury 2

Inception रिलीज़: 2026-02-24 परीक्षण किया गया: 2026-08-14 03:05 inception/mercury-2::medium
~100Bअन्यबंद स्रोतअनुमानित
(medium) (none)

सारांश

Mercury 2 AI BENCHY पर 7.0 स्कोर करता है और #125 पर है। इसकी reliability 10.0, pass rate 53.0%, कुल लागत $0.094, और औसत response time 2.95s है।

Mercury 2 को अलग क्या बनाता है: यह निर्देश पालन में सबसे अलग दिखता है, जहाँ इसकी रैंक #1 है; जबकि पहेली समाधान इसकी सबसे कमजोर जगह है, जहाँ यह #16 पर है।

मॉडल विवरण

शोध की तारीख: 2026-08-12

अनुमानित
पैरामीटर
~100B
आर्किटेक्चर
अन्य
उपलब्धता
बंद स्रोत
लाइसेंस
-

सार्वजनिक साक्ष्यों पर आधारित सर्वोत्तम अनुमान; प्रदाता ने सभी मान जारी नहीं किए हैं।

संगति

8.4

कुल आउटपुट टोकन

87,554

कुल इनपुट टोकन

110,515

इनपुट कीमत

$0.250 / 1M

आउटपुट कीमत

$0.750 / 1M

सही परीक्षण

गलत टेस्ट: 12

प्रति प्रयास पास दर: 53.0%

अस्थिर टेस्ट

4

अस्थिर टेस्ट में रनों के बीच मिले-जुले परिणाम रहे (कम से कम एक पास और एक फेल)।

प्रतिक्रिया समय (औसत)

2.95s

प्रतिक्रिया समय (अधिकतम): 14.63s

प्रतिक्रिया समय (कुल): 61.89s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#125 Mercury 2

medium
लागत
$0.002
समय
2.1s
टोकन
1,702 tok

रन इतिहास

परीक्षण किया गया स्कोर विश्वसनीयता सही परीक्षण कुल लागत तुलना करें
2026-08-14 03:05 दोबारा परीक्षण 7.0 10.0 $0.094 वर्तमान रन
2026-07-16 23:14 नया टेस्ट जोड़ा गया 7.0 10.0 $0.093 तुलना करें
2026-06-04 14:27 नया टेस्ट जोड़ा गया 6.6 10.0 $0.058 तुलना करें
2026-05-22 00:40 दोबारा परीक्षण 6.3 10.0 $0.055 तुलना करें
2026-04-11 01:44 पहला दर्ज रन 6.5 लागू नहीं $0.047 तुलना करें

इस रन में अलग बेंचमार्क सूट इस्तेमाल हुआ था। ऐतिहासिक बदलाव पढ़ते समय सूट बदलाव को ध्यान में रखें।

कीमत का इतिहास

OpenRouter से इस मॉडल का ऐतिहासिक मूल्य डेटा।

तारीख इनपुट कीमत आउटपुट कीमत
2026-08-14 12:51 $0.250 / 1M $0.750 / 1M

चार्ट

पहले मॉडल चुनें, फिर दूसरा मॉडल क्लिक करके साइड-बाय-साइड पेज खोलें।

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

त्वरित तुलना

श्रेणी विवरण

श्रेणी स्कोर संगति सही परीक्षण
एंटी-एआई ट्रिक्स 6.9 9.9
कोडिंग 8.2 7.7
संयुक्त 6.7 9.1
डेटा पार्सिंग और निष्कर्षण 7.3 5.9
डोमेन-विशिष्ट 2.9 4.4
Samanya Buddhimatta 4.8 10.0
निर्देश पालन 10.0 10.0
पहेली समाधान 5.4 10.0
टूल कॉलिंग 10.0 10.0
सामान्य ज्ञान 3.0 10.0

तुलना किए गए मॉडल