नेविगेशन
Advertise here

Mercury 2.5 Preview (low) vs Laguna S 2.1

Mercury 2.5 Preview (low) average score में आगे है: 5.0 vs 4.5. Mercury 2.5 Preview (low) की benchmark लागत कम है: $0.011 vs $0.022. Mercury 2.5 Preview (low) तेज है: 1.31s vs 11.67s, pass rates 47.0% vs 15.2%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-09-22

तुलना किए गए मॉडल

रैंक
#290
कुल आउटपुट टोकन
31,975
प्रतिक्रिया समय (औसत)
1.31s
कुल लागत
$0.011
रैंक
#315
कुल आउटपुट टोकन
57,634
प्रतिक्रिया समय (औसत)
11.67s
कुल लागत
$0.022
अनुशंसित मॉडल Mercury 2.5 Preview (low)

It has the best score here (5.0), while costing about 2.1x less than Laguna S 2.1.

विस्तृत तुलना

मेट्रिक Mercury 2.5 Preview Mercury 2.5 Preview low रिलीज़: 2026-09-02 Laguna S 2.1 Laguna S 2.1 none रिलीज़: 2026-07-21 निःशुल्क उपलब्ध
स्कोर 5.0 4.5
रैंक #290 #315
विश्वसनीयता 10.0 10.0
संगति 7.0 8.8
प्रयास 66/66 66/66
सही परीक्षण
प्रति प्रयास पास दर 47.0% 15.2%
अस्थिर टेस्ट 8 3
कुल रन 66 66
प्रति परिणाम लागत 0.169 1.205
कुल लागत $0.011 $0.022
इनपुट कीमत $0.040 / 1M $0.090 / 1M
आउटपुट कीमत $0.150 / 1M $0.180 / 1M
कुल इनपुट टोकन 133,525 125,604
आउटपुट टोकन 7,259 57,634
रीजनिंग टोकन 24,716 0
प्रतिक्रिया समय (औसत) 1.31s 11.67s
प्रतिक्रिया समय (अधिकतम) 7.29s 200.52s
प्रतिक्रिया समय (कुल) 28.77s 256.71s
पैरामीटर ~100B 118B कुल (8B सक्रिय)
उपलब्धता बंद स्रोत वेट उपलब्ध

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#290 Mercury 2.5 Preview

low
लागत
$0.001
समय
1.5s
टोकन
1,169 tok

#315 Laguna S 2.1

none
लागत
$0.001
समय
7.6s
टोकन
1,345 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Mercury 2.5 Preview 5.5 10.0 33.3% 0 972ms 7,794 695 2,263
Laguna S 2.1 3.4 9.7 0.0% 0 550ms 7,917 424 0

त्वरित तुलना

तुलना जोड़ी बदलें