नेविगेशन
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Inception: Mercury 2 vs Poolside: Laguna S 2.1

Laguna S 2.1 (high) average score में आगे है: 5.4 vs 4.6. Mercury 2 की benchmark लागत कम है: $0.030 vs $0.127. Mercury 2 तेज है: 829ms vs 111.61s, pass rates 22.7% vs 27.3%.

अनुशंसित मॉडलMercury 2Its score stays close to the best score here (4.6 vs 5.4), while costing about 4.3x less than Laguna S 2.1 (high).

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-07-25

तुलना सारांश

रैंक
#204
कुल आउटपुट टोकन
9,564
प्रतिक्रिया समय (औसत)
829ms
कुल लागत
$0.030
रैंक
#173
कुल आउटपुट टोकन
584,864
प्रतिक्रिया समय (औसत)
111.61s
कुल लागत
$0.127
मेट्रिक Mercury 2 Mercury 2 none रिलीज़: 2026-02-24 Laguna S 2.1 Laguna S 2.1 high रिलीज़: 2026-07-21 निःशुल्क उपलब्ध
स्कोर 4.6 5.4
रैंक #204 #173
विश्वसनीयता 10.0 9.9
संगति 9.2 8.1
सही परीक्षण
प्रति प्रयास पास दर 22.7% 27.3%
अस्थिर टेस्ट 2 5
कुल रन 66 66
प्रति परिणाम लागत 0.734 3.153
कुल लागत $0.030 $0.127
इनपुट कीमत $0.250 / 1M $0.100 / 1M
आउटपुट कीमत $0.750 / 1M $0.200 / 1M
कुल इनपुट टोकन 88,704 208,931
आउटपुट टोकन 9,564 175,588
रीजनिंग टोकन 0 409,276
प्रतिक्रिया समय (औसत) 829ms 111.61s
प्रतिक्रिया समय (अधिकतम) 4.52s 1190.11s
प्रतिक्रिया समय (कुल) 18.24s 2455.39s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#204 Mercury 2

none
लागत
$0.002
समय
1.8s
टोकन
1,514 tok

#173 Laguna S 2.1

high
लागत
$0.001
समय
6.8s
टोकन
1,389 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Mercury 2 3.4 9.6 0.0% 0 1.03s 7,229 3,088 0
Laguna S 2.1 5.3 7.2 44.4% 1 271.42s 6,496 59,355 151,009

त्वरित तुलना

तुलना जोड़ी बदलें