नेविगेशन
Advertise here

Mercury 2.5 vs Ling 3.0 Tiny (low)

Mercury 2.5 average score में आगे है: 3.9 vs 3.8. Ling 3.0 Tiny (low) की benchmark लागत कम है: $0.000 vs $0.016. Mercury 2.5 तेज है: 2.45s vs 66.16s, pass rates 25.8% vs 19.7%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-09-08

तुलना किए गए मॉडल

रैंक
#312
कुल आउटपुट टोकन
71,143
प्रतिक्रिया समय (औसत)
2.45s
कुल लागत
$0.016
रैंक
#314
कुल आउटपुट टोकन
879,532
प्रतिक्रिया समय (औसत)
66.16s
कुल लागत
$0.000
अनुशंसित मॉडल Mercury 2.5

It has the best score here (3.9), while responding about 27.0x faster than Ling 3.0 Tiny (low).

विस्तृत तुलना

मेट्रिक Mercury 2.5 Mercury 2.5 none रिलीज़: 2026-09-08 Ling 3.0 Tiny Ling 3.0 Tiny low रिलीज़: 2026-08-07
स्कोर 3.9 3.8
रैंक #312 #314
विश्वसनीयता 10.0 9.6
संगति 7.5 9.7
प्रयास 66/66 66/66
सही परीक्षण
प्रति प्रयास पास दर 25.8% 19.7%
अस्थिर टेस्ट 7 1
कुल रन 66 66
प्रति परिणाम लागत 0.782 0.000
कुल लागत $0.016 $0.000
इनपुट कीमत $0.040 / 1M $0.000 / 1M
आउटपुट कीमत $0.150 / 1M $0.000 / 1M
कुल इनपुट टोकन 123,740 99,662
आउटपुट टोकन 71,143 146,555
रीजनिंग टोकन 0 732,977
प्रतिक्रिया समय (औसत) 2.45s 66.16s
प्रतिक्रिया समय (अधिकतम) 36.48s 252.08s
प्रतिक्रिया समय (कुल) 53.83s 1389.33s
पैरामीटर ~100B 7.9B कुल (1.3B सक्रिय)
उपलब्धता बंद स्रोत मुक्त स्रोत

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#312 Mercury 2.5

none
लागत
$0.001
समय
2.7s
टोकन
2,749 tok

#314 Ling 3.0 Tiny

low
No output was saved. The original provider response or failure reason is unavailable.
लागत
$0.000
समय
200.0s
टोकन
5,030 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Mercury 2.5 3.7 7.0 22.2% 1 12.50s 7,888 61,297 0
Ling 3.0 Tiny 2.9 10.0 0.0% 0 170.73s 7,619 56,012 170,220

त्वरित तुलना

तुलना जोड़ी बदलें