नेविगेशन
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

MoonshotAI: Kimi K2.5 vs Poolside: Laguna S 2.1

Kimi K2.5 average score में आगे है: 5.5 vs 5.4. Laguna S 2.1 (high) की benchmark लागत कम है: $0.127 vs $0.127. Kimi K2.5 तेज है: 19.15s vs 111.61s, pass rates 34.9% vs 27.3%.

अनुशंसित मॉडलKimi K2.5It has the best score here (5.5), while responding about 5.8x faster than Laguna S 2.1 (high).

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-07-22

मेट्रिक Kimi K2.5 Kimi K2.5 none रिलीज़: 2026-01-27 Laguna S 2.1 Laguna S 2.1 high रिलीज़: 2026-07-21 निःशुल्क उपलब्ध
स्कोर 5.5 5.4
रैंक #161 #167
विश्वसनीयता 10.0 9.9
संगति 8.6 8.1
सही परीक्षण
प्रति प्रयास पास दर 34.9% 27.3%
अस्थिर टेस्ट 4 5
कुल रन 66 66
प्रति परिणाम लागत 1.898 3.153
कुल लागत $0.127 $0.127
इनपुट कीमत $0.571 / 1M $0.100 / 1M
आउटपुट कीमत $2.850 / 1M $0.200 / 1M
कुल इनपुट टोकन 89,322 208,931
आउटपुट टोकन 26,638 175,588
रीजनिंग टोकन 0 409,276
प्रतिक्रिया समय (औसत) 19.15s 111.61s
प्रतिक्रिया समय (अधिकतम) 102.83s 1190.11s
प्रतिक्रिया समय (कुल) 287.30s 2455.39s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#161 MoonshotAI: Kimi K2.5

none
लागत
$0.015
समय
89.1s
टोकन
5,421 tok

#167 Laguna S 2.1

high
लागत
$0.001
समय
6.8s
टोकन
1,389 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Kimi K2.5 5.5 10.0 33.3% 0 24.56s 7,311 4,708 0
Laguna S 2.1 5.3 7.2 44.4% 1 271.42s 6,496 59,355 151,009

त्वरित तुलना

तुलना जोड़ी बदलें