नेविगेशन
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Anthropic: Claude Sonnet 4.6 vs MoonshotAI: Kimi K2.5

Claude Sonnet 4.6 average score में आगे है: 7.3 vs 7.0. Kimi K2.5 (medium) की benchmark लागत कम है: $0.600 vs $0.661. Claude Sonnet 4.6 तेज है: 8.12s vs 99.00s, pass rates 57.6% vs 65.2%.

अनुशंसित मॉडलClaude Sonnet 4.6It has the best score here (7.3), while responding about 12.2x faster than Kimi K2.5 (medium).

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-07-25

मेट्रिक Claude Sonnet 4.6 Claude Sonnet 4.6 none रिलीज़: 2026-02-17 Kimi K2.5 Kimi K2.5 medium रिलीज़: 2026-01-27
स्कोर 7.3 7.0
रैंक #71 #85
विश्वसनीयता 10.0 10.0
संगति 9.7 7.0
सही परीक्षण
प्रति प्रयास पास दर 57.6% 65.2%
अस्थिर टेस्ट 1 8
कुल रन 66 66
प्रति परिणाम लागत 5.502 4.789
कुल लागत $0.661 $0.600
इनपुट कीमत $3.000 / 1M $0.571 / 1M
आउटपुट कीमत $15.000 / 1M $2.850 / 1M
कुल इनपुट टोकन 123,264 118,448
आउटपुट टोकन 19,362 62,124
रीजनिंग टोकन 0 165,243
प्रतिक्रिया समय (औसत) 8.12s 99.00s
प्रतिक्रिया समय (अधिकतम) 51.18s 281.00s
प्रतिक्रिया समय (कुल) 121.78s 1485.04s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#71 Claude Sonnet 4.6

none
लागत
$0.038
समय
27.3s
टोकन
2,598 tok

#85 MoonshotAI: Kimi K2.5

medium
लागत
$0.030
समय
58.6s
टोकन
8,683 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Claude Sonnet 4.6 5.5 10.0 33.3% 0 5.19s 8,522 2,127 0
Kimi K2.5 6.1 4.6 66.7% 2 217.49s 6,935 5,705 74,693

त्वरित तुलना

तुलना जोड़ी बदलें