नेविगेशन
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Anthropic: Claude Sonnet 4.6 vs MoonshotAI: Kimi K2.6

Claude Sonnet 4.6 average score में आगे है: 7.3 vs 7.2. Claude Sonnet 4.6 की benchmark लागत कम है: $0.661 vs $1.036. Claude Sonnet 4.6 तेज है: 8.12s vs 109.98s, pass rates 57.6% vs 63.6%.

अनुशंसित मॉडलClaude Sonnet 4.6It has the best score here (7.3), while costing about 1.6x less than Kimi K2.6 (medium).

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-07-20

मेट्रिक Claude Sonnet 4.6 Claude Sonnet 4.6 none रिलीज़: 2026-02-17 Kimi K2.6 Kimi K2.6 medium रिलीज़: 2026-04-20
स्कोर 7.3 7.2
रैंक #63 #68
विश्वसनीयता 10.0 9.4
संगति 9.7 8.3
सही परीक्षण
प्रति प्रयास पास दर 57.6% 63.6%
अस्थिर टेस्ट 1 4
कुल रन 66 66
प्रति परिणाम लागत 5.502 9.821
कुल लागत $0.661 $1.036
इनपुट कीमत $3.000 / 1M $0.684 / 1M
आउटपुट कीमत $15.000 / 1M $3.420 / 1M
कुल इनपुट टोकन 123,264 68,902
आउटपुट टोकन 19,362 111,680
रीजनिंग टोकन 0 279,860
प्रतिक्रिया समय (औसत) 8.12s 109.98s
प्रतिक्रिया समय (अधिकतम) 51.18s 876.20s
प्रतिक्रिया समय (कुल) 121.78s 2309.56s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#63 Claude Sonnet 4.6

none
लागत
$0.038
समय
27.3s
टोकन
2,598 tok

#68 MoonshotAI: Kimi K2.6

medium
लागत
$0.013
समय
103.4s
टोकन
3,620 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Claude Sonnet 4.6 5.5 10.0 33.3% 0 5.19s 8,522 2,127 0
Kimi K2.6 5.7 8.6 33.3% 0 214.42s 2,925 9,970 77,189

त्वरित तुलना

तुलना जोड़ी बदलें