নেভিগেশন
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Anthropic: Claude Sonnet 4.6 vs MoonshotAI: Kimi K2.5

Claude Sonnet 4.6 average score-এ এগিয়ে: 7.3 vs 7.0. Kimi K2.5 (medium)-এর benchmark খরচ কম: $0.600 vs $0.661. Claude Sonnet 4.6 দ্রুত: 8.12s vs 99.00s, pass rates 57.6% vs 65.2%.

প্রস্তাবিত মডেলClaude Sonnet 4.6It has the best score here (7.3), while responding about 12.2x faster than Kimi K2.5 (medium).

AI BENCHY টেস্ট স্যুট থেকে বেঞ্চমার্ক তৈরি হয়েছে: 2026-07-25

মেট্রিক Claude Sonnet 4.6 Claude Sonnet 4.6 none প্রকাশ: 2026-02-17 Kimi K2.5 Kimi K2.5 medium প্রকাশ: 2026-01-27
স্কোর 7.3 7.0
র‍্যাঙ্ক #71 #85
নির্ভরযোগ্যতা 10.0 10.0
ধারাবাহিকতা 9.7 7.0
সঠিক টেস্ট
প্রতি চেষ্টায় পাস রেট 57.6% 65.2%
অস্থির টেস্ট 1 8
মোট রান 66 66
প্রতি ফলাফলে খরচ 5.502 4.789
মোট খরচ $0.661 $0.600
ইনপুট মূল্য $3.000 / 1M $0.571 / 1M
আউটপুট মূল্য $15.000 / 1M $2.850 / 1M
মোট ইনপুট টোকেন 123,264 118,448
আউটপুট টোকেন 19,362 62,124
রিজনিং টোকেন 0 165,243
প্রতিক্রিয়া সময় (গড়) 8.12s 99.00s
প্রতিক্রিয়া সময় (সর্বোচ্চ) 51.18s 281.00s
প্রতিক্রিয়া সময় (মোট) 121.78s 1485.04s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#71 Claude Sonnet 4.6

none
খরচ
$0.038
সময়
27.3s
টোকেন
2,598 tok

#85 MoonshotAI: Kimi K2.5

medium
খরচ
$0.030
সময়
58.6s
টোকেন
8,683 tok

স্কোর অনুযায়ী শীর্ষ মডেল

স্কোর বনাম মোট খরচ

প্রতিক্রিয়া সময় (গড়)

স্কোর vs প্রতিক্রিয়া সময় (গড়)

মোট আউটপুট টোকেন

স্কোর vs মোট আউটপুট টোকেন

বিভাগভিত্তিক বিশ্লেষণ

কোডিং স্কোর ধারাবাহিকতা প্রতি চেষ্টায় পাস রেট অস্থির টেস্ট সঠিক টেস্ট প্রতিক্রিয়া সময় (গড়) ইনপুট টোকেন আউটপুট টোকেন রিজনিং টোকেন
Claude Sonnet 4.6 5.5 10.0 33.3% 0 5.19s 8,522 2,127 0
Kimi K2.5 6.1 4.6 66.7% 2 217.49s 6,935 5,705 74,693

দ্রুত তুলনা

তুলনার জুটি বদলান