নেভিগেশন
AI BENCHY
Advertise here

Kimi K2.5 (medium) vs Grok 4.20 (medium)

average score প্রায় সমান: 7.0 vs 7.0. Kimi K2.5 (medium)-এর benchmark খরচ কম: $0.607 vs $0.805. Grok 4.20 (medium) দ্রুত: 32.56s vs 98.19s, pass rates 63.6% vs 60.6%.

AI BENCHY টেস্ট স্যুট থেকে বেঞ্চমার্ক তৈরি হয়েছে: 2026-08-15

র‍্যাঙ্ক
#122
মোট আউটপুট টোকেন
220,942
প্রতিক্রিয়া সময় (গড়)
98.19s
মোট খরচ
$0.607
র‍্যাঙ্ক
#120
মোট আউটপুট টোকেন
270,259
প্রতিক্রিয়া সময় (গড়)
32.56s
মোট খরচ
$0.805
প্রস্তাবিত মডেল Grok 4.20 (medium)

It has the best score here (7.0), while responding about 3.0x faster than Kimi K2.5 (medium).

বিস্তারিত তুলনা

মেট্রিক Kimi K2.5 Kimi K2.5 medium প্রকাশ: 2026-01-27 Grok 4.20 Grok 4.20 medium প্রকাশ: 2026-03-31
স্কোর 7.0 7.0
র‍্যাঙ্ক #122 #120
নির্ভরযোগ্যতা 10.0 10.0
ধারাবাহিকতা 7.0 8.2
প্রচেষ্টা 66/66 66/66
সঠিক টেস্ট
প্রতি চেষ্টায় পাস রেট 63.6% 60.6%
অস্থির টেস্ট 8 5
মোট রান 66 66
প্রতি ফলাফলে খরচ 4.849 10.365
মোট খরচ $0.607 $0.805
ইনপুট মূল্য $0.571 / 1M $1.250 / 1M
আউটপুট মূল্য $2.850 / 1M $2.500 / 1M
মোট ইনপুট টোকেন 118,496 102,986
আউটপুট টোকেন 53,522 5,860
রিজনিং টোকেন 167,420 264,399
প্রতিক্রিয়া সময় (গড়) 98.19s 32.56s
প্রতিক্রিয়া সময় (সর্বোচ্চ) 281.00s 199.66s
প্রতিক্রিয়া সময় (মোট) 1571.05s 716.36s
প্যারামিটার 1T মোট (32B সক্রিয়) ~1T মোট (~100B সক্রিয়)
উপলভ্যতা ওজন উপলভ্য বন্ধ উৎস

মডেল জেনারেশন শোকেস

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#122 MoonshotAI: Kimi K2.5

medium
খরচ
$0.030
সময়
58.6s
টোকেন
8,683 tok

#120 SpaceXAI: Grok 4.20

medium
খরচ
$0.041
সময়
110.3s
টোকেন
16,336 tok

স্কোর অনুযায়ী শীর্ষ মডেল

স্কোর বনাম মোট খরচ

প্রতিক্রিয়া সময় (গড়)

স্কোর vs প্রতিক্রিয়া সময় (গড়)

মোট আউটপুট টোকেন

স্কোর vs মোট আউটপুট টোকেন

বিভাগভিত্তিক বিশ্লেষণ

কোডিং স্কোর ধারাবাহিকতা প্রতি চেষ্টায় পাস রেট অস্থির টেস্ট সঠিক টেস্ট প্রতিক্রিয়া সময় (গড়) ইনপুট টোকেন আউটপুট টোকেন রিজনিং টোকেন
Kimi K2.5 6.1 4.6 66.7% 2 217.49s 6,935 5,705 74,693
Grok 4.20 6.3 6.6 55.6% 1 109.93s 8,307 268 103,150

দ্রুত তুলনা

তুলনার জুটি বদলান