নেভিগেশন
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

MoonshotAI: Kimi K2.5 vs Poolside: Laguna S 2.1

Kimi K2.5 average score-এ এগিয়ে: 5.5 vs 5.4. Laguna S 2.1 (high)-এর benchmark খরচ কম: $0.127 vs $0.127. Kimi K2.5 দ্রুত: 19.15s vs 111.61s, pass rates 34.9% vs 27.3%.

প্রস্তাবিত মডেলKimi K2.5It has the best score here (5.5), while responding about 5.8x faster than Laguna S 2.1 (high).

AI BENCHY টেস্ট স্যুট থেকে বেঞ্চমার্ক তৈরি হয়েছে: 2026-07-22

মেট্রিক Kimi K2.5 Kimi K2.5 none প্রকাশ: 2026-01-27 Laguna S 2.1 Laguna S 2.1 high প্রকাশ: 2026-07-21 বিনামূল্যে উপলভ্য
স্কোর 5.5 5.4
র‍্যাঙ্ক #161 #167
নির্ভরযোগ্যতা 10.0 9.9
ধারাবাহিকতা 8.6 8.1
সঠিক টেস্ট
প্রতি চেষ্টায় পাস রেট 34.9% 27.3%
অস্থির টেস্ট 4 5
মোট রান 66 66
প্রতি ফলাফলে খরচ 1.898 3.153
মোট খরচ $0.127 $0.127
ইনপুট মূল্য $0.571 / 1M $0.100 / 1M
আউটপুট মূল্য $2.850 / 1M $0.200 / 1M
মোট ইনপুট টোকেন 89,322 208,931
আউটপুট টোকেন 26,638 175,588
রিজনিং টোকেন 0 409,276
প্রতিক্রিয়া সময় (গড়) 19.15s 111.61s
প্রতিক্রিয়া সময় (সর্বোচ্চ) 102.83s 1190.11s
প্রতিক্রিয়া সময় (মোট) 287.30s 2455.39s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#161 MoonshotAI: Kimi K2.5

none
খরচ
$0.015
সময়
89.1s
টোকেন
5,421 tok

#167 Laguna S 2.1

high
খরচ
$0.001
সময়
6.8s
টোকেন
1,389 tok

স্কোর অনুযায়ী শীর্ষ মডেল

স্কোর বনাম মোট খরচ

প্রতিক্রিয়া সময় (গড়)

স্কোর vs প্রতিক্রিয়া সময় (গড়)

মোট আউটপুট টোকেন

স্কোর vs মোট আউটপুট টোকেন

বিভাগভিত্তিক বিশ্লেষণ

কোডিং স্কোর ধারাবাহিকতা প্রতি চেষ্টায় পাস রেট অস্থির টেস্ট সঠিক টেস্ট প্রতিক্রিয়া সময় (গড়) ইনপুট টোকেন আউটপুট টোকেন রিজনিং টোকেন
Kimi K2.5 5.5 10.0 33.3% 0 24.56s 7,311 4,708 0
Laguna S 2.1 5.3 7.2 44.4% 1 271.42s 6,496 59,355 151,009

দ্রুত তুলনা

তুলনার জুটি বদলান