নেভিগেশন
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Meituan: LongCat 2.0 vs Xiaomi: MiMo-V2.5

LongCat 2.0 (high) average score-এ এগিয়ে: 6.6 vs 6.5. MiMo-V2.5 (medium)-এর benchmark খরচ কম: $0.082 vs $0.469. MiMo-V2.5 (medium) দ্রুত: 32.20s vs 148.73s, pass rates 53.0% vs 69.7%.

প্রস্তাবিত মডেলMiMo-V2.5 (medium)Its score stays close to the best score here (6.5 vs 6.6), while costing about 5.8x less than LongCat 2.0 (high).

AI BENCHY টেস্ট স্যুট থেকে বেঞ্চমার্ক তৈরি হয়েছে: 2026-07-20

মেট্রিক LongCat 2.0 LongCat 2.0 high প্রকাশ: 2026-07-20 MiMo-V2.5 MiMo-V2.5 medium প্রকাশ: 2026-04-22
স্কোর 6.6 6.5
র‍্যাঙ্ক #97 #101
নির্ভরযোগ্যতা 9.4 10.0
ধারাবাহিকতা 8.2 7.9
সঠিক টেস্ট
প্রতি চেষ্টায় পাস রেট 53.0% 69.7%
অস্থির টেস্ট 5 6
মোট রান 66 66
প্রতি ফলাফলে খরচ 5.202 3.124
মোট খরচ $0.469 $0.082
ইনপুট মূল্য $0.300 / 1M $0.140 / 1M
আউটপুট মূল্য $1.200 / 1M $0.280 / 1M
মোট ইনপুট টোকেন 93,357 105,447
আউটপুট টোকেন 30,466 7,120
রিজনিং টোকেন 336,325 230,682
প্রতিক্রিয়া সময় (গড়) 148.73s 32.20s
প্রতিক্রিয়া সময় (সর্বোচ্চ) 941.66s 162.44s
প্রতিক্রিয়া সময় (মোট) 3272.00s 708.46s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#97 LongCat 2.0

high
অবৈধ SVG
খরচ
$0.000
সময়
600.0s
টোকেন
0 tok

#101 MiMo-V2.5

medium
খরচ
$0.002
সময়
54.8s
টোকেন
5,247 tok

স্কোর অনুযায়ী শীর্ষ মডেল

স্কোর বনাম মোট খরচ

প্রতিক্রিয়া সময় (গড়)

স্কোর vs প্রতিক্রিয়া সময় (গড়)

মোট আউটপুট টোকেন

স্কোর vs মোট আউটপুট টোকেন

বিভাগভিত্তিক বিশ্লেষণ

কোডিং স্কোর ধারাবাহিকতা প্রতি চেষ্টায় পাস রেট অস্থির টেস্ট সঠিক টেস্ট প্রতিক্রিয়া সময় (গড়) ইনপুট টোকেন আউটপুট টোকেন রিজনিং টোকেন
LongCat 2.0 7.6 7.2 77.8% 1 505.33s 6,913 244 192,377
MiMo-V2.5 6.2 4.7 66.7% 2 97.14s 7,422 557 81,977

দ্রুত তুলনা

তুলনার জুটি বদলান