AI BENCHY
Advertise here
#108

MiMo-V2.5-Pro

Xiaomi প্রকাশ: 2026-04-22 পরীক্ষিত হয়েছে: 2026-05-08 15:29 xiaomi/mimo-v2.5-pro::none
1.02T মোট (42B সক্রিয়)MoEউন্মুক্ত উৎস
(medium) (none)

সারাংশ

MiMo-V2.5-Pro AI BENCHY-তে 5.7 স্কোর করে এবং #108 স্থানে আছে। এর reliability 10.0, pass rate 43.9%, মোট খরচ $0.035, এবং গড় response time 1.88s.

MiMo-V2.5-Pro কে আলাদা করে যা: একই ধরনের মডেলের তুলনায় এটি লক্ষণীয়ভাবে দ্রুত।

মডেলের তথ্য

গবেষণার তারিখ: 2026-08-12

প্রকাশিত
প্যারামিটার
1.02T মোট (42B সক্রিয়)
আর্কিটেকচার
MoE
উপলভ্যতা
উন্মুক্ত উৎস
লাইসেন্স
MIT

ধারাবাহিকতা

8.4

মোট আউটপুট টোকেন

3,040

মোট ইনপুট টোকেন

0

ইনপুট মূল্য

$1.000 / 1M

আউটপুট মূল্য

$3.000 / 1M

সঠিক টেস্ট

ভুল টেস্ট: 13

প্রতি চেষ্টায় পাস রেট: 43.9%

অস্থির টেস্ট

4

অস্থির টেস্টে রানভেদে মিশ্র ফল হয়েছে (কমপক্ষে একটি পাস এবং একটি ফেল)।

প্রতিক্রিয়া সময় (গড়)

1.88s

প্রতিক্রিয়া সময় (সর্বোচ্চ): 8.32s

প্রতিক্রিয়া সময় (মোট): 35.63s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#108 MiMo-V2.5-Pro

none
খরচ
$0.004
সময়
46.4s
টোকেন
4,025 tok

রান ইতিহাস

পরীক্ষিত হয়েছে স্কোর নির্ভরযোগ্যতা সঠিক টেস্ট মোট খরচ তুলনা করুন
2026-08-14 02:26 পুনরায় পরীক্ষা 5.4 10.0 $0.068 তুলনা করুন
2026-07-16 22:42 নতুন টেস্ট যোগ হয়েছে 5.5 10.0 $0.068 তুলনা করুন
2026-06-04 13:48 নতুন টেস্ট যোগ হয়েছে 5.5 10.0 $0.017 তুলনা করুন
2026-05-08 15:29 স্যুইট পরিবর্তিত হয়েছে 5.7 10.0 $0.035 বর্তমান রান
2026-04-22 21:39 প্রথম নথিভুক্ত রান 5.8 প্রযোজ্য নয় $0.033 তুলনা করুন

এই রানটি ভিন্ন একটি বেঞ্চমার্ক স্যুইট ব্যবহার করেছে। ঐতিহাসিক পরিবর্তন পড়ার সময় স্যুইট পরিবর্তনও মাথায় রাখুন।

রান তুলনা

রানবেঞ্চমার্ক কভারেজস্কোরধারাবাহিকতানির্ভরযোগ্যতাসঠিক টেস্টঅস্থির টেস্টমোট আউটপুট টোকেনমোট ইনপুট টোকেনমোট খরচপ্রতিক্রিয়া সময় (গড়)
2026-05-08 15:29 · স্যুইট পরিবর্তিত হয়েছে57/57 প্রচেষ্টা5.78.410.06/1943,0400$0.0351.88s
2026-08-14 02:26 · পুনরায় পরীক্ষা66/66 প্রচেষ্টা5.48.610.05/22415,362124,808$0.0684.24s
পার্থক্য+0.3-0.20.0+10-12322-124808-$0.034-2365ms

বেঞ্চমার্ক কভারেজ আলাদা: 57/57 প্রচেষ্টা (লক্ষ্য: প্রতি টেস্টে 3টি পুনরাবৃত্তি) বনাম 66/66 প্রচেষ্টা (লক্ষ্য: প্রতি টেস্টে 3টি পুনরাবৃত্তি)। মোট মান ও পুনরাবৃত্তি-সংবেদনশীল মেট্রিক সরাসরি তুলনাযোগ্য নয়।

এই দুই রান ভিন্ন বেঞ্চমার্ক স্যুইট ব্যবহার করেছে, তাই পার্থক্যগুলোতে মডেল পরিবর্তন এবং স্যুইট পরিবর্তন দুটোই ধরা পড়ে।

চার্ট

প্রথম মডেলটি নির্বাচন করুন, তারপর দ্বিতীয় মডেলে ক্লিক করে পাশাপাশি তুলনা পৃষ্ঠা খুলুন।

মোট আউটপুট টোকেন

স্কোর vs মোট আউটপুট টোকেন

দ্রুত তুলনা

বিভাগভিত্তিক বিশ্লেষণ

বিভাগ স্কোর ধারাবাহিকতা সঠিক টেস্ট
অ্যান্টি-এআই কৌশল 3.3 8.1
কোডিং 6.4 3.3
সমন্বিত 3.0 10.0
ডেটা পার্সিং ও নিষ্কাশন 10.0 10.0
ডোমেইন-নির্দিষ্ট 5.3 10.0
Sadharon Buddhimotta 4.0 10.0
নির্দেশনা অনুসরণ 6.4 10.0
ধাঁধা সমাধান 6.7 4.7
টুল কলিং 10.0 10.0
সাধারণ জ্ঞান 3.0 10.0

তুলনা করা মডেল