AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com
#60

Mimo V2 Omni

Xiaomi প্রকাশ: 2026-03-18 পরীক্ষিত হয়েছে: 2026-04-11 01:44 xiaomi/mimo-v2-omni::none
(medium) (none)

সারাংশ

Mimo V2 Omni AI BENCHY-তে 6.5 স্কোর করে এবং #60 স্থানে আছে। এর reliability প্রযোজ্য নয়, pass rate 44.4%, মোট খরচ $0.007, এবং গড় response time 1.99s.

Mimo V2 Omni কে আলাদা করে যা: এটি ডোমেইন-নির্দিষ্ট-তে সবচেয়ে ভালোভাবে নজর কাড়ে, যেখানে এর rank #3; আর অ্যান্টি-এআই কৌশল এর দুর্বলতম ক্ষেত্র, rank #17. এই score range-এর জন্য মোট benchmark খরচ অস্বাভাবিকভাবে কম। একই ধরনের মডেলের তুলনায় এটি লক্ষণীয়ভাবে দ্রুত।

আর্কাইভড মডেল: এই মডেল আর আপডেট করা হবে না এবং নতুন টেস্টে পরীক্ষা করা হবে না।

ধারাবাহিকতা

10.0

নির্ভরযোগ্যতা

প্রযোজ্য নয়

মোট আউটপুট টোকেন

868

মোট ইনপুট টোকেন

0

ইনপুট মূল্য

$0.400 / 1M

আউটপুট মূল্য

$2.000 / 1M

সঠিক টেস্ট

ভুল টেস্ট: 10

প্রতি চেষ্টায় পাস রেট: 44.4%

অস্থির টেস্ট

0

অস্থির টেস্টে রানভেদে মিশ্র ফল হয়েছে (কমপক্ষে একটি পাস এবং একটি ফেল)।

প্রতিক্রিয়া সময় (গড়)

1.99s

প্রতিক্রিয়া সময় (সর্বোচ্চ): 6.81s

প্রতিক্রিয়া সময় (মোট): 35.81s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#60 MiMo-V2-Omni

none
This model has been deprecated. It is recommended to migrate to xiaomi/mimo-v2.5
খরচ
$0.000
সময়
0.1s
টোকেন
0 tok

রান ইতিহাস

পরীক্ষিত হয়েছে স্কোর নির্ভরযোগ্যতা সঠিক টেস্ট মোট খরচ তুলনা করুন
2026-06-04 13:47 নতুন টেস্ট যোগ হয়েছে 5.5 10.0 $0.021 তুলনা করুন
2026-05-22 00:20 স্যুইট পরিবর্তিত হয়েছে 6.2 10.0 $0.023 তুলনা করুন
2026-05-08 15:32 স্যুইট পরিবর্তিত হয়েছে 6.3 10.0 $0.020 তুলনা করুন
2026-04-11 01:44 প্রথম নথিভুক্ত রান 6.5 প্রযোজ্য নয় $0.007 বর্তমান রান

রান তুলনা

রানবেঞ্চমার্ক কভারেজস্কোরধারাবাহিকতানির্ভরযোগ্যতাসঠিক টেস্টঅস্থির টেস্টমোট আউটপুট টোকেনমোট ইনপুট টোকেনমোট খরচপ্রতিক্রিয়া সময় (গড়)
2026-04-11 01:44 · প্রথম নথিভুক্ত রান18/18 টেস্ট · 20/54 প্রচেষ্টা6.510.0প্রযোজ্য নয়8/1808680$0.0071.99s
2026-05-22 00:20 · স্যুইট পরিবর্তিত হয়েছে20/20 টেস্ট · 52/60 প্রচেষ্টা6.29.710.08/2013,3140$0.0232.44s
পার্থক্য+0.3+0.30-1-24460-$0.017-451ms

বেঞ্চমার্ক কভারেজ আলাদা: 18/18 টেস্ট · 20/54 প্রচেষ্টা (লক্ষ্য: প্রতি টেস্টে 3টি পুনরাবৃত্তি) বনাম 20/20 টেস্ট · 52/60 প্রচেষ্টা (লক্ষ্য: প্রতি টেস্টে 3টি পুনরাবৃত্তি)। মোট মান ও পুনরাবৃত্তি-সংবেদনশীল মেট্রিক সরাসরি তুলনাযোগ্য নয়।

এই দুই রান ভিন্ন বেঞ্চমার্ক স্যুইট ব্যবহার করেছে, তাই পার্থক্যগুলোতে মডেল পরিবর্তন এবং স্যুইট পরিবর্তন দুটোই ধরা পড়ে।

চার্ট

প্রথম মডেলটি নির্বাচন করুন, তারপর দ্বিতীয় মডেলে ক্লিক করে পাশাপাশি তুলনা পৃষ্ঠা খুলুন।

মোট আউটপুট টোকেন

স্কোর vs মোট আউটপুট টোকেন

বিভাগভিত্তিক বিশ্লেষণ

বিভাগ স্কোর ধারাবাহিকতা সঠিক টেস্ট
অ্যান্টি-এআই কৌশল 4.8 10.0
কোডিং 6.6 10.0
সমন্বিত 3.0 10.0
ডেটা পার্সিং ও নিষ্কাশন 10.0 10.0
ডোমেইন-নির্দিষ্ট 5.3 10.0
Sadharon Buddhimotta 4.5 10.0
নির্দেশনা অনুসরণ 6.5 10.0
ধাঁধা সমাধান 8.0 10.0
টুল কলিং 10.0 10.0

তুলনা করা মডেল