AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com
#32

Step 3.7 Flash

Stepfun প্রকাশ: 2026-05-29 পরীক্ষিত হয়েছে: 2026-05-29 11:49 stepfun/step-3.7-flash::medium
198B মোট (11B সক্রিয়)MoEউন্মুক্ত উৎস
(high) (medium) (low)

সারাংশ

Step 3.7 Flash AI BENCHY-তে 7.9 স্কোর করে এবং #32 স্থানে আছে। এর reliability 9.9, pass rate 71.7%, মোট খরচ $0.404, এবং গড় response time 20.29s.

Step 3.7 Flash কে আলাদা করে যা: এটি ডোমেইন-নির্দিষ্ট-তে সবচেয়ে ভালোভাবে নজর কাড়ে, যেখানে এর rank #1; আর Sadharon Buddhimotta এর দুর্বলতম ক্ষেত্র, rank #18. এই score range-এর জন্য মোট benchmark খরচ অস্বাভাবিকভাবে কম।

মডেলের তথ্য

গবেষণার তারিখ: 2026-08-12

প্রকাশিত
প্যারামিটার
198B মোট (11B সক্রিয়)
আর্কিটেকচার
MoE
উপলভ্যতা
উন্মুক্ত উৎস
লাইসেন্স
Apache-2.0

ধারাবাহিকতা

9.2

মোট আউটপুট টোকেন

344,492

মোট ইনপুট টোকেন

0

ইনপুট মূল্য

$0.200 / 1M

আউটপুট মূল্য

$1.150 / 1M

সঠিক টেস্ট

ভুল টেস্ট: 7

প্রতি চেষ্টায় পাস রেট: 71.7%

অস্থির টেস্ট

2

অস্থির টেস্টে রানভেদে মিশ্র ফল হয়েছে (কমপক্ষে একটি পাস এবং একটি ফেল)।

প্রতিক্রিয়া সময় (গড়)

20.29s

প্রতিক্রিয়া সময় (সর্বোচ্চ): 136.44s

প্রতিক্রিয়া সময় (মোট): 405.79s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#32 Step 3.7 Flash

medium
খরচ
$0.006
সময়
46.2s
টোকেন
4,466 tok

রান ইতিহাস

পরীক্ষিত হয়েছে স্কোর নির্ভরযোগ্যতা সঠিক টেস্ট মোট খরচ তুলনা করুন
2026-08-14 02:31 পুনরায় পরীক্ষা 7.9 10.0 $0.495 তুলনা করুন
2026-07-16 22:50 নতুন টেস্ট যোগ হয়েছে 8.0 9.9 $0.515 তুলনা করুন
2026-06-04 13:52 নতুন টেস্ট যোগ হয়েছে 8.0 9.9 $0.376 তুলনা করুন
2026-05-29 11:49 প্রথম রান 7.9 9.9 $0.404 বর্তমান রান

রান তুলনা

রানবেঞ্চমার্ক কভারেজস্কোরধারাবাহিকতানির্ভরযোগ্যতাসঠিক টেস্টঅস্থির টেস্টমোট আউটপুট টোকেনমোট ইনপুট টোকেনমোট খরচপ্রতিক্রিয়া সময় (গড়)
2026-05-29 11:49 · প্রথম রান60/60 প্রচেষ্টা7.99.29.913/202344,4920$0.40420.29s
2026-07-16 22:50 · নতুন টেস্ট যোগ হয়েছে64/66 প্রচেষ্টা8.08.99.914/223427,572114,062$0.51526.37s
পার্থক্য-0.1+0.30.0-1-1-83080-114062-$0.111-6085ms

বেঞ্চমার্ক কভারেজ আলাদা: 60/60 প্রচেষ্টা (লক্ষ্য: প্রতি টেস্টে 3টি পুনরাবৃত্তি) বনাম 64/66 প্রচেষ্টা (লক্ষ্য: প্রতি টেস্টে 3টি পুনরাবৃত্তি)। মোট মান ও পুনরাবৃত্তি-সংবেদনশীল মেট্রিক সরাসরি তুলনাযোগ্য নয়।

এই দুই রান ভিন্ন বেঞ্চমার্ক স্যুইট ব্যবহার করেছে, তাই পার্থক্যগুলোতে মডেল পরিবর্তন এবং স্যুইট পরিবর্তন দুটোই ধরা পড়ে।

চার্ট

প্রথম মডেলটি নির্বাচন করুন, তারপর দ্বিতীয় মডেলে ক্লিক করে পাশাপাশি তুলনা পৃষ্ঠা খুলুন।

মোট আউটপুট টোকেন

স্কোর vs মোট আউটপুট টোকেন

দ্রুত তুলনা

বিভাগভিত্তিক বিশ্লেষণ

বিভাগ স্কোর ধারাবাহিকতা সঠিক টেস্ট
অ্যান্টি-এআই কৌশল 8.7 7.9
কোডিং 8.2 6.7
সমন্বিত 10.0 10.0
ডেটা পার্সিং ও নিষ্কাশন 10.0 10.0
ডোমেইন-নির্দিষ্ট 7.7 10.0
Sadharon Buddhimotta 4.0 10.0
নির্দেশনা অনুসরণ 9.8 10.0
ধাঁধা সমাধান 5.7 9.9
টুল কলিং 10.0 10.0
সাধারণ জ্ঞান 3.0 10.0

তুলনা করা মডেল