AI BENCHY
Advertise here
#58

Step 3.5 Flash

Stepfun প্রকাশ: 2026-02-01 পরীক্ষিত হয়েছে: 2026-05-22 00:30 stepfun/step-3.5-flash::medium
196B মোট (11B সক্রিয়)MoEউন্মুক্ত উৎস
(medium) (none)

সারাংশ

Step 3.5 Flash AI BENCHY-তে 7.4 স্কোর করে এবং #58 স্থানে আছে। এর reliability 9.3, pass rate 65.8%, মোট খরচ $0.015, এবং গড় response time 43.29s.

Step 3.5 Flash কে আলাদা করে যা: এটি ডেটা পার্সিং ও নিষ্কাশন-তে সবচেয়ে ভালোভাবে নজর কাড়ে, যেখানে এর rank #1; আর কোডিং এর দুর্বলতম ক্ষেত্র, rank #18. এই score range-এর জন্য মোট benchmark খরচ অস্বাভাবিকভাবে কম।

মডেলের তথ্য

গবেষণার তারিখ: 2026-08-12

প্রকাশিত
প্যারামিটার
196B মোট (11B সক্রিয়)
আর্কিটেকচার
MoE
উপলভ্যতা
উন্মুক্ত উৎস
লাইসেন্স
Apache-2.0

ধারাবাহিকতা

8.7

মোট আউটপুট টোকেন

263,806

মোট ইনপুট টোকেন

0

ইনপুট মূল্য

$0.090 / 1M

আউটপুট মূল্য

$0.300 / 1M

সঠিক টেস্ট

ভুল টেস্ট: 8

প্রতি চেষ্টায় পাস রেট: 65.8%

অস্থির টেস্ট

3

অস্থির টেস্টে রানভেদে মিশ্র ফল হয়েছে (কমপক্ষে একটি পাস এবং একটি ফেল)।

প্রতিক্রিয়া সময় (গড়)

43.29s

প্রতিক্রিয়া সময় (সর্বোচ্চ): 170.45s

প্রতিক্রিয়া সময় (মোট): 562.74s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#58 Step 3.5 Flash

medium
খরচ
$0.008
সময়
277.1s
টোকেন
23,695 tok

রান ইতিহাস

পরীক্ষিত হয়েছে স্কোর নির্ভরযোগ্যতা সঠিক টেস্ট মোট খরচ তুলনা করুন
2026-08-14 02:50 পুনরায় পরীক্ষা 5.9 10.0 $0.132 তুলনা করুন
2026-07-16 23:25 নতুন টেস্ট যোগ হয়েছে 6.0 9.2 $0.108 তুলনা করুন
2026-06-04 14:12 নতুন টেস্ট যোগ হয়েছে 7.2 8.9 $0.070 তুলনা করুন
2026-05-22 00:30 স্যুইট পরিবর্তিত হয়েছে 7.4 9.3 $0.015 বর্তমান রান
2026-05-08 15:30 স্যুইট পরিবর্তিত হয়েছে 7.6 10.0 $0.011 তুলনা করুন
2026-04-11 00:35 প্রথম নথিভুক্ত রান 7.9 প্রযোজ্য নয় $0.000 তুলনা করুন

এই রানটি ভিন্ন একটি বেঞ্চমার্ক স্যুইট ব্যবহার করেছে। ঐতিহাসিক পরিবর্তন পড়ার সময় স্যুইট পরিবর্তনও মাথায় রাখুন।

রান তুলনা

রানবেঞ্চমার্ক কভারেজস্কোরধারাবাহিকতানির্ভরযোগ্যতাসঠিক টেস্টঅস্থির টেস্টমোট আউটপুট টোকেনমোট ইনপুট টোকেনমোট খরচপ্রতিক্রিয়া সময় (গড়)
2026-05-22 00:30 · স্যুইট পরিবর্তিত হয়েছে57/57 প্রচেষ্টা7.48.79.311/193263,8060$0.01543.29s
2026-08-14 02:50 · পুনরায় পরীক্ষা63/63 প্রচেষ্টা5.98.610.010/212568,53665,716$0.132191.63s
পার্থক্য+1.4+0.1-0.7+1+1-304730-65716-$0.117-148342ms

বেঞ্চমার্ক কভারেজ আলাদা: 57/57 প্রচেষ্টা (লক্ষ্য: প্রতি টেস্টে 3টি পুনরাবৃত্তি) বনাম 63/63 প্রচেষ্টা (লক্ষ্য: প্রতি টেস্টে 3টি পুনরাবৃত্তি)। মোট মান ও পুনরাবৃত্তি-সংবেদনশীল মেট্রিক সরাসরি তুলনাযোগ্য নয়।

এই দুই রান ভিন্ন বেঞ্চমার্ক স্যুইট ব্যবহার করেছে, তাই পার্থক্যগুলোতে মডেল পরিবর্তন এবং স্যুইট পরিবর্তন দুটোই ধরা পড়ে।

চার্ট

প্রথম মডেলটি নির্বাচন করুন, তারপর দ্বিতীয় মডেলে ক্লিক করে পাশাপাশি তুলনা পৃষ্ঠা খুলুন।

মোট আউটপুট টোকেন

স্কোর vs মোট আউটপুট টোকেন

দ্রুত তুলনা

বিভাগভিত্তিক বিশ্লেষণ

বিভাগ স্কোর ধারাবাহিকতা সঠিক টেস্ট
অ্যান্টি-এআই কৌশল 10.0 10.0
কোডিং 3.0 6.0
সমন্বিত 10.0 10.0
ডেটা পার্সিং ও নিষ্কাশন 10.0 10.0
ডোমেইন-নির্দিষ্ট 5.3 7.2
Sadharon Buddhimotta 5.5 10.0
নির্দেশনা অনুসরণ 8.5 6.8
ধাঁধা সমাধান 5.3 10.0
টুল কলিং 10.0 10.0
সাধারণ জ্ঞান 3.0 10.0

তুলনা করা মডেল