AI BENCHY
Advertise here
#62

Step 3.5 Flash

Stepfun প্রকাশ: 2026-02-01 পরীক্ষিত হয়েছে: 2026-06-04 14:12 stepfun/step-3.5-flash::medium
196B মোট (11B সক্রিয়)MoEউন্মুক্ত উৎস
(medium) (none)

সারাংশ

Step 3.5 Flash AI BENCHY-তে 7.2 স্কোর করে এবং #62 স্থানে আছে। এর reliability 8.9, pass rate 58.3%, মোট খরচ $0.070, এবং গড় response time 72.53s.

Step 3.5 Flash কে আলাদা করে যা: এটি সমন্বিত-তে সবচেয়ে ভালোভাবে নজর কাড়ে, যেখানে এর rank #1; আর কোডিং এর দুর্বলতম ক্ষেত্র, rank #18. এই score range-এর জন্য মোট benchmark খরচ অস্বাভাবিকভাবে কম।

মডেলের তথ্য

গবেষণার তারিখ: 2026-08-12

প্রকাশিত
প্যারামিটার
196B মোট (11B সক্রিয়)
আর্কিটেকচার
MoE
উপলভ্যতা
উন্মুক্ত উৎস
লাইসেন্স
Apache-2.0

ধারাবাহিকতা

9.1

মোট খরচ (বর্তমান মূল্য)

$0.070 ↑ +218.4%

পরীক্ষার সময়: $0.022

মোট আউটপুট টোকেন

287,560

মোট ইনপুট টোকেন

34,431

ইনপুট মূল্য

$0.090 / 1M

আউটপুট মূল্য

$0.300 / 1M

সঠিক টেস্ট

ভুল টেস্ট: 9

প্রতি চেষ্টায় পাস রেট: 58.3%

অস্থির টেস্ট

2

অস্থির টেস্টে রানভেদে মিশ্র ফল হয়েছে (কমপক্ষে একটি পাস এবং একটি ফেল)।

প্রতিক্রিয়া সময় (গড়)

72.53s

প্রতিক্রিয়া সময় (সর্বোচ্চ): 453.94s

প্রতিক্রিয়া সময় (মোট): 1015.47s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#62 Step 3.5 Flash

medium
খরচ
$0.008
সময়
277.1s
টোকেন
23,695 tok

রান ইতিহাস

পরীক্ষিত হয়েছে স্কোর নির্ভরযোগ্যতা সঠিক টেস্ট মোট খরচ তুলনা করুন
2026-08-14 02:50 পুনরায় পরীক্ষা 5.9 10.0 $0.132 তুলনা করুন
2026-07-16 23:25 নতুন টেস্ট যোগ হয়েছে 6.0 9.2 $0.108 তুলনা করুন
2026-06-04 14:12 নতুন টেস্ট যোগ হয়েছে 7.2 8.9 $0.070 বর্তমান রান
2026-05-22 00:30 স্যুইট পরিবর্তিত হয়েছে 7.4 9.3 $0.015 তুলনা করুন
2026-05-08 15:30 স্যুইট পরিবর্তিত হয়েছে 7.6 10.0 $0.011 তুলনা করুন
2026-04-11 00:35 প্রথম নথিভুক্ত রান 7.9 প্রযোজ্য নয় $0.000 তুলনা করুন

এই রানটি ভিন্ন একটি বেঞ্চমার্ক স্যুইট ব্যবহার করেছে। ঐতিহাসিক পরিবর্তন পড়ার সময় স্যুইট পরিবর্তনও মাথায় রাখুন।

রান তুলনা

রানবেঞ্চমার্ক কভারেজস্কোরধারাবাহিকতানির্ভরযোগ্যতাসঠিক টেস্টঅস্থির টেস্টমোট আউটপুট টোকেনমোট ইনপুট টোকেনমোট খরচপ্রতিক্রিয়া সময় (গড়)
2026-06-04 14:12 · নতুন টেস্ট যোগ হয়েছে60/60 প্রচেষ্টা7.29.18.911/202287,56034,431$0.07072.53s
2026-08-14 02:50 · পুনরায় পরীক্ষা63/63 প্রচেষ্টা5.98.610.010/212568,53665,716$0.132191.63s
পার্থক্য+1.2+0.5-1.1+10-280976-31285-$0.063-119095ms

বেঞ্চমার্ক কভারেজ আলাদা: 60/60 প্রচেষ্টা (লক্ষ্য: প্রতি টেস্টে 3টি পুনরাবৃত্তি) বনাম 63/63 প্রচেষ্টা (লক্ষ্য: প্রতি টেস্টে 3টি পুনরাবৃত্তি)। মোট মান ও পুনরাবৃত্তি-সংবেদনশীল মেট্রিক সরাসরি তুলনাযোগ্য নয়।

এই দুই রান ভিন্ন বেঞ্চমার্ক স্যুইট ব্যবহার করেছে, তাই পার্থক্যগুলোতে মডেল পরিবর্তন এবং স্যুইট পরিবর্তন দুটোই ধরা পড়ে।

মূল্যের ইতিহাস

OpenRouter থেকে এই মডেলের ঐতিহাসিক মূল্য তথ্য।

তারিখ ইনপুট মূল্য আউটপুট মূল্য
2026-06-04 14:42 $0.090 / 1M $0.300 / 1M

চার্ট

প্রথম মডেলটি নির্বাচন করুন, তারপর দ্বিতীয় মডেলে ক্লিক করে পাশাপাশি তুলনা পৃষ্ঠা খুলুন।

মোট আউটপুট টোকেন

স্কোর vs মোট আউটপুট টোকেন

দ্রুত তুলনা

বিভাগভিত্তিক বিশ্লেষণ

বিভাগ স্কোর ধারাবাহিকতা সঠিক টেস্ট
অ্যান্টি-এআই কৌশল 10.0 10.0
কোডিং 3.1 4.7
সমন্বিত 10.0 10.0
ডেটা পার্সিং ও নিষ্কাশন 10.0 10.0
ডোমেইন-নির্দিষ্ট 5.3 7.2
Sadharon Buddhimotta 5.5 10.0
নির্দেশনা অনুসরণ 8.3 10.0
ধাঁধা সমাধান 5.3 10.0
টুল কলিং 10.0 10.0
সাধারণ জ্ঞান 3.0 10.0

তুলনা করা মডেল