Advertise here
#149

Qwen3.5-27B

Qwen প্রকাশ: 2026-02-24 পরীক্ষিত হয়েছে: 2026-10-01 01:05 qwen/qwen3.5-27b::none
27Bঘনউন্মুক্ত উৎস
(medium) (none)

সারাংশ

Qwen3.5-27B AI BENCHY-তে 7.2 স্কোর করে এবং #149 স্থানে আছে। এর reliability 10.0, pass rate 47.8%, মোট খরচ $0.116, এবং গড় response time 9.98s.

Qwen3.5-27B কে আলাদা করে যা: এটি স্বায়ত্তশাসিত এজেন্টের কাজ-তে সবচেয়ে ভালোভাবে নজর কাড়ে, যেখানে এর rank #1; আর অ্যান্টি-এআই কৌশল এর দুর্বলতম ক্ষেত্র, rank #17.

মডেলের তথ্য

গবেষণার তারিখ: 2026-08-12

প্রকাশিত
প্যারামিটার
27B
আর্কিটেকচার
ঘন
উপলভ্যতা
উন্মুক্ত উৎস
লাইসেন্স
Apache-2.0

ধারাবাহিকতা

9.4

মোট আউটপুট টোকেন

36,422

মোট ইনপুট টোকেন

283,977

ইনপুট মূল্য

$0.195 / 1M

আউটপুট মূল্য

$1.560 / 1M

ক্যাশ পড়ার মূল্য

প্রযোজ্য নয়

ক্যাশ লেখার মূল্য

প্রযোজ্য নয়

ক্যাশের মূল্য ইনপুট টোকেনের জন্য প্রযোজ্য। পড়ার সময় ক্যাশ করা প্রম্পট আবার ব্যবহার হয়; লেখার সময় সেগুলি সংরক্ষিত হয় এবং বাড়তি খরচ হতে পারে। আউটপুট টোকেনের জন্য আউটপুট মূল্য প্রযোজ্য।

সঠিক টেস্ট

ভুল টেস্ট: 13

প্রতি চেষ্টায় পাস রেট: 47.8%

অস্থির টেস্ট

2

অস্থির টেস্টে রানভেদে মিশ্র ফল হয়েছে (কমপক্ষে একটি পাস এবং একটি ফেল)।

প্রতিক্রিয়া সময় (গড়)

9.98s

প্রতিক্রিয়া সময় (সর্বোচ্চ): 124.53s

প্রতিক্রিয়া সময় (মোট): 229.52s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#149 Qwen3.5-27B

none
খরচ
$0.007
সময়
42.9s
টোকেন
4,273 tok

রান ইতিহাস

পরীক্ষিত হয়েছে স্কোর নির্ভরযোগ্যতা সঠিক টেস্ট মোট খরচ তুলনা করুন
2026-10-01 01:05 পুনরায় পরীক্ষা 7.2 10.0 $0.116 বর্তমান রান
2026-07-16 22:01 নতুন টেস্ট যোগ হয়েছে 6.5 10.0 $0.058 ↓ তুলনা করুন
2026-06-04 13:28 নতুন টেস্ট যোগ হয়েছে 5.7 10.0 $0.015 ↓ তুলনা করুন
2026-05-21 23:59 স্যুইট পরিবর্তিত হয়েছে 5.8 10.0 $0.017 তুলনা করুন
2026-04-11 01:19 প্রথম নথিভুক্ত রান 5.9 প্রযোজ্য নয় $0.016 তুলনা করুন

এই রানটি ভিন্ন একটি বেঞ্চমার্ক স্যুইট ব্যবহার করেছে। ঐতিহাসিক পরিবর্তন পড়ার সময় স্যুইট পরিবর্তনও মাথায় রাখুন।

রান তুলনা

রানবেঞ্চমার্ক কভারেজস্কোরধারাবাহিকতানির্ভরযোগ্যতাসঠিক টেস্টঅস্থির টেস্টমোট আউটপুট টোকেনমোট ইনপুট টোকেনমোট খরচপ্রতিক্রিয়া সময় (গড়)
2026-10-01 01:05 · বর্তমান রান69/69 প্রচেষ্টা7.29.410.010/23236,422283,977$0.1169.98s
2026-04-11 01:19 · প্রথম নথিভুক্ত রান54/54 প্রচেষ্টা5.99.2প্রযোজ্য নয়6/1823,5450$0.0161.74s
পার্থক্য—+1.4+0.2+40+32877+283977+$0.100+8239ms

বেঞ্চমার্ক কভারেজ আলাদা: 69/69 প্রচেষ্টা (লক্ষ্য: প্রতি টেস্টে 3টি পুনরাবৃত্তি) বনাম 54/54 প্রচেষ্টা (লক্ষ্য: প্রতি টেস্টে 3টি পুনরাবৃত্তি)। মোট মান ও পুনরাবৃত্তি-সংবেদনশীল মেট্রিক সরাসরি তুলনাযোগ্য নয়।

এই দুই রান ভিন্ন বেঞ্চমার্ক স্যুইট ব্যবহার করেছে, তাই পার্থক্যগুলোতে মডেল পরিবর্তন এবং স্যুইট পরিবর্তন দুটোই ধরা পড়ে।

চার্ট

প্রথম মডেলটি নির্বাচন করুন, তারপর দ্বিতীয় মডেলে ক্লিক করে পাশাপাশি তুলনা পৃষ্ঠা খুলুন।

মোট আউটপুট টোকেন

স্কোর vs মোট আউটপুট টোকেন

দ্রুত তুলনা

বিভাগভিত্তিক বিশ্লেষণ

বিভাগ স্কোর ধারাবাহিকতা সঠিক টেস্ট
স্বায়ত্তশাসিত এজেন্টের কাজ 10.0 10.0
অ্যান্টি-এআই কৌশল 4.8 10.0
কোডিং 5.8 10.0
সমন্বিত 6.4 5.8
ডেটা পার্সিং ও নিষ্কাশন 10.0 10.0
ডোমেইন-নির্দিষ্ট 5.3 10.0
Sadharon Buddhimotta 5.0 10.0
নির্দেশনা অনুসরণ 6.3 10.0
ধাঁধা সমাধান 6.7 7.9
টুল কলিং 10.0 10.0
সাধারণ জ্ঞান 3.0 10.0

তুলনা করা মডেল