AI BENCHY
Advertise here
#21

Qwen3.5 Plus 2026-02-15

Qwen প্রকাশ: 2026-02-15 পরীক্ষিত হয়েছে: 2026-05-21 23:53 qwen/qwen3.5-plus-02-15::medium
(medium) (none)

সারাংশ

Qwen3.5 Plus 2026-02-15 AI BENCHY-তে 8.1 স্কোর করে এবং #21 স্থানে আছে। এর reliability 10.0, pass rate 76.7%, মোট খরচ $0.317, এবং গড় response time 67.90s.

Qwen3.5 Plus 2026-02-15 কে আলাদা করে যা: এটি ধাঁধা সমাধান-তে সবচেয়ে ভালোভাবে নজর কাড়ে, যেখানে এর rank #1; আর অ্যান্টি-এআই কৌশল এর দুর্বলতম ক্ষেত্র, rank #14.

ধারাবাহিকতা

8.8

মোট আউটপুট টোকেন

175,390

মোট ইনপুট টোকেন

0

ইনপুট মূল্য

$0.260 / 1M

আউটপুট মূল্য

$1.560 / 1M

সঠিক টেস্ট

ভুল টেস্ট: 6

প্রতি চেষ্টায় পাস রেট: 76.7%

অস্থির টেস্ট

3

অস্থির টেস্টে রানভেদে মিশ্র ফল হয়েছে (কমপক্ষে একটি পাস এবং একটি ফেল)।

প্রতিক্রিয়া সময় (গড়)

67.90s

প্রতিক্রিয়া সময় (সর্বোচ্চ): 266.69s

প্রতিক্রিয়া সময় (মোট): 882.70s

জেনারেশন শোকেস

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#21 Qwen3.5 Plus 2026-02-15

medium
খরচ
$0.011
সময়
125.5s
টোকেন
7,040 tok

রান ইতিহাস

পরীক্ষিত হয়েছে স্কোর নির্ভরযোগ্যতা সঠিক টেস্ট মোট খরচ তুলনা করুন
2026-06-04 13:17 নতুন টেস্ট যোগ হয়েছে 7.9 8.9 $0.310 তুলনা করুন
2026-05-21 23:53 স্যুইট পরিবর্তিত হয়েছে 8.1 10.0 $0.317 বর্তমান রান
2026-04-11 01:44 প্রথম নথিভুক্ত রান 8.5 প্রযোজ্য নয় $0.220 তুলনা করুন

এই রানটি ভিন্ন একটি বেঞ্চমার্ক স্যুইট ব্যবহার করেছে। ঐতিহাসিক পরিবর্তন পড়ার সময় স্যুইট পরিবর্তনও মাথায় রাখুন।

রান তুলনা

রানস্কোরধারাবাহিকতানির্ভরযোগ্যতাসঠিক টেস্টঅস্থির টেস্টমোট আউটপুট টোকেনমোট ইনপুট টোকেনমোট খরচপ্রতিক্রিয়া সময় (গড়)
2026-05-21 23:53 · স্যুইট পরিবর্তিত হয়েছে8.18.810.014/203175,3900$0.31767.90s
2026-04-11 01:44 · প্রথম নথিভুক্ত রান8.59.1প্রযোজ্য নয়14/182114,0100$0.22046.56s
পার্থক্য-0.4-0.30+1+613800+$0.097+21336ms

এই দুই রান ভিন্ন বেঞ্চমার্ক স্যুইট ব্যবহার করেছে, তাই পার্থক্যগুলোতে মডেল পরিবর্তন এবং স্যুইট পরিবর্তন দুটোই ধরা পড়ে।

চার্ট

প্রথম মডেলটি নির্বাচন করুন, তারপর দ্বিতীয় মডেলে ক্লিক করে পাশাপাশি তুলনা পৃষ্ঠা খুলুন।

মোট আউটপুট টোকেন

স্কোর vs মোট আউটপুট টোকেন

দ্রুত তুলনা

বিভাগভিত্তিক বিশ্লেষণ

বিভাগ স্কোর ধারাবাহিকতা সঠিক টেস্ট
অ্যান্টি-এআই কৌশল 8.2 7.9
কোডিং 7.6 6.7
সমন্বিত 10.0 10.0
ডেটা পার্সিং ও নিষ্কাশন 10.0 10.0
ডোমেইন-নির্দিষ্ট 5.3 10.0
Sadharon Buddhimotta 4.7 1.6
নির্দেশনা অনুসরণ 10.0 10.0
ধাঁধা সমাধান 10.0 10.0
টুল কলিং 10.0 10.0
সাধারণ জ্ঞান 3.0 10.0

তুলনা করা মডেল