AI BENCHY
Advertise here
#29

Qwen3.5-122B-A10B

Qwen প্রকাশ: 2026-02-24 পরীক্ষিত হয়েছে: 2026-06-04 13:31 qwen/qwen3.5-122b-a10b::medium
122B মোট (10B সক্রিয়)MoEউন্মুক্ত উৎস
(medium) (none)

সারাংশ

Qwen3.5-122B-A10B AI BENCHY-তে 7.8 স্কোর করে এবং #29 স্থানে আছে। এর reliability 10.0, pass rate 73.0%, মোট খরচ $0.588, এবং গড় response time 42.49s.

মডেলের তথ্য

গবেষণার তারিখ: 2026-08-12

প্রকাশিত
প্যারামিটার
122B মোট (10B সক্রিয়)
আর্কিটেকচার
MoE
উপলভ্যতা
উন্মুক্ত উৎস
লাইসেন্স
Apache-2.0

ধারাবাহিকতা

8.8

মোট খরচ (বর্তমান মূল্য)

$0.588 ↓ -19.8%

পরীক্ষার সময়: $0.733

মোট আউটপুট টোকেন

277,215

মোট ইনপুট টোকেন

41,832

ইনপুট মূল্য

$0.260 / 1M

আউটপুট মূল্য

$2.080 / 1M

সঠিক টেস্ট

ভুল টেস্ট: 7

প্রতি চেষ্টায় পাস রেট: 73.0%

অস্থির টেস্ট

3

অস্থির টেস্টে রানভেদে মিশ্র ফল হয়েছে (কমপক্ষে একটি পাস এবং একটি ফেল)।

প্রতিক্রিয়া সময় (গড়)

42.49s

প্রতিক্রিয়া সময় (সর্বোচ্চ): 168.16s

প্রতিক্রিয়া সময় (মোট): 892.30s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#29 Qwen3.5-122B-A10B

medium
খরচ
$0.019
সময়
48.7s
টোকেন
6,034 tok

রান ইতিহাস

পরীক্ষিত হয়েছে স্কোর নির্ভরযোগ্যতা সঠিক টেস্ট মোট খরচ তুলনা করুন
2026-08-14 01:54 পুনরায় পরীক্ষা 7.1 10.0 $1.207 তুলনা করুন
2026-07-16 22:21 নতুন টেস্ট যোগ হয়েছে 7.1 10.0 $1.046 তুলনা করুন
2026-06-04 13:31 নতুন টেস্ট যোগ হয়েছে 7.8 10.0 $0.588 বর্তমান রান
2026-05-22 00:03 স্যুইট পরিবর্তিত হয়েছে 7.7 10.0 $0.650 তুলনা করুন
2026-04-11 01:44 প্রথম নথিভুক্ত রান 8.1 প্রযোজ্য নয় $0.528 তুলনা করুন

এই রানটি ভিন্ন একটি বেঞ্চমার্ক স্যুইট ব্যবহার করেছে। ঐতিহাসিক পরিবর্তন পড়ার সময় স্যুইট পরিবর্তনও মাথায় রাখুন।

রান তুলনা

রানবেঞ্চমার্ক কভারেজস্কোরধারাবাহিকতানির্ভরযোগ্যতাসঠিক টেস্টঅস্থির টেস্টমোট আউটপুট টোকেনমোট ইনপুট টোকেনমোট খরচপ্রতিক্রিয়া সময় (গড়)
2026-06-04 13:31 · নতুন টেস্ট যোগ হয়েছে63/63 প্রচেষ্টা7.88.810.014/213277,21541,832$0.58842.49s
2026-05-22 00:03 · স্যুইট পরিবর্তিত হয়েছে60/60 প্রচেষ্টা7.78.810.013/203238,2850$0.65039.29s
পার্থক্য+0.10.00.0+10+38930+41832-$0.063+3197ms

বেঞ্চমার্ক কভারেজ আলাদা: 63/63 প্রচেষ্টা (লক্ষ্য: প্রতি টেস্টে 3টি পুনরাবৃত্তি) বনাম 60/60 প্রচেষ্টা (লক্ষ্য: প্রতি টেস্টে 3টি পুনরাবৃত্তি)। মোট মান ও পুনরাবৃত্তি-সংবেদনশীল মেট্রিক সরাসরি তুলনাযোগ্য নয়।

এই দুই রান ভিন্ন বেঞ্চমার্ক স্যুইট ব্যবহার করেছে, তাই পার্থক্যগুলোতে মডেল পরিবর্তন এবং স্যুইট পরিবর্তন দুটোই ধরা পড়ে।

মূল্যের ইতিহাস

OpenRouter থেকে এই মডেলের ঐতিহাসিক মূল্য তথ্য।

তারিখ ইনপুট মূল্য আউটপুট মূল্য
2026-06-04 14:42 $0.260 / 1M $2.080 / 1M

চার্ট

প্রথম মডেলটি নির্বাচন করুন, তারপর দ্বিতীয় মডেলে ক্লিক করে পাশাপাশি তুলনা পৃষ্ঠা খুলুন।

মোট আউটপুট টোকেন

স্কোর vs মোট আউটপুট টোকেন

দ্রুত তুলনা

বিভাগভিত্তিক বিশ্লেষণ

বিভাগ স্কোর ধারাবাহিকতা সঠিক টেস্ট
অ্যান্টি-এআই কৌশল 10.0 10.0
কোডিং 6.0 7.2
সমন্বিত 10.0 10.0
ডেটা পার্সিং ও নিষ্কাশন 10.0 10.0
ডোমেইন-নির্দিষ্ট 2.9 7.2
Sadharon Buddhimotta 3.4 2.2
নির্দেশনা অনুসরণ 10.0 10.0
ধাঁধা সমাধান 10.0 10.0
টুল কলিং 10.0 10.0
সাধারণ জ্ঞান 3.0 10.0

তুলনা করা মডেল