AI BENCHY
Advertise here
#104

DeepSeek V3.2

DeepSeek প্রকাশ: 2025-12-01 পরীক্ষিত হয়েছে: 2026-05-08 15:31 deepseek/deepseek-v3.2::none
671B মোট (37B সক্রিয়)MoEউন্মুক্ত উৎস
(medium) (none)

সারাংশ

DeepSeek V3.2 AI BENCHY-তে 5.7 স্কোর করে এবং #104 স্থানে আছে। এর reliability 10.0, pass rate 49.1%, মোট খরচ $0.016, এবং গড় response time 13.43s.

DeepSeek V3.2 কে আলাদা করে যা: এটি নির্দেশনা অনুসরণ-তে সবচেয়ে ভালোভাবে নজর কাড়ে, যেখানে এর rank #1; আর অ্যান্টি-এআই কৌশল এর দুর্বলতম ক্ষেত্র, rank #18. এই score range-এর জন্য মোট benchmark খরচ অস্বাভাবিকভাবে কম।

মডেলের তথ্য

গবেষণার তারিখ: 2026-08-12

প্রকাশিত
প্যারামিটার
671B মোট (37B সক্রিয়)
আর্কিটেকচার
MoE
উপলভ্যতা
উন্মুক্ত উৎস
লাইসেন্স
MIT

ধারাবাহিকতা

7.9

মোট আউটপুট টোকেন

7,194

মোট ইনপুট টোকেন

0

ইনপুট মূল্য

$0.252 / 1M

আউটপুট মূল্য

$0.378 / 1M

সঠিক টেস্ট

ভুল টেস্ট: 12

প্রতি চেষ্টায় পাস রেট: 49.1%

অস্থির টেস্ট

5

অস্থির টেস্টে রানভেদে মিশ্র ফল হয়েছে (কমপক্ষে একটি পাস এবং একটি ফেল)।

প্রতিক্রিয়া সময় (গড়)

13.43s

প্রতিক্রিয়া সময় (সর্বোচ্চ): 115.89s

প্রতিক্রিয়া সময় (মোট): 255.10s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#104 DeepSeek V3.2

none
খরচ
$0.002
সময়
7.0s
টোকেন
1,046 tok

রান ইতিহাস

পরীক্ষিত হয়েছে স্কোর নির্ভরযোগ্যতা সঠিক টেস্ট মোট খরচ তুলনা করুন
2026-08-14 02:58 পুনরায় পরীক্ষা 5.0 10.0 $0.054 তুলনা করুন
2026-07-16 23:15 নতুন টেস্ট যোগ হয়েছে 5.0 10.0 $0.054 তুলনা করুন
2026-06-04 14:22 নতুন টেস্ট যোগ হয়েছে 5.2 10.0 $0.017 তুলনা করুন
2026-05-22 00:35 স্যুইট পরিবর্তিত হয়েছে 5.6 10.0 $0.018 তুলনা করুন
2026-05-08 15:31 স্যুইট পরিবর্তিত হয়েছে 5.7 10.0 $0.016 বর্তমান রান
2026-04-20 17:48 প্রথম নথিভুক্ত রান 6.1 প্রযোজ্য নয় $0.016 তুলনা করুন

এই রানটি ভিন্ন একটি বেঞ্চমার্ক স্যুইট ব্যবহার করেছে। ঐতিহাসিক পরিবর্তন পড়ার সময় স্যুইট পরিবর্তনও মাথায় রাখুন।

রান তুলনা

রানবেঞ্চমার্ক কভারেজস্কোরধারাবাহিকতানির্ভরযোগ্যতাসঠিক টেস্টঅস্থির টেস্টমোট আউটপুট টোকেনমোট ইনপুট টোকেনমোট খরচপ্রতিক্রিয়া সময় (গড়)
2026-05-08 15:31 · স্যুইট পরিবর্তিত হয়েছে57/57 প্রচেষ্টা5.77.910.07/1957,1940$0.01613.43s
2026-07-16 23:15 · নতুন টেস্ট যোগ হয়েছে66/66 প্রচেষ্টা5.07.710.06/22642,097135,780$0.05418.25s
পার্থক্য+0.7+0.20.0+1-1-34903-135780-$0.039-4828ms

বেঞ্চমার্ক কভারেজ আলাদা: 57/57 প্রচেষ্টা (লক্ষ্য: প্রতি টেস্টে 3টি পুনরাবৃত্তি) বনাম 66/66 প্রচেষ্টা (লক্ষ্য: প্রতি টেস্টে 3টি পুনরাবৃত্তি)। মোট মান ও পুনরাবৃত্তি-সংবেদনশীল মেট্রিক সরাসরি তুলনাযোগ্য নয়।

এই দুই রান ভিন্ন বেঞ্চমার্ক স্যুইট ব্যবহার করেছে, তাই পার্থক্যগুলোতে মডেল পরিবর্তন এবং স্যুইট পরিবর্তন দুটোই ধরা পড়ে।

চার্ট

প্রথম মডেলটি নির্বাচন করুন, তারপর দ্বিতীয় মডেলে ক্লিক করে পাশাপাশি তুলনা পৃষ্ঠা খুলুন।

মোট আউটপুট টোকেন

স্কোর vs মোট আউটপুট টোকেন

দ্রুত তুলনা

বিভাগভিত্তিক বিশ্লেষণ

বিভাগ স্কোর ধারাবাহিকতা সঠিক টেস্ট
অ্যান্টি-এআই কৌশল 3.3 8.2
কোডিং 2.4 1.3
সমন্বিত 6.5 10.0
ডেটা পার্সিং ও নিষ্কাশন 6.3 5.8
ডোমেইন-নির্দিষ্ট 3.0 6.9
Sadharon Buddhimotta 7.6 10.0
নির্দেশনা অনুসরণ 10.0 10.0
ধাঁধা সমাধান 7.5 7.7
টুল কলিং 10.0 10.0
সাধারণ জ্ঞান 3.0 10.0

তুলনা করা মডেল