AI BENCHY
Advertise here
#43

DeepSeek V4 Pro

DeepSeek প্রকাশ: 2026-04-24 পরীক্ষিত হয়েছে: 2026-07-16 23:19 deepseek/deepseek-v4-pro::high
1.6T মোট (49B সক্রিয়)MoEউন্মুক্ত উৎস
(high) (none)

সারাংশ

DeepSeek V4 Pro AI BENCHY-তে 7.7 স্কোর করে এবং #43 স্থানে আছে। এর reliability 10.0, pass rate 63.6%, মোট খরচ $0.200, এবং গড় response time 79.14s.

DeepSeek V4 Pro কে আলাদা করে যা: এই score range-এর জন্য মোট benchmark খরচ অস্বাভাবিকভাবে কম।

মডেলের তথ্য

গবেষণার তারিখ: 2026-08-12

প্রকাশিত
প্যারামিটার
1.6T মোট (49B সক্রিয়)
আর্কিটেকচার
MoE
উপলভ্যতা
উন্মুক্ত উৎস
লাইসেন্স
MIT

ধারাবাহিকতা

7.7

মোট আউটপুট টোকেন

189,181

মোট ইনপুট টোকেন

90,748

ইনপুট মূল্য

$0.435 / 1M

আউটপুট মূল্য

$0.870 / 1M

সঠিক টেস্ট

ভুল টেস্ট: 12

প্রতি চেষ্টায় পাস রেট: 63.6%

অস্থির টেস্ট

6

অস্থির টেস্টে রানভেদে মিশ্র ফল হয়েছে (কমপক্ষে একটি পাস এবং একটি ফেল)।

প্রতিক্রিয়া সময় (গড়)

79.14s

প্রতিক্রিয়া সময় (সর্বোচ্চ): 416.76s

প্রতিক্রিয়া সময় (মোট): 1740.97s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#43 DeepSeek V4 Pro

high
খরচ
$0.023
সময়
257.6s
টোকেন
14,870 tok

রান ইতিহাস

পরীক্ষিত হয়েছে স্কোর নির্ভরযোগ্যতা সঠিক টেস্ট মোট খরচ তুলনা করুন
2026-08-14 03:17 পুনরায় পরীক্ষা 7.7 10.0 $0.555 তুলনা করুন
2026-07-16 23:19 নতুন টেস্ট যোগ হয়েছে 7.7 10.0 $0.200 বর্তমান রান
2026-06-16 15:31 পুনরায় পরীক্ষা 7.6 9.3 $0.157 তুলনা করুন
2026-06-16 14:47 স্যুইট পরিবর্তিত হয়েছে 8.1 9.6 $0.098 তুলনা করুন
2026-06-04 14:38 নতুন টেস্ট যোগ হয়েছে 6.0 8.9 $0.079 তুলনা করুন
2026-05-22 00:54 স্যুইট পরিবর্তিত হয়েছে 6.6 9.0 $0.212 তুলনা করুন
2026-04-29 14:47 পুনরায় পরীক্ষা 7.5 9.3 $0.209 তুলনা করুন
2026-04-26 10:50 পুনরায় পরীক্ষা 7.5 8.4 $0.201 তুলনা করুন
2026-04-25 21:53 প্রথম রান 8.2 প্রযোজ্য নয় $0.329 তুলনা করুন

এই রানটি ভিন্ন একটি বেঞ্চমার্ক স্যুইট ব্যবহার করেছে। ঐতিহাসিক পরিবর্তন পড়ার সময় স্যুইট পরিবর্তনও মাথায় রাখুন।

রান তুলনা

রানবেঞ্চমার্ক কভারেজস্কোরধারাবাহিকতানির্ভরযোগ্যতাসঠিক টেস্টঅস্থির টেস্টমোট আউটপুট টোকেনমোট ইনপুট টোকেনমোট খরচপ্রতিক্রিয়া সময় (গড়)
2026-07-16 23:19 · নতুন টেস্ট যোগ হয়েছে66/66 প্রচেষ্টা7.77.710.010/226189,18190,748$0.20079.14s
2026-04-29 14:47 · পুনরায় পরীক্ষা54/54 প্রচেষ্টা7.58.09.311/18462,1250$0.20960.03s
পার্থক্য+0.1-0.3+0.7-1+2+127056+90748-$0.009+19101ms

বেঞ্চমার্ক কভারেজ আলাদা: 66/66 প্রচেষ্টা (লক্ষ্য: প্রতি টেস্টে 3টি পুনরাবৃত্তি) বনাম 54/54 প্রচেষ্টা (লক্ষ্য: প্রতি টেস্টে 3টি পুনরাবৃত্তি)। মোট মান ও পুনরাবৃত্তি-সংবেদনশীল মেট্রিক সরাসরি তুলনাযোগ্য নয়।

এই দুই রান ভিন্ন বেঞ্চমার্ক স্যুইট ব্যবহার করেছে, তাই পার্থক্যগুলোতে মডেল পরিবর্তন এবং স্যুইট পরিবর্তন দুটোই ধরা পড়ে।

মূল্যের ইতিহাস

OpenRouter থেকে এই মডেলের ঐতিহাসিক মূল্য তথ্য।

তারিখ ইনপুট মূল্য আউটপুট মূল্য
2026-06-16 14:59 $0.435 / 1M $0.870 / 1M

চার্ট

প্রথম মডেলটি নির্বাচন করুন, তারপর দ্বিতীয় মডেলে ক্লিক করে পাশাপাশি তুলনা পৃষ্ঠা খুলুন।

মোট আউটপুট টোকেন

স্কোর vs মোট আউটপুট টোকেন

দ্রুত তুলনা

বিভাগভিত্তিক বিশ্লেষণ

বিভাগ স্কোর ধারাবাহিকতা সঠিক টেস্ট
অ্যান্টি-এআই কৌশল 5.7 5.9
কোডিং 6.3 8.7
সমন্বিত 10.0 10.0
ডেটা পার্সিং ও নিষ্কাশন 10.0 10.0
ডোমেইন-নির্দিষ্ট 3.6 7.2
Sadharon Buddhimotta 10.0 10.0
নির্দেশনা অনুসরণ 7.8 6.6
ধাঁধা সমাধান 6.9 4.9
টুল কলিং 9.8 10.0
সাধারণ জ্ঞান 3.0 10.0

তুলনা করা মডেল