AI BENCHY
Advertise here
#7

GPT-5.3-Codex

OpenAI প্রকাশ: 2026-02-05 পরীক্ষিত হয়েছে: 2026-04-11 01:44 openai/gpt-5.3-codex::medium
~1.2T মোট (~80B সক্রিয়)MoEবন্ধ উৎসআনুমানিক

সারাংশ

GPT-5.3-Codex AI BENCHY-তে 8.6 স্কোর করে এবং #7 স্থানে আছে। এর reliability প্রযোজ্য নয়, pass rate 83.3%, মোট খরচ $0.573, এবং গড় response time 15.38s.

মডেলের তথ্য

গবেষণার তারিখ: 2026-08-12

আনুমানিক
প্যারামিটার
~1.2T মোট (~80B সক্রিয়)
আর্কিটেকচার
MoE
উপলভ্যতা
বন্ধ উৎস
লাইসেন্স
-

সর্বজনীন তথ্যপ্রমাণের ভিত্তিতে সেরা অনুমান; প্রদানকারী সব মান প্রকাশ করেনি।

ধারাবাহিকতা

8.7

নির্ভরযোগ্যতা

প্রযোজ্য নয়

মোট আউটপুট টোকেন

37,458

মোট ইনপুট টোকেন

0

ইনপুট মূল্য

$1.750 / 1M

আউটপুট মূল্য

$14.000 / 1M

সঠিক টেস্ট

ভুল টেস্ট: 5

প্রতি চেষ্টায় পাস রেট: 83.3%

অস্থির টেস্ট

3

অস্থির টেস্টে রানভেদে মিশ্র ফল হয়েছে (কমপক্ষে একটি পাস এবং একটি ফেল)।

প্রতিক্রিয়া সময় (গড়)

15.38s

প্রতিক্রিয়া সময় (সর্বোচ্চ): 100.93s

প্রতিক্রিয়া সময় (মোট): 276.91s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#7 GPT-5.3-Codex

medium
খরচ
$0.049
সময়
54.9s
টোকেন
3,580 tok

রান ইতিহাস

পরীক্ষিত হয়েছে স্কোর নির্ভরযোগ্যতা সঠিক টেস্ট মোট খরচ তুলনা করুন
2026-08-14 02:13 পুনরায় পরীক্ষা 8.9 10.0 $0.988 তুলনা করুন
2026-07-16 22:33 নতুন টেস্ট যোগ হয়েছে 8.9 10.0 $0.920 তুলনা করুন
2026-06-04 13:45 নতুন টেস্ট যোগ হয়েছে 8.4 10.0 $0.740 তুলনা করুন
2026-05-22 00:19 পুনরায় পরীক্ষা 8.3 10.0 $0.685 তুলনা করুন
2026-04-11 01:44 প্রথম নথিভুক্ত রান 8.6 প্রযোজ্য নয় $0.573 বর্তমান রান

রান তুলনা

রানবেঞ্চমার্ক কভারেজস্কোরধারাবাহিকতানির্ভরযোগ্যতাসঠিক টেস্টঅস্থির টেস্টমোট আউটপুট টোকেনমোট ইনপুট টোকেনমোট খরচপ্রতিক্রিয়া সময় (গড়)
2026-04-11 01:44 · প্রথম নথিভুক্ত রান54/54 প্রচেষ্টা8.68.7প্রযোজ্য নয়13/18337,4580$0.57315.38s
2026-08-14 02:13 · পুনরায় পরীক্ষা66/66 প্রচেষ্টা8.98.610.016/22460,37481,187$0.98816.91s
পার্থক্য-0.4+0.1-3-1-22916-81187-$0.415-1526ms

বেঞ্চমার্ক কভারেজ আলাদা: 54/54 প্রচেষ্টা (লক্ষ্য: প্রতি টেস্টে 3টি পুনরাবৃত্তি) বনাম 66/66 প্রচেষ্টা (লক্ষ্য: প্রতি টেস্টে 3টি পুনরাবৃত্তি)। মোট মান ও পুনরাবৃত্তি-সংবেদনশীল মেট্রিক সরাসরি তুলনাযোগ্য নয়।

এই দুই রান ভিন্ন বেঞ্চমার্ক স্যুইট ব্যবহার করেছে, তাই পার্থক্যগুলোতে মডেল পরিবর্তন এবং স্যুইট পরিবর্তন দুটোই ধরা পড়ে।

চার্ট

প্রথম মডেলটি নির্বাচন করুন, তারপর দ্বিতীয় মডেলে ক্লিক করে পাশাপাশি তুলনা পৃষ্ঠা খুলুন।

মোট আউটপুট টোকেন

স্কোর vs মোট আউটপুট টোকেন

দ্রুত তুলনা

বিভাগভিত্তিক বিশ্লেষণ

বিভাগ স্কোর ধারাবাহিকতা সঠিক টেস্ট
অ্যান্টি-এআই কৌশল 8.7 7.9
কোডিং 10.0 10.0
সমন্বিত 10.0 10.0
ডেটা পার্সিং ও নিষ্কাশন 10.0 10.0
ডোমেইন-নির্দিষ্ট 5.9 7.2
Sadharon Buddhimotta 4.6 10.0
নির্দেশনা অনুসরণ 10.0 10.0
ধাঁধা সমাধান 9.0 7.9
টুল কলিং 10.0 10.0

তুলনা করা মডেল