Advertise here
#34

GPT-5.3-Codex

OpenAI প্রকাশ: 2026-02-05 পরীক্ষিত হয়েছে: 2026-10-01 01:42 openai/gpt-5.3-codex::medium
~1.2T মোট (~80B সক্রিয়)MoEবন্ধ উৎসআনুমানিক

সারাংশ

GPT-5.3-Codex AI BENCHY-তে 9.1 স্কোর করে এবং #34 স্থানে আছে। এর reliability 10.0, pass rate 84.1%, মোট খরচ $1.318, এবং গড় response time 18.87s.

GPT-5.3-Codex কে আলাদা করে যা: এটি ডোমেইন-নির্দিষ্ট-তে সবচেয়ে ভালোভাবে নজর কাড়ে, যেখানে এর rank #3; আর Sadharon Buddhimotta এর দুর্বলতম ক্ষেত্র, rank #17.

মডেলের তথ্য

গবেষণার তারিখ: 2026-08-12

আনুমানিক
প্যারামিটার
~1.2T মোট (~80B সক্রিয়)
আর্কিটেকচার
MoE
উপলভ্যতা
বন্ধ উৎস
লাইসেন্স
-

সর্বজনীন তথ্যপ্রমাণের ভিত্তিতে সেরা অনুমান; প্রদানকারী সব মান প্রকাশ করেনি।

ধারাবাহিকতা

8.6

মোট আউটপুট টোকেন

66,287

মোট ইনপুট টোকেন

222,794

ইনপুট মূল্য

$1.750 / 1M

আউটপুট মূল্য

$14.000 / 1M

ক্যাশ পড়ার মূল্য

$0.175 / 1M

ক্যাশ লেখার মূল্য

প্রযোজ্য নয়

ক্যাশের মূল্য ইনপুট টোকেনের জন্য প্রযোজ্য। পড়ার সময় ক্যাশ করা প্রম্পট আবার ব্যবহার হয়; লেখার সময় সেগুলি সংরক্ষিত হয় এবং বাড়তি খরচ হতে পারে। আউটপুট টোকেনের জন্য আউটপুট মূল্য প্রযোজ্য।

সঠিক টেস্ট

ভুল টেস্ট: 6

প্রতি চেষ্টায় পাস রেট: 84.1%

অস্থির টেস্ট

4

অস্থির টেস্টে রানভেদে মিশ্র ফল হয়েছে (কমপক্ষে একটি পাস এবং একটি ফেল)।

প্রতিক্রিয়া সময় (গড়)

18.87s

প্রতিক্রিয়া সময় (সর্বোচ্চ): 100.93s

প্রতিক্রিয়া সময় (মোট): 433.94s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#34 GPT-5.3-Codex

medium
খরচ
$0.049
সময়
54.9s
টোকেন
3,580 tok

রান ইতিহাস

পরীক্ষিত হয়েছে স্কোর নির্ভরযোগ্যতা সঠিক টেস্ট মোট খরচ তুলনা করুন
2026-10-01 01:42 পুনরায় পরীক্ষা 9.1 10.0 $1.318 বর্তমান রান
2026-07-16 22:33 নতুন টেস্ট যোগ হয়েছে 8.9 10.0 $0.920 তুলনা করুন
2026-06-04 13:45 নতুন টেস্ট যোগ হয়েছে 8.4 10.0 $0.740 তুলনা করুন
2026-05-22 00:19 পুনরায় পরীক্ষা 8.3 10.0 $0.685 তুলনা করুন
2026-04-11 01:44 প্রথম নথিভুক্ত রান 8.6 প্রযোজ্য নয় $0.573 তুলনা করুন

এই রানটি ভিন্ন একটি বেঞ্চমার্ক স্যুইট ব্যবহার করেছে। ঐতিহাসিক পরিবর্তন পড়ার সময় স্যুইট পরিবর্তনও মাথায় রাখুন।

রান তুলনা

রানবেঞ্চমার্ক কভারেজস্কোরধারাবাহিকতানির্ভরযোগ্যতাসঠিক টেস্টঅস্থির টেস্টমোট আউটপুট টোকেনমোট ইনপুট টোকেনমোট খরচপ্রতিক্রিয়া সময় (গড়)
2026-10-01 01:42 · বর্তমান রান69/69 প্রচেষ্টা9.18.610.017/23466,287222,794$1.31818.87s
2026-04-11 01:44 · প্রথম নথিভুক্ত রান54/54 প্রচেষ্টা8.68.7প্রযোজ্য নয়13/18337,4580$0.57315.38s
পার্থক্য—+0.6-0.1+4+1+28829+222794+$0.746+3483ms

বেঞ্চমার্ক কভারেজ আলাদা: 69/69 প্রচেষ্টা (লক্ষ্য: প্রতি টেস্টে 3টি পুনরাবৃত্তি) বনাম 54/54 প্রচেষ্টা (লক্ষ্য: প্রতি টেস্টে 3টি পুনরাবৃত্তি)। মোট মান ও পুনরাবৃত্তি-সংবেদনশীল মেট্রিক সরাসরি তুলনাযোগ্য নয়।

এই দুই রান ভিন্ন বেঞ্চমার্ক স্যুইট ব্যবহার করেছে, তাই পার্থক্যগুলোতে মডেল পরিবর্তন এবং স্যুইট পরিবর্তন দুটোই ধরা পড়ে।

মূল্যের ইতিহাস

OpenRouter থেকে এই মডেলের ঐতিহাসিক মূল্য তথ্য।

তারিখ ইনপুট মূল্য আউটপুট মূল্য ক্যাশ পড়ার মূল্য ক্যাশ লেখার মূল্য
2026-08-14 12:51 $1.750 / 1M $14.000 / 1M প্রযোজ্য নয় প্রযোজ্য নয়
2026-10-01 18:33 $1.750 / 1M $14.000 / 1M $0.175 / 1M প্রযোজ্য নয়

চার্ট

প্রথম মডেলটি নির্বাচন করুন, তারপর দ্বিতীয় মডেলে ক্লিক করে পাশাপাশি তুলনা পৃষ্ঠা খুলুন।

মোট আউটপুট টোকেন

স্কোর vs মোট আউটপুট টোকেন

দ্রুত তুলনা

বিভাগভিত্তিক বিশ্লেষণ

বিভাগ স্কোর ধারাবাহিকতা সঠিক টেস্ট
স্বায়ত্তশাসিত এজেন্টের কাজ 10.0 10.0
অ্যান্টি-এআই কৌশল 8.7 7.9
কোডিং 10.0 10.0
সমন্বিত 10.0 10.0
ডেটা পার্সিং ও নিষ্কাশন 10.0 10.0
ডোমেইন-নির্দিষ্ট 5.9 7.2
Sadharon Buddhimotta 4.6 10.0
নির্দেশনা অনুসরণ 10.0 10.0
ধাঁধা সমাধান 9.0 7.9
টুল কলিং 10.0 10.0
সাধারণ জ্ঞান 2.8 1.6

তুলনা করা মডেল