AI BENCHY
Advertise here
#123

GPT-5.4

OpenAI প্রকাশ: 2026-03-05 পরীক্ষিত হয়েছে: 2026-06-04 13:45 openai/gpt-5.4::none
~1.5T মোট (~100B সক্রিয়)MoEবন্ধ উৎসআনুমানিক
(medium) (none)

সারাংশ

GPT-5.4 AI BENCHY-তে 5.5 স্কোর করে এবং #123 স্থানে আছে। এর reliability 10.0, pass rate 36.5%, মোট খরচ $0.122, এবং গড় response time 1.42s.

GPT-5.4 কে আলাদা করে যা: এটি ডোমেইন-নির্দিষ্ট-তে সবচেয়ে ভালোভাবে নজর কাড়ে, যেখানে এর rank #3; আর অ্যান্টি-এআই কৌশল এর দুর্বলতম ক্ষেত্র, rank #18. একই ধরনের মডেলের তুলনায় এটি লক্ষণীয়ভাবে দ্রুত।

মডেলের তথ্য

গবেষণার তারিখ: 2026-08-12

আনুমানিক
প্যারামিটার
~1.5T মোট (~100B সক্রিয়)
আর্কিটেকচার
MoE
উপলভ্যতা
বন্ধ উৎস
লাইসেন্স
-

সর্বজনীন তথ্যপ্রমাণের ভিত্তিতে সেরা অনুমান; প্রদানকারী সব মান প্রকাশ করেনি।

ধারাবাহিকতা

9.2

মোট আউটপুট টোকেন

2,417

মোট ইনপুট টোকেন

34,212

ইনপুট মূল্য

$2.500 / 1M

আউটপুট মূল্য

$15.000 / 1M

সঠিক টেস্ট

ভুল টেস্ট: 14

প্রতি চেষ্টায় পাস রেট: 36.5%

অস্থির টেস্ট

2

অস্থির টেস্টে রানভেদে মিশ্র ফল হয়েছে (কমপক্ষে একটি পাস এবং একটি ফেল)।

প্রতিক্রিয়া সময় (গড়)

1.42s

প্রতিক্রিয়া সময় (সর্বোচ্চ): 2.95s

প্রতিক্রিয়া সময় (মোট): 29.87s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#123 GPT-5.4

none
খরচ
$0.026
সময়
18.1s
টোকেন
1,792 tok

রান ইতিহাস

পরীক্ষিত হয়েছে স্কোর নির্ভরযোগ্যতা সঠিক টেস্ট মোট খরচ তুলনা করুন
2026-08-14 02:13 পুনরায় পরীক্ষা 5.8 10.0 $0.397 তুলনা করুন
2026-07-16 22:33 নতুন টেস্ট যোগ হয়েছে 5.8 10.0 $0.397 তুলনা করুন
2026-06-04 13:45 নতুন টেস্ট যোগ হয়েছে 5.5 10.0 $0.122 বর্তমান রান
2026-05-22 00:18 স্যুইট পরিবর্তিত হয়েছে 5.6 10.0 $0.115 তুলনা করুন
2026-04-11 01:44 প্রথম নথিভুক্ত রান 5.9 প্রযোজ্য নয় $0.104 তুলনা করুন

এই রানটি ভিন্ন একটি বেঞ্চমার্ক স্যুইট ব্যবহার করেছে। ঐতিহাসিক পরিবর্তন পড়ার সময় স্যুইট পরিবর্তনও মাথায় রাখুন।

রান তুলনা

রানবেঞ্চমার্ক কভারেজস্কোরধারাবাহিকতানির্ভরযোগ্যতাসঠিক টেস্টঅস্থির টেস্টমোট আউটপুট টোকেনমোট ইনপুট টোকেনমোট খরচপ্রতিক্রিয়া সময় (গড়)
2026-06-04 13:45 · নতুন টেস্ট যোগ হয়েছে63/63 প্রচেষ্টা5.59.210.07/2122,41734,212$0.1221.42s
2026-08-14 02:13 · পুনরায় পরীক্ষা66/66 প্রচেষ্টা5.89.210.07/2228,339108,641$0.3972.08s
পার্থক্য-0.30.00.000-5922-74429-$0.275-657ms

বেঞ্চমার্ক কভারেজ আলাদা: 63/63 প্রচেষ্টা (লক্ষ্য: প্রতি টেস্টে 3টি পুনরাবৃত্তি) বনাম 66/66 প্রচেষ্টা (লক্ষ্য: প্রতি টেস্টে 3টি পুনরাবৃত্তি)। মোট মান ও পুনরাবৃত্তি-সংবেদনশীল মেট্রিক সরাসরি তুলনাযোগ্য নয়।

এই দুই রান ভিন্ন বেঞ্চমার্ক স্যুইট ব্যবহার করেছে, তাই পার্থক্যগুলোতে মডেল পরিবর্তন এবং স্যুইট পরিবর্তন দুটোই ধরা পড়ে।

মূল্যের ইতিহাস

OpenRouter থেকে এই মডেলের ঐতিহাসিক মূল্য তথ্য।

তারিখ ইনপুট মূল্য আউটপুট মূল্য
2026-06-04 14:42 $2.500 / 1M $15.000 / 1M

চার্ট

প্রথম মডেলটি নির্বাচন করুন, তারপর দ্বিতীয় মডেলে ক্লিক করে পাশাপাশি তুলনা পৃষ্ঠা খুলুন।

মোট আউটপুট টোকেন

স্কোর vs মোট আউটপুট টোকেন

দ্রুত তুলনা

বিভাগভিত্তিক বিশ্লেষণ

বিভাগ স্কোর ধারাবাহিকতা সঠিক টেস্ট
অ্যান্টি-এআই কৌশল 3.2 8.0
কোডিং 5.5 10.0
সমন্বিত 3.0 10.0
ডেটা পার্সিং ও নিষ্কাশন 10.0 10.0
ডোমেইন-নির্দিষ্ট 5.3 7.2
Sadharon Buddhimotta 4.4 9.9
নির্দেশনা অনুসরণ 6.5 10.0
ধাঁধা সমাধান 5.6 9.8
টুল কলিং 10.0 10.0
সাধারণ জ্ঞান 3.0 10.0

তুলনা করা মডেল