AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com
#79

GPT-5.6 Sol

OpenAI প্রকাশ: 2026-07-09 পরীক্ষিত হয়েছে: 2026-07-16 22:37 openai/gpt-5.6-sol::none
~2T মোট (~150B সক্রিয়)MoEবন্ধ উৎসআনুমানিক

সারাংশ

GPT-5.6 Sol AI BENCHY-তে 6.9 স্কোর করে এবং #79 স্থানে আছে। এর reliability 10.0, pass rate 59.1%, মোট খরচ $0.524, এবং গড় response time 2.16s.

GPT-5.6 Sol কে আলাদা করে যা: এটি Sadharon Buddhimotta-তে সবচেয়ে ভালোভাবে নজর কাড়ে, যেখানে এর rank #4; আর কোডিং এর দুর্বলতম ক্ষেত্র, rank #16. একই ধরনের মডেলের তুলনায় এটি লক্ষণীয়ভাবে দ্রুত।

মডেলের তথ্য

গবেষণার তারিখ: 2026-08-12

আনুমানিক
প্যারামিটার
~2T মোট (~150B সক্রিয়)
আর্কিটেকচার
MoE
উপলভ্যতা
বন্ধ উৎস
লাইসেন্স
-

সর্বজনীন তথ্যপ্রমাণের ভিত্তিতে সেরা অনুমান; প্রদানকারী সব মান প্রকাশ করেনি।

ধারাবাহিকতা

9.0

মোট আউটপুট টোকেন

4,357

মোট ইনপুট টোকেন

78,593

ইনপুট মূল্য

$5.000 / 1M

আউটপুট মূল্য

$30.000 / 1M

সঠিক টেস্ট

ভুল টেস্ট: 11

প্রতি চেষ্টায় পাস রেট: 59.1%

অস্থির টেস্ট

3

অস্থির টেস্টে রানভেদে মিশ্র ফল হয়েছে (কমপক্ষে একটি পাস এবং একটি ফেল)।

প্রতিক্রিয়া সময় (গড়)

2.16s

প্রতিক্রিয়া সময় (সর্বোচ্চ): 12.81s

প্রতিক্রিয়া সময় (মোট): 47.62s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#79 GPT-5.6 Sol

none
খরচ
$0.116
সময়
78.7s
টোকেন
3,944 tok

রান ইতিহাস

পরীক্ষিত হয়েছে স্কোর নির্ভরযোগ্যতা সঠিক টেস্ট মোট খরচ তুলনা করুন
2026-08-14 02:21 পুনরায় পরীক্ষা 7.0 10.0 $0.524 তুলনা করুন
2026-07-16 22:37 নতুন টেস্ট যোগ হয়েছে 6.9 10.0 $0.524 বর্তমান রান
2026-07-09 21:15 প্রথম রান 6.3 10.0 $0.225 তুলনা করুন

এই রানটি ভিন্ন একটি বেঞ্চমার্ক স্যুইট ব্যবহার করেছে। ঐতিহাসিক পরিবর্তন পড়ার সময় স্যুইট পরিবর্তনও মাথায় রাখুন।

রান তুলনা

রানবেঞ্চমার্ক কভারেজস্কোরধারাবাহিকতানির্ভরযোগ্যতাসঠিক টেস্টঅস্থির টেস্টমোট আউটপুট টোকেনমোট ইনপুট টোকেনমোট খরচপ্রতিক্রিয়া সময় (গড়)
2026-07-16 22:37 · নতুন টেস্ট যোগ হয়েছে66/66 প্রচেষ্টা6.99.010.011/2234,35778,593$0.5242.16s
2026-07-09 21:15 · প্রথম রান63/63 প্রচেষ্টা6.39.010.010/2131,77634,218$0.2251.66s
পার্থক্য+0.60.00.0+10+2581+44375+$0.300+507ms

বেঞ্চমার্ক কভারেজ আলাদা: 66/66 প্রচেষ্টা (লক্ষ্য: প্রতি টেস্টে 3টি পুনরাবৃত্তি) বনাম 63/63 প্রচেষ্টা (লক্ষ্য: প্রতি টেস্টে 3টি পুনরাবৃত্তি)। মোট মান ও পুনরাবৃত্তি-সংবেদনশীল মেট্রিক সরাসরি তুলনাযোগ্য নয়।

এই দুই রান ভিন্ন বেঞ্চমার্ক স্যুইট ব্যবহার করেছে, তাই পার্থক্যগুলোতে মডেল পরিবর্তন এবং স্যুইট পরিবর্তন দুটোই ধরা পড়ে।

মূল্যের ইতিহাস

OpenRouter থেকে এই মডেলের ঐতিহাসিক মূল্য তথ্য।

তারিখ ইনপুট মূল্য আউটপুট মূল্য
2026-07-09 21:18 $5.000 / 1M $30.000 / 1M

চার্ট

প্রথম মডেলটি নির্বাচন করুন, তারপর দ্বিতীয় মডেলে ক্লিক করে পাশাপাশি তুলনা পৃষ্ঠা খুলুন।

মোট আউটপুট টোকেন

স্কোর vs মোট আউটপুট টোকেন

দ্রুত তুলনা

বিভাগভিত্তিক বিশ্লেষণ

বিভাগ স্কোর ধারাবাহিকতা সঠিক টেস্ট
অ্যান্টি-এআই কৌশল 8.3 10.0
কোডিং 5.5 10.0
সমন্বিত 6.5 10.0
ডেটা পার্সিং ও নিষ্কাশন 10.0 10.0
ডোমেইন-নির্দিষ্ট 3.6 7.2
Sadharon Buddhimotta 6.5 3.4
নির্দেশনা অনুসরণ 8.5 6.8
ধাঁধা সমাধান 7.7 10.0
টুল কলিং 10.0 10.0
সাধারণ জ্ঞান 3.0 10.0

তুলনা করা মডেল