- স্কোর
- 8.6 (+1.16 পয়েন্ট)
- মোট খরচ (বর্তমান মূল্য)
- $0.061 · 6.2% সস্তা
- প্রতিক্রিয়া সময় (গড়)
- 7.51s · 22.1% দ্রুত
সারাংশ
GPT-5.6 Luna AI BENCHY-তে 7.4 স্কোর করে এবং #132 স্থানে আছে। এর reliability 10.0, pass rate 62.3%, মোট খরচ $0.065, এবং গড় response time 9.64s.
GPT-5.6 Luna কে আলাদা করে যা: এটি সমন্বিত-তে সবচেয়ে ভালোভাবে নজর কাড়ে, যেখানে এর rank #1; আর ডোমেইন-নির্দিষ্ট এর দুর্বলতম ক্ষেত্র, rank #15. একই ধরনের মডেলের তুলনায় এটি লক্ষণীয়ভাবে দ্রুত।
প্রস্তাবিত বিকল্প
এর বদলে এই মডেল বেছে নেওয়ার পরামর্শ দিই:
মডেলের তথ্য
গবেষণার তারিখ: 2026-08-12
- প্যারামিটার
- ~400B মোট (~17B সক্রিয়)
- আর্কিটেকচার
- MoE
- উপলভ্যতা
- বন্ধ উৎস
- লাইসেন্স
- -
সর্বজনীন তথ্যপ্রমাণের ভিত্তিতে সেরা অনুমান; প্রদানকারী সব মান প্রকাশ করেনি।
7.4
ধারাবাহিকতা
9.0
10.0
মোট আউটপুট টোকেন
47,986
মোট ইনপুট টোকেন
212,780
ইনপুট মূল্য
$0.200 / 1M
আউটপুট মূল্য
$1.200 / 1M
ক্যাশ পড়ার মূল্য
$0.020 / 1M
ক্যাশ লেখার মূল্য
$0.250 / 1M
ক্যাশের মূল্য ইনপুট টোকেনের জন্য প্রযোজ্য। পড়ার সময় ক্যাশ করা প্রম্পট আবার ব্যবহার হয়; লেখার সময় সেগুলি সংরক্ষিত হয় এবং বাড়তি খরচ হতে পারে। আউটপুট টোকেনের জন্য আউটপুট মূল্য প্রযোজ্য।
অস্থির টেস্ট
3
অস্থির টেস্টে রানভেদে মিশ্র ফল হয়েছে (কমপক্ষে একটি পাস এবং একটি ফেল)।
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#132 GPT-5.6 Luna
medium- খরচ
- $0.014
- সময়
- 14.6s
- টোকেন
- 2,362 tok
রান ইতিহাস
| পরীক্ষিত হয়েছে | স্কোর | নির্ভরযোগ্যতা | সঠিক টেস্ট | মোট খরচ | তুলনা করুন |
|---|---|---|---|---|---|
| 2026-10-01 01:49 পুনরায় পরীক্ষা | 7.4 | 10.0 | $0.065 ↓ | বর্তমান রান | |
| 2026-07-16 22:37 নতুন টেস্ট যোগ হয়েছে | 7.6 | 10.0 | $0.352 | তুলনা করুন | |
| 2026-07-09 21:16 প্রথম রান | 7.6 | 10.0 | $0.258 | তুলনা করুন |
এই রানটি ভিন্ন একটি বেঞ্চমার্ক স্যুইট ব্যবহার করেছে। ঐতিহাসিক পরিবর্তন পড়ার সময় স্যুইট পরিবর্তনও মাথায় রাখুন।
রান তুলনা
| রান | বেঞ্চমার্ক কভারেজ | স্কোর | ধারাবাহিকতা | নির্ভরযোগ্যতা | সঠিক টেস্ট | অস্থির টেস্ট | মোট আউটপুট টোকেন | মোট ইনপুট টোকেন | মোট খরচ | প্রতিক্রিয়া সময় (গড়) |
|---|---|---|---|---|---|---|---|---|---|---|
| 2026-10-01 01:49 · বর্তমান রান | 69/69 প্রচেষ্টা | 7.4 | 9.0 | 10.0 | 13/23 | 3 | 47,986 | 212,780 | $0.065 | 9.64s |
| 2026-07-16 22:37 · নতুন টেস্ট যোগ হয়েছে | 66/66 প্রচেষ্টা | 7.6 | 9.6 | 10.0 | 14/22 | 1 | 43,679 | 89,676 | $0.352 | 7.28s |
| পার্থক্য | — | -0.1 | -0.6 | 0.0 | -1 | +2 | +4307 | +123104 | -$0.288 | +2351ms |
বেঞ্চমার্ক কভারেজ আলাদা: 69/69 প্রচেষ্টা (লক্ষ্য: প্রতি টেস্টে 3টি পুনরাবৃত্তি) বনাম 66/66 প্রচেষ্টা (লক্ষ্য: প্রতি টেস্টে 3টি পুনরাবৃত্তি)। মোট মান ও পুনরাবৃত্তি-সংবেদনশীল মেট্রিক সরাসরি তুলনাযোগ্য নয়।
এই দুই রান ভিন্ন বেঞ্চমার্ক স্যুইট ব্যবহার করেছে, তাই পার্থক্যগুলোতে মডেল পরিবর্তন এবং স্যুইট পরিবর্তন দুটোই ধরা পড়ে।
মূল্যের ইতিহাস
OpenRouter থেকে এই মডেলের ঐতিহাসিক মূল্য তথ্য।
| তারিখ | ইনপুট মূল্য | আউটপুট মূল্য | ক্যাশ পড়ার মূল্য | ক্যাশ লেখার মূল্য |
|---|---|---|---|---|
| 2026-07-09 21:18 | $1.000 / 1M | $6.000 / 1M | প্রযোজ্য নয় | প্রযোজ্য নয় |
| 2026-07-28 08:40 | $0.500 / 1M | $3.000 / 1M | প্রযোজ্য নয় | প্রযোজ্য নয় |
| 2026-07-31 10:14 | $0.100 / 1M | $0.601 / 1M | প্রযোজ্য নয় | প্রযোজ্য নয় |
| 2026-08-14 12:51 | $0.100 / 1M | $0.600 / 1M | প্রযোজ্য নয় | প্রযোজ্য নয় |
| 2026-10-01 18:33 | $0.200 / 1M | $1.200 / 1M | $0.020 / 1M | $0.250 / 1M |
চার্ট
প্রথম মডেলটি নির্বাচন করুন, তারপর দ্বিতীয় মডেলে ক্লিক করে পাশাপাশি তুলনা পৃষ্ঠা খুলুন।
স্কোর অনুযায়ী শীর্ষ মডেল
স্কোর vs মোট খরচ
প্রতিক্রিয়া সময় (গড়)
স্কোর vs প্রতিক্রিয়া সময় (গড়)
মোট আউটপুট টোকেন
স্কোর vs মোট আউটপুট টোকেন
দ্রুত তুলনা
বিভাগভিত্তিক বিশ্লেষণ
| বিভাগ | স্কোর | ধারাবাহিকতা | সঠিক টেস্ট |
|---|---|---|---|
| স্বায়ত্তশাসিত এজেন্টের কাজ | 7.4 | 3.8 | |
| অ্যান্টি-এআই কৌশল | 8.3 | 10.0 | |
| কোডিং | 5.4 | 7.2 | |
| সমন্বিত | 10.0 | 10.0 | |
| ডেটা পার্সিং ও নিষ্কাশন | 10.0 | 10.0 | |
| ডোমেইন-নির্দিষ্ট | 2.9 | 7.2 | |
| Sadharon Buddhimotta | 5.1 | 10.0 | |
| নির্দেশনা অনুসরণ | 9.9 | 10.0 | |
| ধাঁধা সমাধান | 7.8 | 10.0 | |
| টুল কলিং | 10.0 | 10.0 | |
| সাধারণ জ্ঞান | 3.0 | 10.0 |