- স্কোর
- 5.2 (-0.13 পয়েন্ট)
- মোট খরচ (বর্তমান মূল্য)
- $0.004 · 91.8% সস্তা
- প্রতিক্রিয়া সময় (গড়)
- 3.40s · 10.0% দ্রুত
সারাংশ
GPT-5.6 Luna AI BENCHY-তে 5.3 স্কোর করে এবং #297 স্থানে আছে। এর reliability 10.0, pass rate 34.8%, মোট খরচ $0.042, এবং গড় response time 3.78s.
GPT-5.6 Luna কে আলাদা করে যা: এটি ধাঁধা সমাধান-তে সবচেয়ে ভালোভাবে নজর কাড়ে, যেখানে এর rank #3; আর কোডিং এর দুর্বলতম ক্ষেত্র, rank #12.
প্রস্তাবিত বিকল্প
এর বদলে এই মডেল বেছে নেওয়ার পরামর্শ দিই:
মডেলের তথ্য
গবেষণার তারিখ: 2026-08-12
- প্যারামিটার
- ~400B মোট (~17B সক্রিয়)
- আর্কিটেকচার
- MoE
- উপলভ্যতা
- বন্ধ উৎস
- লাইসেন্স
- -
সর্বজনীন তথ্যপ্রমাণের ভিত্তিতে সেরা অনুমান; প্রদানকারী সব মান প্রকাশ করেনি।
5.3
ধারাবাহিকতা
8.8
10.0
মোট আউটপুট টোকেন
8,000
মোট ইনপুট টোকেন
230,744
ইনপুট মূল্য
$0.200 / 1M
আউটপুট মূল্য
$1.200 / 1M
ক্যাশ পড়ার মূল্য
$0.020 / 1M
ক্যাশ লেখার মূল্য
$0.250 / 1M
ক্যাশের মূল্য ইনপুট টোকেনের জন্য প্রযোজ্য। পড়ার সময় ক্যাশ করা প্রম্পট আবার ব্যবহার হয়; লেখার সময় সেগুলি সংরক্ষিত হয় এবং বাড়তি খরচ হতে পারে। আউটপুট টোকেনের জন্য আউটপুট মূল্য প্রযোজ্য।
অস্থির টেস্ট
3
অস্থির টেস্টে রানভেদে মিশ্র ফল হয়েছে (কমপক্ষে একটি পাস এবং একটি ফেল)।
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#297 GPT-5.6 Luna
none- খরচ
- $0.016
- সময়
- 15.8s
- টোকেন
- 2,685 tok
রান ইতিহাস
| পরীক্ষিত হয়েছে | স্কোর | নির্ভরযোগ্যতা | সঠিক টেস্ট | মোট খরচ | তুলনা করুন |
|---|---|---|---|---|---|
| 2026-10-01 01:48 পুনরায় পরীক্ষা | 5.3 | 10.0 | $0.042 ↓ | বর্তমান রান | |
| 2026-07-16 22:36 নতুন টেস্ট যোগ হয়েছে | 5.4 | 10.0 | $0.142 | তুলনা করুন | |
| 2026-07-09 21:15 প্রথম রান | 5.3 | 10.0 | $0.047 | তুলনা করুন |
এই রানটি ভিন্ন একটি বেঞ্চমার্ক স্যুইট ব্যবহার করেছে। ঐতিহাসিক পরিবর্তন পড়ার সময় স্যুইট পরিবর্তনও মাথায় রাখুন।
রান তুলনা
| রান | বেঞ্চমার্ক কভারেজ | স্কোর | ধারাবাহিকতা | নির্ভরযোগ্যতা | সঠিক টেস্ট | অস্থির টেস্ট | মোট আউটপুট টোকেন | মোট ইনপুট টোকেন | মোট খরচ | প্রতিক্রিয়া সময় (গড়) |
|---|---|---|---|---|---|---|---|---|---|---|
| 2026-10-01 01:48 · বর্তমান রান | 69/69 প্রচেষ্টা | 5.3 | 8.8 | 10.0 | 6/23 | 3 | 8,000 | 230,744 | $0.042 | 3.78s |
| 2026-07-16 22:36 · নতুন টেস্ট যোগ হয়েছে | 66/66 প্রচেষ্টা | 5.4 | 8.8 | 10.0 | 6/22 | 3 | 6,709 | 101,323 | $0.142 | 1.50s |
| পার্থক্য | — | 0.0 | 0.0 | 0.0 | 0 | 0 | +1291 | +129421 | -$0.100 | +2279ms |
বেঞ্চমার্ক কভারেজ আলাদা: 69/69 প্রচেষ্টা (লক্ষ্য: প্রতি টেস্টে 3টি পুনরাবৃত্তি) বনাম 66/66 প্রচেষ্টা (লক্ষ্য: প্রতি টেস্টে 3টি পুনরাবৃত্তি)। মোট মান ও পুনরাবৃত্তি-সংবেদনশীল মেট্রিক সরাসরি তুলনাযোগ্য নয়।
এই দুই রান ভিন্ন বেঞ্চমার্ক স্যুইট ব্যবহার করেছে, তাই পার্থক্যগুলোতে মডেল পরিবর্তন এবং স্যুইট পরিবর্তন দুটোই ধরা পড়ে।
মূল্যের ইতিহাস
OpenRouter থেকে এই মডেলের ঐতিহাসিক মূল্য তথ্য।
| তারিখ | ইনপুট মূল্য | আউটপুট মূল্য | ক্যাশ পড়ার মূল্য | ক্যাশ লেখার মূল্য |
|---|---|---|---|---|
| 2026-07-09 21:18 | $1.000 / 1M | $6.000 / 1M | প্রযোজ্য নয় | প্রযোজ্য নয় |
| 2026-07-28 08:40 | $0.500 / 1M | $3.000 / 1M | প্রযোজ্য নয় | প্রযোজ্য নয় |
| 2026-07-31 10:14 | $0.100 / 1M | $0.601 / 1M | প্রযোজ্য নয় | প্রযোজ্য নয় |
| 2026-08-14 12:51 | $0.100 / 1M | $0.600 / 1M | প্রযোজ্য নয় | প্রযোজ্য নয় |
| 2026-10-01 18:33 | $0.200 / 1M | $1.200 / 1M | $0.020 / 1M | $0.250 / 1M |
চার্ট
প্রথম মডেলটি নির্বাচন করুন, তারপর দ্বিতীয় মডেলে ক্লিক করে পাশাপাশি তুলনা পৃষ্ঠা খুলুন।
স্কোর অনুযায়ী শীর্ষ মডেল
স্কোর vs মোট খরচ
প্রতিক্রিয়া সময় (গড়)
স্কোর vs প্রতিক্রিয়া সময় (গড়)
মোট আউটপুট টোকেন
স্কোর vs মোট আউটপুট টোকেন
দ্রুত তুলনা
বিভাগভিত্তিক বিশ্লেষণ
| বিভাগ | স্কোর | ধারাবাহিকতা | সঠিক টেস্ট |
|---|---|---|---|
| স্বায়ত্তশাসিত এজেন্টের কাজ | 5.0 | 10.0 | |
| অ্যান্টি-এআই কৌশল | 4.8 | 10.0 | |
| কোডিং | 3.8 | 7.2 | |
| সমন্বিত | 3.2 | 9.1 | |
| ডেটা পার্সিং ও নিষ্কাশন | 10.0 | 10.0 | |
| ডোমেইন-নির্দিষ্ট | 3.6 | 7.2 | |
| Sadharon Buddhimotta | 5.0 | 10.0 | |
| নির্দেশনা অনুসরণ | 7.1 | 5.8 | |
| ধাঁধা সমাধান | 5.3 | 10.0 | |
| টুল কলিং | 10.0 | 10.0 | |
| সাধারণ জ্ঞান | 3.0 | 10.0 |