#110 GPT-5.6 Luna
low- খরচ
- $0.011
- সময়
- 10.2s
- টোকেন
- 1,897 tok
সারাংশ
GPT-5.6 Luna AI BENCHY-তে 6.2 স্কোর করে এবং #110 স্থানে আছে। এর reliability 10.0, pass rate 56.1%, মোট খরচ $0.249, এবং গড় response time 5.04s.
GPT-5.6 Luna কে আলাদা করে যা: একই ধরনের মডেলের তুলনায় এটি লক্ষণীয়ভাবে দ্রুত।
গবেষণার তারিখ: 2026-08-12
সর্বজনীন তথ্যপ্রমাণের ভিত্তিতে সেরা অনুমান; প্রদানকারী সব মান প্রকাশ করেনি।
6.2
ধারাবাহিকতা
8.2
10.0
$0.249
মোট আউটপুট টোকেন
25,438
মোট ইনপুট টোকেন
96,346
ইনপুট মূল্য
$1.000 / 1M
আউটপুট মূল্য
$6.000 / 1M
ক্যাশ পড়ার মূল্য
প্রযোজ্য নয়
ক্যাশ লেখার মূল্য
প্রযোজ্য নয়
ক্যাশের মূল্য ইনপুট টোকেনের জন্য প্রযোজ্য। পড়ার সময় ক্যাশ করা প্রম্পট আবার ব্যবহার হয়; লেখার সময় সেগুলি সংরক্ষিত হয় এবং বাড়তি খরচ হতে পারে। আউটপুট টোকেনের জন্য আউটপুট মূল্য প্রযোজ্য।
অস্থির টেস্ট
5
অস্থির টেস্টে রানভেদে মিশ্র ফল হয়েছে (কমপক্ষে একটি পাস এবং একটি ফেল)।
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
রান ইতিহাস
| পরীক্ষিত হয়েছে | স্কোর | নির্ভরযোগ্যতা | সঠিক টেস্ট | মোট খরচ | তুলনা করুন |
|---|---|---|---|---|---|
| 2026-08-14 02:19 পুনরায় পরীক্ষা | 6.2 | 10.0 | $0.026 ↓ | তুলনা করুন | |
| 2026-07-16 22:37 নতুন টেস্ট যোগ হয়েছে | 6.2 | 10.0 | $0.249 | বর্তমান রান | |
| 2026-07-09 21:16 প্রথম রান | 6.2 | 10.0 | $0.141 | তুলনা করুন |
এই রানটি ভিন্ন একটি বেঞ্চমার্ক স্যুইট ব্যবহার করেছে। ঐতিহাসিক পরিবর্তন পড়ার সময় স্যুইট পরিবর্তনও মাথায় রাখুন।
রান তুলনা
| রান | বেঞ্চমার্ক কভারেজ | স্কোর | ধারাবাহিকতা | নির্ভরযোগ্যতা | সঠিক টেস্ট | অস্থির টেস্ট | মোট আউটপুট টোকেন | মোট ইনপুট টোকেন | মোট খরচ | প্রতিক্রিয়া সময় (গড়) |
|---|---|---|---|---|---|---|---|---|---|---|
| 2026-07-16 22:37 · নতুন টেস্ট যোগ হয়েছে | 66/66 প্রচেষ্টা | 6.2 | 8.2 | 10.0 | 10/22 | 5 | 25,438 | 96,346 | $0.249 | 5.04s |
| 2026-07-09 21:16 · প্রথম রান | 63/63 প্রচেষ্টা | 6.2 | 8.5 | 10.0 | 10/21 | 4 | 17,681 | 34,218 | $0.141 | 4.35s |
| পার্থক্য | — | 0.0 | -0.3 | 0.0 | 0 | +1 | +7757 | +62128 | +$0.109 | +686ms |
বেঞ্চমার্ক কভারেজ আলাদা: 66/66 প্রচেষ্টা (লক্ষ্য: প্রতি টেস্টে 3টি পুনরাবৃত্তি) বনাম 63/63 প্রচেষ্টা (লক্ষ্য: প্রতি টেস্টে 3টি পুনরাবৃত্তি)। মোট মান ও পুনরাবৃত্তি-সংবেদনশীল মেট্রিক সরাসরি তুলনাযোগ্য নয়।
এই দুই রান ভিন্ন বেঞ্চমার্ক স্যুইট ব্যবহার করেছে, তাই পার্থক্যগুলোতে মডেল পরিবর্তন এবং স্যুইট পরিবর্তন দুটোই ধরা পড়ে।
মূল্যের ইতিহাস
OpenRouter থেকে এই মডেলের ঐতিহাসিক মূল্য তথ্য।
| তারিখ | ইনপুট মূল্য | আউটপুট মূল্য | ক্যাশ পড়ার মূল্য | ক্যাশ লেখার মূল্য |
|---|---|---|---|---|
| 2026-07-09 21:18 | $1.000 / 1M | $6.000 / 1M | প্রযোজ্য নয় | প্রযোজ্য নয় |
প্রথম মডেলটি নির্বাচন করুন, তারপর দ্বিতীয় মডেলে ক্লিক করে পাশাপাশি তুলনা পৃষ্ঠা খুলুন।
| বিভাগ | স্কোর | ধারাবাহিকতা | সঠিক টেস্ট |
|---|---|---|---|
| অ্যান্টি-এআই কৌশল | 8.3 | 10.0 | |
| কোডিং | 5.5 | 10.0 | |
| সমন্বিত | 2.8 | 1.6 | |
| ডেটা পার্সিং ও নিষ্কাশন | 10.0 | 10.0 | |
| ডোমেইন-নির্দিষ্ট | 3.6 | 7.2 | |
| Sadharon Buddhimotta | 5.0 | 10.0 | |
| নির্দেশনা অনুসরণ | 8.5 | 6.8 | |
| ধাঁধা সমাধান | 7.6 | 7.2 | |
| টুল কলিং | 10.0 | 10.0 | |
| সাধারণ জ্ঞান | 3.0 | 10.0 |