- স্কোর
- 8.6 (+1.34 পয়েন্ট)
- মোট খরচ (বর্তমান মূল্য)
- $0.061 · 47.6% সস্তা
- প্রতিক্রিয়া সময় (গড়)
- 7.51s · 24.7% দ্রুত
সারাংশ
Qwen3.5-27B AI BENCHY-তে 7.2 স্কোর করে এবং #149 স্থানে আছে। এর reliability 10.0, pass rate 47.8%, মোট খরচ $0.116, এবং গড় response time 9.98s.
Qwen3.5-27B কে আলাদা করে যা: এটি স্বায়ত্তশাসিত এজেন্টের কাজ-তে সবচেয়ে ভালোভাবে নজর কাড়ে, যেখানে এর rank #1; আর অ্যান্টি-এআই কৌশল এর দুর্বলতম ক্ষেত্র, rank #17.
প্রস্তাবিত বিকল্প
এর বদলে এই মডেল বেছে নেওয়ার পরামর্শ দিই:
মডেলের তথ্য
গবেষণার তারিখ: 2026-08-12
- প্যারামিটার
- 27B
- আর্কিটেকচার
- ঘন
- উপলভ্যতা
- উন্মুক্ত উৎস
- লাইসেন্স
- Apache-2.0
7.2
ধারাবাহিকতা
9.4
10.0
$0.116
মোট আউটপুট টোকেন
36,422
মোট ইনপুট টোকেন
283,977
ইনপুট মূল্য
$0.195 / 1M
আউটপুট মূল্য
$1.560 / 1M
ক্যাশ পড়ার মূল্য
প্রযোজ্য নয়
ক্যাশ লেখার মূল্য
প্রযোজ্য নয়
ক্যাশের মূল্য ইনপুট টোকেনের জন্য প্রযোজ্য। পড়ার সময় ক্যাশ করা প্রম্পট আবার ব্যবহার হয়; লেখার সময় সেগুলি সংরক্ষিত হয় এবং বাড়তি খরচ হতে পারে। আউটপুট টোকেনের জন্য আউটপুট মূল্য প্রযোজ্য।
অস্থির টেস্ট
2
অস্থির টেস্টে রানভেদে মিশ্র ফল হয়েছে (কমপক্ষে একটি পাস এবং একটি ফেল)।
9.98s
প্রতিক্রিয়া সময় (সর্বোচ্চ): 124.53s
প্রতিক্রিয়া সময় (মোট): 229.52s
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#149 Qwen3.5-27B
none- খরচ
- $0.007
- সময়
- 42.9s
- টোকেন
- 4,273 tok
রান ইতিহাস
| পরীক্ষিত হয়েছে | স্কোর | নির্ভরযোগ্যতা | সঠিক টেস্ট | মোট খরচ | তুলনা করুন |
|---|---|---|---|---|---|
| 2026-10-01 01:05 পুনরায় পরীক্ষা | 7.2 | 10.0 | $0.116 | বর্তমান রান | |
| 2026-07-16 22:01 নতুন টেস্ট যোগ হয়েছে | 6.5 | 10.0 | $0.058 ↓ | তুলনা করুন | |
| 2026-06-04 13:28 নতুন টেস্ট যোগ হয়েছে | 5.7 | 10.0 | $0.015 ↓ | তুলনা করুন | |
| 2026-05-21 23:59 স্যুইট পরিবর্তিত হয়েছে | 5.8 | 10.0 | $0.017 | তুলনা করুন | |
| 2026-04-11 01:19 প্রথম নথিভুক্ত রান | 5.9 | প্রযোজ্য নয় | $0.016 | তুলনা করুন |
এই রানটি ভিন্ন একটি বেঞ্চমার্ক স্যুইট ব্যবহার করেছে। ঐতিহাসিক পরিবর্তন পড়ার সময় স্যুইট পরিবর্তনও মাথায় রাখুন।
রান তুলনা
| রান | বেঞ্চমার্ক কভারেজ | স্কোর | ধারাবাহিকতা | নির্ভরযোগ্যতা | সঠিক টেস্ট | অস্থির টেস্ট | মোট আউটপুট টোকেন | মোট ইনপুট টোকেন | মোট খরচ | প্রতিক্রিয়া সময় (গড়) |
|---|---|---|---|---|---|---|---|---|---|---|
| 2026-10-01 01:05 · বর্তমান রান | 69/69 প্রচেষ্টা | 7.2 | 9.4 | 10.0 | 10/23 | 2 | 36,422 | 283,977 | $0.116 | 9.98s |
| 2026-04-11 01:19 · প্রথম নথিভুক্ত রান | 54/54 প্রচেষ্টা | 5.9 | 9.2 | প্রযোজ্য নয় | 6/18 | 2 | 3,545 | 0 | $0.016 | 1.74s |
| পার্থক্য | — | +1.4 | +0.2 | +4 | 0 | +32877 | +283977 | +$0.100 | +8239ms |
বেঞ্চমার্ক কভারেজ আলাদা: 69/69 প্রচেষ্টা (লক্ষ্য: প্রতি টেস্টে 3টি পুনরাবৃত্তি) বনাম 54/54 প্রচেষ্টা (লক্ষ্য: প্রতি টেস্টে 3টি পুনরাবৃত্তি)। মোট মান ও পুনরাবৃত্তি-সংবেদনশীল মেট্রিক সরাসরি তুলনাযোগ্য নয়।
এই দুই রান ভিন্ন বেঞ্চমার্ক স্যুইট ব্যবহার করেছে, তাই পার্থক্যগুলোতে মডেল পরিবর্তন এবং স্যুইট পরিবর্তন দুটোই ধরা পড়ে।
চার্ট
প্রথম মডেলটি নির্বাচন করুন, তারপর দ্বিতীয় মডেলে ক্লিক করে পাশাপাশি তুলনা পৃষ্ঠা খুলুন।
স্কোর অনুযায়ী শীর্ষ মডেল
স্কোর vs মোট খরচ
প্রতিক্রিয়া সময় (গড়)
স্কোর vs প্রতিক্রিয়া সময় (গড়)
মোট আউটপুট টোকেন
স্কোর vs মোট আউটপুট টোকেন
দ্রুত তুলনা
বিভাগভিত্তিক বিশ্লেষণ
| বিভাগ | স্কোর | ধারাবাহিকতা | সঠিক টেস্ট |
|---|---|---|---|
| স্বায়ত্তশাসিত এজেন্টের কাজ | 10.0 | 10.0 | |
| অ্যান্টি-এআই কৌশল | 4.8 | 10.0 | |
| কোডিং | 5.8 | 10.0 | |
| সমন্বিত | 6.4 | 5.8 | |
| ডেটা পার্সিং ও নিষ্কাশন | 10.0 | 10.0 | |
| ডোমেইন-নির্দিষ্ট | 5.3 | 10.0 | |
| Sadharon Buddhimotta | 5.0 | 10.0 | |
| নির্দেশনা অনুসরণ | 6.3 | 10.0 | |
| ধাঁধা সমাধান | 6.7 | 7.9 | |
| টুল কলিং | 10.0 | 10.0 | |
| সাধারণ জ্ঞান | 3.0 | 10.0 |