#94 Qwen3 Coder Next
none- খরচ
- $0.058
- সময়
- 246.3s
- টোকেন
- 64,126 tok
সারাংশ
Qwen3 Coder Next AI BENCHY-তে 5.1 স্কোর করে এবং #94 স্থানে আছে। এর reliability প্রযোজ্য নয়, pass rate 25.9%, মোট খরচ $0.008, এবং গড় response time 10.18s.
Qwen3 Coder Next কে আলাদা করে যা: এটি ডোমেইন-নির্দিষ্ট-তে সবচেয়ে ভালোভাবে নজর কাড়ে, যেখানে এর rank #4; আর অ্যান্টি-এআই কৌশল এর দুর্বলতম ক্ষেত্র, rank #18. এই score range-এর জন্য মোট benchmark খরচ অস্বাভাবিকভাবে কম।
গবেষণার তারিখ: 2026-08-12
5.1
ধারাবাহিকতা
9.7
প্রযোজ্য নয়
$0.008
মোট আউটপুট টোকেন
3,617
মোট ইনপুট টোকেন
0
ইনপুট মূল্য
$0.150 / 1M
আউটপুট মূল্য
$0.800 / 1M
অস্থির টেস্ট
1
অস্থির টেস্টে রানভেদে মিশ্র ফল হয়েছে (কমপক্ষে একটি পাস এবং একটি ফেল)।
10.18s
প্রতিক্রিয়া সময় (সর্বোচ্চ): 45.14s
প্রতিক্রিয়া সময় (মোট): 122.13s
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
রান ইতিহাস
| পরীক্ষিত হয়েছে | স্কোর | নির্ভরযোগ্যতা | সঠিক টেস্ট | মোট খরচ | তুলনা করুন |
|---|---|---|---|---|---|
| 2026-08-14 01:38 পুনরায় পরীক্ষা | 5.1 | 10.0 | $0.026 ↑ | তুলনা করুন | |
| 2026-07-16 21:14 নতুন টেস্ট যোগ হয়েছে | 5.1 | 10.0 | $0.025 ↓ | তুলনা করুন | |
| 2026-06-04 13:09 নতুন টেস্ট যোগ হয়েছে | 4.9 | 10.0 | $0.009 ↓ | তুলনা করুন | |
| 2026-05-21 23:44 স্যুইট পরিবর্তিত হয়েছে | 5.1 | 10.0 | $0.008 | তুলনা করুন | |
| 2026-04-14 00:56 প্রথম নথিভুক্ত রান | 5.1 | প্রযোজ্য নয় | $0.008 | বর্তমান রান |
রান তুলনা
| রান | বেঞ্চমার্ক কভারেজ | স্কোর | ধারাবাহিকতা | নির্ভরযোগ্যতা | সঠিক টেস্ট | অস্থির টেস্ট | মোট আউটপুট টোকেন | মোট ইনপুট টোকেন | মোট খরচ | প্রতিক্রিয়া সময় (গড়) |
|---|---|---|---|---|---|---|---|---|---|---|
| 2026-04-14 00:56 · প্রথম নথিভুক্ত রান | 54/54 প্রচেষ্টা | 5.1 | 9.7 | প্রযোজ্য নয় | 4/18 | 1 | 3,617 | 0 | $0.008 | 10.18s |
| 2026-06-04 13:09 · নতুন টেস্ট যোগ হয়েছে | 63/63 প্রচেষ্টা | 4.9 | 9.7 | 10.0 | 5/21 | 1 | 3,584 | 47,507 | $0.009 | 8.62s |
| পার্থক্য | — | +0.2 | 0.0 | -1 | 0 | +33 | -47507 | -$0.001 | +1553ms |
বেঞ্চমার্ক কভারেজ আলাদা: 54/54 প্রচেষ্টা (লক্ষ্য: প্রতি টেস্টে 3টি পুনরাবৃত্তি) বনাম 63/63 প্রচেষ্টা (লক্ষ্য: প্রতি টেস্টে 3টি পুনরাবৃত্তি)। মোট মান ও পুনরাবৃত্তি-সংবেদনশীল মেট্রিক সরাসরি তুলনাযোগ্য নয়।
এই দুই রান ভিন্ন বেঞ্চমার্ক স্যুইট ব্যবহার করেছে, তাই পার্থক্যগুলোতে মডেল পরিবর্তন এবং স্যুইট পরিবর্তন দুটোই ধরা পড়ে।
প্রথম মডেলটি নির্বাচন করুন, তারপর দ্বিতীয় মডেলে ক্লিক করে পাশাপাশি তুলনা পৃষ্ঠা খুলুন।
| বিভাগ | স্কোর | ধারাবাহিকতা | সঠিক টেস্ট |
|---|---|---|---|
| অ্যান্টি-এআই কৌশল | 3.6 | 10.0 | |
| কোডিং | 7.3 | 3.7 | |
| সমন্বিত | 3.0 | 10.0 | |
| ডেটা পার্সিং ও নিষ্কাশন | 6.5 | 10.0 | |
| ডোমেইন-নির্দিষ্ট | 5.3 | 10.0 | |
| Sadharon Buddhimotta | 10.0 | 10.0 | |
| নির্দেশনা অনুসরণ | 4.8 | 10.0 | |
| ধাঁধা সমাধান | 3.2 | 10.0 | |
| টুল কলিং | 10.0 | 10.0 |