স্বায়ত্তশাসিত এজেন্টের কাজ র্যাঙ্কিং
দেখুন স্বায়ত্তশাসিত এজেন্টের কাজ এ কোন AI মডেল সবচেয়ে ভালো করে, কোনগুলো নির্ভরযোগ্য থাকে, আর সবচেয়ে বড় পার্থক্য কোথায় দেখা যায়। সাজান: মেট্রিক ↑.
380/380
মডেল ফিল্টার করুন
বর্তমান অনুসন্ধান ও ফিল্টারের সাথে কোনো মডেল মেলেনি।
| র্যাঙ্ক | মডেল | কোম্পানি | স্বায়ত্তশাসিত এজেন্টের কাজ স্কোর | স্কোর | মোট খরচ | সঠিক টেস্ট | প্রতিক্রিয়া সময় (গড়) |
|---|---|---|---|---|---|---|---|
| #314 | Mercury 2.5 Preview none | Inception | 3.9 | 4.7 | $0.023 | 0/1 | 85.0s |
| #321 | GPT-5.4 Nano none | OpenAI | 3.9 | 4.6 | $0.068 | 0/1 | 45.4s |
| #341 | GLM 4.7 Flash medium | Z.ai | 3.9 | 4.2 | $0.193 | 0/1 | 399.2s |
| #368 | Command A+ high | Cohere | 3.9 | 3.2 | $0.079 | 0/1 | 156.0s |
| #71 | Gemini 3.1 Pro Preview medium | 4.7 | 8.4 | $1.585 | 0/1 | 56.2s | |
| #124 | DeepSeek V4 Flash 0731 low | DeepSeek | 4.7 | 7.4 | $0.307 | 0/1 | 321.2s |
| #130 | Inkling medium | Thinkingmachines | 4.7 | 7.4 | $0.540 | 0/1 | 45.9s |
| #141 | Qwen3.8 27B medium | Qwen | 4.7 | 7.2 | ~$0.073 | 0/1 | 187.9s |
| #144 | Qwen3.7 Flash high | Qwen | 4.7 | 7.2 | $0.063 | 0/1 | 135.9s |
| #151 | MiMo-V2.6-Flash low | Xiaomi | 4.7 | 7.1 | $0.200 | 0/1 | 107.9s |
| #189 | Mercury 2 medium | Inception | 4.7 | 6.6 | $0.121 | 0/1 | 34.9s |
| #208 | MiMo-V2.5-Pro medium | Xiaomi | 4.7 | 6.4 | $0.502 | 0/1 | 233.5s |
| #257 | Dots 3 Note Preview medium | Dots Studio | 4.7 | 5.7 | $0.000 | 0/1 | 140.5s |
| #264 | Nemotron 3 Super medium | NVIDIA | 4.7 | 5.5 | $0.081 | 0/1 | 138.3s |
| #274 | Hy4 preview low | Tencent | 4.7 | 5.4 | $1.670 | 0/1 | 52.4s |