সমন্বিত: ভুল উত্তর
সমন্বিত
ভুল উত্তর
দেখুন সমন্বিত এ কোন AI মডেলগুলোর ভুল উত্তর হওয়ার সম্ভাবনা সবচেয়ে বেশি, যাতে দুর্বল দিক দ্রুত ধরা যায়। সাজান: সঠিক টেস্ট ↓.
ব্যর্থতার কারণ
90/90
মডেল ফিল্টার করুন
বর্তমান অনুসন্ধান ও ফিল্টারের সাথে কোনো মডেল মেলেনি।
| র্যাঙ্ক | মডেল | কোম্পানি | ভুল উত্তর সংখ্যা | বিভাগ স্কোর | মোট খরচ | সঠিক টেস্ট | প্রতিক্রিয়া সময় (গড়) |
|---|---|---|---|---|---|---|---|
| #38 | Gemini 3.6 Flash low | 1 | 7.3 | $0.251 | 1/2 | 19.8s | |
| #51 | Grok 4.5 low | X AI | 1 | 6.5 | $0.945 | 1/2 | 12.8s |
| #106 | Qwen3.7 Max none | Qwen | 1 | 6.5 | $0.197 | 1/2 | 37.2s |
| #107 | Kimi K2.7 Code medium | Moonshot AI | 1 | 7.3 | $0.687 | 1/2 | 66.0s |
| #111 | Grok 4.6 low | X AI | 1 | 6.5 | $0.449 | 1/2 | 23.3s |
| #114 | GLM 5.3 high | Z.ai | 1 | 6.4 | $0.403 | 1/2 | 64.0s |
| #132 | GPT-5.6 Sol none | OpenAI | 1 | 6.5 | $0.201 | 1/2 | 8.37s |
| #135 | GPT-5.5 none | OpenAI | 1 | 6.5 | $0.544 | 1/2 | 8.90s |
| #163 | Qwen3.5-27B none | Qwen | 1 | 6.4 | $0.058 | 1/2 | 39.4s |
| #169 | Qwen3.5 Plus 2026-02-15 none | Qwen | 1 | 6.5 | $0.073 | 1/2 | 64.8s |
| #174 | Qwen3.6 Max Preview none | Qwen | 1 | 6.5 | $0.228 | 1/2 | 61.6s |
| #177 | LongCat 2.0 none | Meituan | 1 | 6.5 | $0.044 | 1/2 | 28.4s |
| #197 | Qwen3.5 Plus 2026-04-20 none | Qwen | 1 | 6.4 | $0.122 | 1/2 | 109.7s |
| #212 | GPT-5.4 Mini none | OpenAI | 1 | 6.5 | $0.095 | 1/2 | 6.22s |
| #249 | Ling-2.6-1T none | Inclusionai | 1 | 6.5 | $0.016 | 1/2 | 23.8s |