কোডিং: ভুল উত্তর
কোডিং
ভুল উত্তর
দেখুন কোডিং এ কোন AI মডেলগুলোর ভুল উত্তর হওয়ার সম্ভাবনা সবচেয়ে বেশি, যাতে দুর্বল দিক দ্রুত ধরা যায়।
ব্যর্থতার কারণ
265/265
মডেল ফিল্টার করুন
বর্তমান অনুসন্ধান ও ফিল্টারের সাথে কোনো মডেল মেলেনি।
| র্যাঙ্ক | মডেল | কোম্পানি | ভুল উত্তর সংখ্যা | বিভাগ স্কোর | মোট খরচ | সঠিক টেস্ট | প্রতিক্রিয়া সময় (গড়) |
|---|---|---|---|---|---|---|---|
| #80 | Claude Haiku 5.5 high | Anthropic | 2 | 0.6 | $0.088 | 1/3 | 9.54s |
| #83 | GPT-6 Luna medium | OpenAI | 2 | 0.7 | $0.047 | 1/3 | 23.6s |
| #86 | Qwen3.7 Plus medium | Qwen | 2 | 0.6 | $0.415 | 1/3 | 108.6s |
| #89 | GPT-5.6 Terra medium | OpenAI | 2 | 0.6 | $0.483 | 1/3 | 7.19s |
| #91 | Seed-2.0-Code low | Bytedance Seed | 2 | 0.7 | $0.881 | 1/3 | 109.7s |
| #92 | DeepSeek V4 Pro 0423 high | DeepSeek | 2 | 0.6 | $0.149 | 1/3 | 243.0s |
| #96 | GPT-5.6 Luna high | OpenAI | 2 | 0.5 | $0.118 | 1/3 | 15.6s |
| #98 | GPT-5.4 Nano medium | OpenAI | 2 | 0.6 | $0.235 | 1/3 | 19.1s |
| #101 | GPT-5.6 Terra low | OpenAI | 2 | 0.7 | $0.435 | 1/3 | 9.56s |
| #102 | Qwen3.5-27B medium | Qwen | 2 | 0.6 | $1.135 | 1/3 | 160.7s |
| #106 | Qwen3.7 Max none | Qwen | 2 | 0.5 | $0.451 | 1/3 | 1.35s |
| #112 | GLM 5.3 high | Z.ai | 2 | 0.7 | $0.495 | 1/3 | 18.9s |
| #115 | Qwen3.7 Plus none | Qwen | 2 | 0.5 | $0.178 | 1/3 | 2.15s |
| #120 | Claude Haiku 5.5 medium | Anthropic | 2 | 0.6 | $0.063 | 1/3 | 7.16s |
| #121 | Qwen3.5 Plus 2026-04-20 medium | Qwen | 2 | 0.6 | $0.435 | 1/3 | 125.3s |