कोडिंग: गलत उत्तर
कोडिंग
गलत उत्तर
देखें कि कोडिंग में किन AI मॉडलों में गलत उत्तर आने की सबसे अधिक संभावना है, ताकि आप कमजोरियाँ जल्दी पहचान सकें।
विफलता के कारण
265/265
मॉडल फ़िल्टर करें
मौजूदा खोज और फ़िल्टर से कोई मॉडल मेल नहीं खाता।
| रैंक | मॉडल | कंपनी | गलत उत्तर संख्या | श्रेणी स्कोर | कुल लागत | सही परीक्षण | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|---|
| #319 | Mercury 2.5 Preview low | Inception | 2 | 0.5 | $0.015 | 1/3 | 972ms |
| #321 | Dots 3 Note Preview default | Dots Studio | 2 | 0.5 | $0.000 | 0/3 | 6.12s |
| #330 | MiMo-V2.5 none | Xiaomi | 2 | 0.5 | $0.049 | 1/3 | 3.24s |
| #332 | Hy4 preview none | Tencent | 2 | 0.4 | $0.165 | 0/3 | 45.5s |
| #341 | Qwen3 Coder Next medium | Qwen | 2 | 0.4 | $0.071 | 0/3 | 924ms |
| #342 | DeepSeek V3.2 none | DeepSeek | 2 | 0.3 | $0.119 | 0/3 | 14.5s |
| #345 | GLM 5V Turbo none | Z.ai | 2 | 0.5 | $0.052 | 1/3 | 3.13s |
| #358 | Granite 4.2 8B none | IBM Granite | 2 | 0.5 | $0.037 | 1/3 | 105.6s |
| #366 | Mercury 2.5 none | Inception | 2 | 0.4 | $0.026 | 0/3 | 12.5s |
| #388 | MiMo-V2-Flash default | Xiaomi | 2 | 0.4 | $0.025 | 0/3 | 2.64s |
| #397 | Jev 1.13 default | Typesafe | 2 | 0.2 | $0.003 | 0/2 | 598ms |
| #399 | GPT-6 Luna Decisions default | OpenAI | 2 | 0.3 | $0.005 | 0/2 | 447ms |
| #402 | D1 default | Liquid | 2 | 0.2 | $0.003 | 0/2 | 456ms |
| #15 | Gemini 3 Flash Preview medium | 1 | 0.9 | $0.876 | 2/3 | 84.4s | |
| #17 | Gemini 3.7 Flash medium | 1 | 0.8 | $0.278 | 2/3 | 8.86s |