कोडिंग: गलत उत्तर
कोडिंग
गलत उत्तर
देखें कि कोडिंग में किन AI मॉडलों में गलत उत्तर आने की सबसे अधिक संभावना है, ताकि आप कमजोरियाँ जल्दी पहचान सकें।
विफलता के कारण
265/265
मॉडल फ़िल्टर करें
मौजूदा खोज और फ़िल्टर से कोई मॉडल मेल नहीं खाता।
| रैंक | मॉडल | कंपनी | गलत उत्तर संख्या | श्रेणी स्कोर | कुल लागत | सही परीक्षण | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|---|
| #147 | Qwen3.6 Plus medium | Qwen | 1 | 0.6 | $0.554 | 1/3 | 153.1s |
| #148 | Gemini 3.5 Flash Lite medium | 1 | 0.8 | $0.440 | 2/3 | 9.96s | |
| #153 | Claude Opus 4.8 low | Anthropic | 1 | 0.7 | $3.787 | 1/3 | 7.58s |
| #154 | Qwen3.7 Flash high | Qwen | 1 | 0.8 | $0.063 | 2/3 | 58.8s |
| #157 | Step 3.7 Flash low | Stepfun | 1 | 0.8 | $0.449 | 2/3 | 9.46s |
| #159 | Claude Opus 5 none | Anthropic | 1 | 0.6 | $2.766 | 1/3 | 5.54s |
| #162 | MiMo-V2.6-Flash low | Xiaomi | 1 | 0.8 | $0.200 | 2/3 | 11.0s |
| #164 | GPT-5.2 Chat default | OpenAI | 1 | 0.9 | $0.594 | 2/3 | 9.82s |
| #165 | Qwen3.6 Max Preview medium | Qwen | 1 | 0.9 | $1.132 | 2/3 | 146.5s |
| #169 | Qwen3.5-122B-A10B medium | Qwen | 1 | 0.6 | $1.152 | 1/3 | 114.5s |
| #172 | Muse Glimmer 30B low | Meta | 1 | 0.8 | $0.219 | 2/3 | 16.5s |
| #175 | Gemma 4 31B medium | 1 | 0.4 | $0.144 | 0/3 | 219.8s | |
| #178 | Claude Opus 4.8 none | Anthropic | 1 | 0.5 | $2.334 | 1/3 | 3.29s |
| #182 | Mercury 2.5 Preview medium | Inception | 1 | 0.8 | $0.039 | 2/3 | 3.86s |
| #185 | Solar Pro 4 xhigh | Upstage | 1 | 0.6 | $0.067 | 1/3 | 292.2s |