कोडिंग: गलत उत्तर
कोडिंग
गलत उत्तर
देखें कि कोडिंग में किन AI मॉडलों में गलत उत्तर आने की सबसे अधिक संभावना है, ताकि आप कमजोरियाँ जल्दी पहचान सकें।
विफलता के कारण
265/265
मॉडल फ़िल्टर करें
मौजूदा खोज और फ़िल्टर से कोई मॉडल मेल नहीं खाता।
| रैंक | मॉडल | कंपनी | गलत उत्तर संख्या | श्रेणी स्कोर | कुल लागत | सही परीक्षण | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|---|
| #80 | Claude Haiku 5.5 high | Anthropic | 2 | 0.6 | $0.088 | 1/3 | 9.54s |
| #83 | GPT-6 Luna medium | OpenAI | 2 | 0.7 | $0.047 | 1/3 | 23.6s |
| #86 | Qwen3.7 Plus medium | Qwen | 2 | 0.6 | $0.415 | 1/3 | 108.6s |
| #89 | GPT-5.6 Terra medium | OpenAI | 2 | 0.6 | $0.483 | 1/3 | 7.19s |
| #91 | Seed-2.0-Code low | Bytedance Seed | 2 | 0.7 | $0.881 | 1/3 | 109.7s |
| #92 | DeepSeek V4 Pro 0423 high | DeepSeek | 2 | 0.6 | $0.149 | 1/3 | 243.0s |
| #96 | GPT-5.6 Luna high | OpenAI | 2 | 0.5 | $0.118 | 1/3 | 15.6s |
| #98 | GPT-5.4 Nano medium | OpenAI | 2 | 0.6 | $0.235 | 1/3 | 19.1s |
| #101 | GPT-5.6 Terra low | OpenAI | 2 | 0.7 | $0.435 | 1/3 | 9.56s |
| #102 | Qwen3.5-27B medium | Qwen | 2 | 0.6 | $1.135 | 1/3 | 160.7s |
| #106 | Qwen3.7 Max none | Qwen | 2 | 0.5 | $0.451 | 1/3 | 1.35s |
| #112 | GLM 5.3 high | Z.ai | 2 | 0.7 | $0.495 | 1/3 | 18.9s |
| #115 | Qwen3.7 Plus none | Qwen | 2 | 0.5 | $0.178 | 1/3 | 2.15s |
| #120 | Claude Haiku 5.5 medium | Anthropic | 2 | 0.6 | $0.063 | 1/3 | 7.16s |
| #121 | Qwen3.5 Plus 2026-04-20 medium | Qwen | 2 | 0.6 | $0.435 | 1/3 | 125.3s |