कोडिंग: गलत उत्तर
कोडिंग
गलत उत्तर
देखें कि कोडिंग में किन AI मॉडलों में गलत उत्तर आने की सबसे अधिक संभावना है, ताकि आप कमजोरियाँ जल्दी पहचान सकें।
विफलता के कारण
197/197
मॉडल फ़िल्टर करें
मौजूदा खोज और फ़िल्टर से कोई मॉडल मेल नहीं खाता।
| रैंक | मॉडल | कंपनी | गलत उत्तर संख्या | श्रेणी स्कोर | कुल लागत | सही परीक्षण | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|---|
| #71 | Qwen3.7 Flash high | Qwen | 1 | 8.2 | $0.052 | 2/3 | 58.8s |
| #73 | Seed-2.0-Code low | Bytedance Seed | 1 | 7.0 | $0.767 | 1/3 | 109.7s |
| #76 | DeepSeek V4 Flash 0423 high | DeepSeek | 1 | 7.8 | $0.042 | 2/3 | 50.6s |
| #79 | Solar Pro 4 xhigh | Upstage | 1 | 5.8 | $0.050 | 1/3 | 292.2s |
| #80 | Nemotron 3 Ultra medium | NVIDIA | 1 | 8.4 | $0.780 | 2/3 | 26.5s |
| #81 | Claude Opus 5 none | Anthropic | 1 | 5.9 | $1.550 | 1/3 | 5.54s |
| #86 | Qwen3.5 Plus 2026-02-15 medium | Qwen | 1 | 6.6 | $0.459 | 1/3 | 180.7s |
| #88 | GPT-5.4 Mini medium | OpenAI | 1 | 8.4 | $0.786 | 2/3 | 57.9s |
| #89 | Grok Build 0.1 medium | X AI | 1 | 5.7 | $1.130 | 1/3 | 108.5s |
| #98 | Claude Sonnet 4.6 none | Anthropic | 1 | 5.5 | $0.661 | 1/3 | 5.19s |
| #100 | KAT-Coder-Pro V2.5 low | Kwaipilot | 1 | 7.8 | $0.400 | 2/3 | 24.9s |
| #104 | Claude Opus 4.8 none | Anthropic | 1 | 5.5 | $1.166 | 1/3 | 3.29s |
| #107 | Muse Glimmer 30B high | Meta | 1 | 8.8 | $0.535 | 2/3 | 96.0s |
| #110 | Muse Glimmer 30B medium | Meta | 1 | 8.4 | $0.280 | 2/3 | 33.7s |
| #111 | Qwen3.5-122B-A10B medium | Qwen | 1 | 6.0 | $1.047 | 1/3 | 114.5s |