कोडिंग: गलत उत्तर
कोडिंग
गलत उत्तर
देखें कि कोडिंग में किन AI मॉडलों में गलत उत्तर आने की सबसे अधिक संभावना है, ताकि आप कमजोरियाँ जल्दी पहचान सकें।
विफलता के कारण
265/265
मॉडल फ़िल्टर करें
मौजूदा खोज और फ़िल्टर से कोई मॉडल मेल नहीं खाता।
| रैंक | मॉडल | कंपनी | गलत उत्तर संख्या | श्रेणी स्कोर | कुल लागत | सही परीक्षण | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|---|
| #18 | GPT-6 Sol medium | OpenAI | 1 | 0.8 | $0.703 | 2/3 | 11.8s |
| #25 | Gemini 3.7 Flash low | 1 | 0.8 | $0.183 | 2/3 | 6.20s | |
| #29 | Claude Opus 5.5 medium | Anthropic | 1 | 0.8 | $1.804 | 2/3 | 13.5s |
| #30 | GPT-5.5 medium | OpenAI | 1 | 0.9 | $4.809 | 2/3 | 59.8s |
| #39 | Gemini 3.5 Flash low | 1 | 0.8 | $0.752 | 2/3 | 6.71s | |
| #40 | Qwen3.8 Max (0902) medium | Qwen | 1 | 0.8 | $1.096 | 2/3 | 45.7s |
| #42 | Gemini 3.5 Flash Lite high | 1 | 0.8 | $0.624 | 2/3 | 16.6s | |
| #43 | Claude Opus 5 low | Anthropic | 1 | 0.8 | $2.350 | 2/3 | 6.70s |
| #44 | Gemini 3.6 Flash low | 1 | 0.8 | $0.363 | 2/3 | 6.95s | |
| #50 | Qwen3.8 MAX low | Qwen | 1 | 0.8 | $1.089 | 2/3 | 28.7s |
| #51 | GPT-5.4 medium | OpenAI | 1 | 0.9 | $2.213 | 2/3 | 44.4s |
| #54 | Muse Spark 1.2 low | Meta | 1 | 0.8 | $0.881 | 2/3 | 10.1s |
| #68 | Claude Sonnet 5 medium | Anthropic | 1 | 0.9 | $1.438 | 2/3 | 17.3s |
| #74 | Gemini 3.1 Pro Preview medium | 1 | 0.8 | $1.585 | 2/3 | 40.2s | |
| #75 | Inkling high | Thinkingmachines | 1 | 0.9 | $1.238 | 2/3 | 148.4s |