कोडिंग: गलत उत्तर
कोडिंग
गलत उत्तर
देखें कि कोडिंग में किन AI मॉडलों में गलत उत्तर आने की सबसे अधिक संभावना है, ताकि आप कमजोरियाँ जल्दी पहचान सकें।
विफलता के कारण
197/197
मॉडल फ़िल्टर करें
मौजूदा खोज और फ़िल्टर से कोई मॉडल मेल नहीं खाता।
| रैंक | मॉडल | कंपनी | गलत उत्तर संख्या | श्रेणी स्कोर | कुल लागत | सही परीक्षण | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|---|
| #251 | GPT-5.4 Nano none | OpenAI | 3 | 4.6 | $0.041 | 0/3 | 2.22s |
| #255 | GLM 4.7 Flash none | Z.ai | 3 | 4.3 | $0.016 | 0/3 | 2.54s |
| #261 | Mercury 2 none | Inception | 3 | 3.4 | $0.030 | 0/3 | 1.03s |
| #264 | Laguna S 2.1 none | Poolside | 3 | 3.4 | $0.022 | 0/3 | 550ms |
| #275 | Ling 3.0 Tiny none | Inclusionai | 3 | 4.2 | $0.000 | 0/3 | 1.19s |
| #277 | Nemotron 3.5 Lightning none | NVIDIA | 3 | 3.1 | $0.007 | 0/3 | 1.55s |
| #66 | GPT-5.6 Terra medium | OpenAI | 2 | 6.1 | $0.523 | 1/3 | 7.19s |
| #78 | GPT-5.6 Luna high | OpenAI | 2 | 5.5 | $0.179 | 1/3 | 15.6s |
| #82 | GPT-5.4 Nano medium | OpenAI | 2 | 6.1 | $0.142 | 1/3 | 19.1s |
| #83 | GPT-5.6 Terra low | OpenAI | 2 | 6.6 | $0.420 | 1/3 | 9.56s |
| #85 | GPT 5.3 Chat none | OpenAI | 2 | 5.6 | $0.533 | 1/3 | 10.5s |
| #87 | Qwen3.5-27B medium | Qwen | 2 | 6.2 | $0.982 | 1/3 | 160.7s |
| #90 | Gemini 3.1 Flash Lite Preview medium | 2 | 5.5 | $0.117 | 1/3 | 4.09s | |
| #91 | Qwen3.7 Max none | Qwen | 2 | 5.5 | $0.197 | 1/3 | 1.35s |
| #93 | GPT-5.6 Luna medium | OpenAI | 2 | 5.4 | $0.072 | 1/3 | 10.4s |