कोडिंग: गलत उत्तर
कोडिंग
गलत उत्तर
देखें कि कोडिंग में किन AI मॉडलों में गलत उत्तर आने की सबसे अधिक संभावना है, ताकि आप कमजोरियाँ जल्दी पहचान सकें।
विफलता के कारण
197/197
मॉडल फ़िल्टर करें
मौजूदा खोज और फ़िल्टर से कोई मॉडल मेल नहीं खाता।
| रैंक | मॉडल | कंपनी | गलत उत्तर संख्या | श्रेणी स्कोर | कुल लागत | सही परीक्षण | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|---|
| #7 | Gemini 3.7 Flash medium | 1 | 8.4 | $0.155 | 2/3 | 8.86s | |
| #12 | Gemini 3.1 Pro Preview medium | 1 | 7.9 | $1.352 | 2/3 | 40.2s | |
| #13 | Gemini 3.7 Flash low | 1 | 7.6 | $0.104 | 2/3 | 6.20s | |
| #19 | GPT-5.5 medium | OpenAI | 1 | 8.8 | $4.163 | 2/3 | 59.8s |
| #24 | Gemini 3.5 Flash low | 1 | 7.8 | $0.449 | 2/3 | 6.71s | |
| #25 | Gemini 3.5 Flash Lite high | 1 | 8.4 | $0.540 | 2/3 | 16.6s | |
| #27 | Claude Opus 5 low | Anthropic | 1 | 7.8 | $1.121 | 2/3 | 6.70s |
| #28 | Gemini 3.6 Flash low | 1 | 7.8 | $0.251 | 2/3 | 6.95s | |
| #29 | Claude Opus 4.7 medium | Anthropic | 1 | 7.6 | $1.476 | 2/3 | 13.0s |
| #34 | Qwen3.6 Max Preview medium | Qwen | 1 | 8.8 | $1.132 | 2/3 | 146.5s |
| #35 | Qwen3.8 Max low | Qwen | 1 | 8.4 | $0.702 | 2/3 | 28.7s |
| #36 | GPT-5.4 medium | OpenAI | 1 | 8.8 | $1.560 | 2/3 | 44.4s |
| #37 | Grok 4.5 medium | X AI | 1 | 7.6 | $2.042 | 2/3 | 155.7s |
| #38 | Muse Spark 1.2 low | Meta | 1 | 8.4 | $0.655 | 2/3 | 10.1s |
| #39 | Grok 4.6 medium | X AI | 1 | 8.2 | $1.713 | 2/3 | 120.0s |