कोडिंग: चुकीचे उत्तर
कोडिंग
चुकीचे उत्तर
कोडिंग मध्ये कोणत्या AI मॉडेल्सना चुकीचे उत्तर येण्याची शक्यता जास्त आहे ते पाहा, म्हणजे कमकुवत बाजू लवकर ओळखता येतील.
अयशस्वी होण्याची कारणे
265/265
मॉडेल फिल्टर करा
सध्याच्या शोध आणि फिल्टर्सशी जुळणारी कोणतीही मॉडेल्स नाहीत.
| क्रमांक | मॉडेल | कंपनी | चुकीचे उत्तर संख्या | श्रेणी स्कोअर | एकूण खर्च | बरोबर चाचण्या | प्रतिसाद वेळ (सरासरी) |
|---|---|---|---|---|---|---|---|
| #147 | Qwen3.6 Plus medium | Qwen | 1 | 0.6 | $0.554 | 1/3 | 153.1s |
| #148 | Gemini 3.5 Flash Lite medium | 1 | 0.8 | $0.440 | 2/3 | 9.96s | |
| #153 | Claude Opus 4.8 low | Anthropic | 1 | 0.7 | $3.787 | 1/3 | 7.58s |
| #154 | Qwen3.7 Flash high | Qwen | 1 | 0.8 | $0.063 | 2/3 | 58.8s |
| #157 | Step 3.7 Flash low | Stepfun | 1 | 0.8 | $0.449 | 2/3 | 9.46s |
| #159 | Claude Opus 5 none | Anthropic | 1 | 0.6 | $2.766 | 1/3 | 5.54s |
| #162 | MiMo-V2.6-Flash low | Xiaomi | 1 | 0.8 | $0.200 | 2/3 | 11.0s |
| #164 | GPT-5.2 Chat default | OpenAI | 1 | 0.9 | $0.594 | 2/3 | 9.82s |
| #165 | Qwen3.6 Max Preview medium | Qwen | 1 | 0.9 | $1.132 | 2/3 | 146.5s |
| #169 | Qwen3.5-122B-A10B medium | Qwen | 1 | 0.6 | $1.152 | 1/3 | 114.5s |
| #172 | Muse Glimmer 30B low | Meta | 1 | 0.8 | $0.219 | 2/3 | 16.5s |
| #175 | Gemma 4 31B medium | 1 | 0.4 | $0.144 | 0/3 | 219.8s | |
| #178 | Claude Opus 4.8 none | Anthropic | 1 | 0.5 | $2.334 | 1/3 | 3.29s |
| #182 | Mercury 2.5 Preview medium | Inception | 1 | 0.8 | $0.039 | 2/3 | 3.86s |
| #185 | Solar Pro 4 xhigh | Upstage | 1 | 0.6 | $0.067 | 1/3 | 292.2s |