चुकीचे उत्तर अपयशे
कोणत्या AI मॉडेल्सना चुकीचे उत्तर सर्वाधिक वेळा येतो ते पाहा, म्हणजे निवडण्यापूर्वी विश्वासार्हतेचे धोके लक्षात येतील.
209/209
मॉडेल फिल्टर करा
सध्याच्या शोध आणि फिल्टर्सशी जुळणारी कोणतीही मॉडेल्स नाहीत.
| क्रमांक | मॉडेल | कंपनी | चुकीचे उत्तर संख्या | स्कोअर | एकूण खर्च | बरोबर चाचण्या | प्रतिसाद वेळ (सरासरी) |
|---|---|---|---|---|---|---|---|
| #145 | GLM 5V Turbo none | Z.ai | 11 | 5.6 | $0.052 | 8/21 | 2.99s |
| #147 | Mimo V2 PRO none | Xiaomi | 11 | 5.6 | $0.045 | 7/21 | 2.27s |
| #149 | KAT-Coder-Air V2.5 medium | Kwaipilot | 11 | 5.6 | $0.048 | 8/22 | 8.42s |
| #152 | Qwen3.6 27B none | Qwen | 11 | 5.5 | $0.087 | 7/22 | 10.7s |
| #154 | MiMo-V2.5-Pro none | Xiaomi | 11 | 5.5 | $0.068 | 6/22 | 4.12s |
| #62 | KAT-Coder-Pro V2.5 low | Kwaipilot | 10 | 7.4 | $0.387 | 11/22 | 19.5s |
| #69 | KAT-Coder-Pro V2.5 high | Kwaipilot | 10 | 7.2 | $0.482 | 11/22 | 20.8s |
| #71 | Qwen3.7 Plus none | Qwen | 10 | 7.2 | $0.106 | 11/22 | 12.1s |
| #83 | GPT-5.6 Sol none | OpenAI | 10 | 6.9 | $0.524 | 11/22 | 2.16s |
| #92 | KAT-Coder-Pro V2.5 none | Kwaipilot | 10 | 6.7 | $0.476 | 11/22 | 25.6s |
| #98 | Qwen3.6 Max Preview none | Qwen | 10 | 6.6 | $0.231 | 12/22 | 7.82s |
| #117 | GPT-5.6 Luna low | OpenAI | 10 | 6.2 | $0.249 | 10/22 | 5.04s |
| #146 | Owl Alpha medium | Openrouter | 10 | 5.6 | $0.000 | 8/21 | 11.9s |
| #148 | Owl Alpha none | Openrouter | 10 | 5.6 | $0.000 | 7/21 | 9.88s |
| #156 | Gemma 4 26B A4B none | 10 | 5.5 | $0.015 | 8/22 | 7.64s |