चुकीचे उत्तर अपयशे
कोणत्या AI मॉडेल्सना चुकीचे उत्तर सर्वाधिक वेळा येतो ते पाहा, म्हणजे निवडण्यापूर्वी विश्वासार्हतेचे धोके लक्षात येतील. क्रम लावा: प्रतिसाद वेळ (सरासरी) ↑.
दाखवलेली मॉडेल्स
15
एकूण अपयशे
1558
सर्वाधिक प्रभावित मॉडेल
Nemotron 3 Nano Omni 30b A3b Reasoning 9
209/209
मॉडेल फिल्टर करा
सध्याच्या शोध आणि फिल्टर्सशी जुळणारी कोणतीही मॉडेल्स नाहीत.
| क्रमांक | मॉडेल | कंपनी | चुकीचे उत्तर संख्या | स्कोअर | एकूण खर्च | बरोबर चाचण्या | प्रतिसाद वेळ (सरासरी) |
|---|---|---|---|---|---|---|---|
| #132 | GPT-5.6 Terra none | OpenAI | 11 | 6.0 | $0.349 | 8/22 | 1.65s |
| #122 | Gemini 3.1 Flash Lite none | 11 | 6.1 | $0.046 | 9/22 | 1.75s | |
| #120 | Gemini 3.1 Flash Lite minimal | 8 | 6.1 | $0.047 | 10/22 | 1.86s | |
| #174 | GPT-4o-mini none | OpenAI | 15 | 5.0 | $0.010 | 5/22 | 1.99s |
| #139 | GPT-5.4 none | OpenAI | 14 | 5.8 | $0.397 | 7/22 | 2.07s |
| #83 | GPT-5.6 Sol none | OpenAI | 10 | 6.9 | $0.524 | 11/22 | 2.16s |
| #147 | Mimo V2 PRO none | Xiaomi | 11 | 5.6 | $0.045 | 7/21 | 2.27s |
| #87 | GPT-5.5 none | OpenAI | 11 | 6.9 | $0.544 | 11/22 | 2.36s |
| #157 | Mimo V2 Omni none | Xiaomi | 10 | 5.5 | $0.021 | 8/21 | 2.44s |
| #180 | GPT-5.4 Nano none | OpenAI | 15 | 4.8 | $0.041 | 4/22 | 2.57s |
| #88 | Gemini 3.5 Flash minimal | 5 | 6.8 | $0.300 | 14/22 | 2.65s | |
| #78 | Mercury 2 medium | Inception | 8 | 7.0 | $0.093 | 10/22 | 2.72s |
| #200 | MiMo-V2-Flash none | Xiaomi | 13 | 4.0 | $0.025 | 4/21 | 2.76s |
| #170 | GLM 5 Turbo none | Z.ai | 13 | 5.1 | $0.047 | 6/21 | 2.82s |
| #192 | Laguna M.1 none | Poolside | 10 | 4.4 | $0.009 | 4/19 | 2.89s |