चुकीचे उत्तर अपयशे
कोणत्या AI मॉडेल्सना चुकीचे उत्तर सर्वाधिक वेळा येतो ते पाहा, म्हणजे निवडण्यापूर्वी विश्वासार्हतेचे धोके लक्षात येतील. क्रम लावा: प्रतिसाद वेळ (सरासरी) ↑.
दाखवलेली मॉडेल्स
15
एकूण अपयशे
2265
सर्वाधिक प्रभावित मॉडेल
Nemotron 3 Nano Omni 30b A3b Reasoning 9
313/313
मॉडेल फिल्टर करा
सध्याच्या शोध आणि फिल्टर्सशी जुळणारी कोणतीही मॉडेल्स नाहीत.
| क्रमांक | मॉडेल | कंपनी | चुकीचे उत्तर संख्या | स्कोअर | एकूण खर्च | बरोबर चाचण्या | प्रतिसाद वेळ (सरासरी) |
|---|---|---|---|---|---|---|---|
| #38 | Gemini 3.6 Flash low | 4 | 8.7 | $0.251 | 18/22 | 4.92s | |
| #9 | GPT-6 Astra low | OpenAI | 2 | 9.5 | $1.289 | 20/22 | 5.09s |
| #193 | Inkling low | Thinkingmachines | 8 | 6.1 | $0.187 | 10/22 | 5.11s |
| #77 | Gemini 3.5 Flash Lite medium | 6 | 7.8 | $0.272 | 14/22 | 5.12s | |
| #177 | LongCat 2.0 none | Meituan | 13 | 6.4 | $0.044 | 8/22 | 5.17s |
| #185 | GPT-5.6 Luna low | OpenAI | 10 | 6.2 | $0.051 | 10/22 | 5.20s |
| #215 | Solar Pro 4 none | Upstage | 14 | 5.8 | $0.006 | 7/22 | 5.37s |
| #196 | Gemma 4 31B none | 10 | 6.1 | $0.016 | 9/22 | 5.41s | |
| #96 | GPT-5.6 Terra low | OpenAI | 8 | 7.5 | $0.420 | 13/22 | 5.45s |
| #251 | Qwen3.6 35B A3B none | Qwen | 13 | 5.3 | $0.051 | 4/22 | 5.57s |
| #33 | Gemini 3.5 Flash low | 3 | 8.8 | $0.449 | 18/22 | 5.76s | |
| #12 | Gemini 3.7 Flash medium | 2 | 9.4 | $0.309 | 20/22 | 5.87s | |
| #272 | Nemotron 3 Super none | NVIDIA | 15 | 4.8 | $0.008 | 5/22 | 6.04s |
| #186 | Claude Sonnet 5 none | Anthropic | 8 | 6.1 | $0.548 | 7/22 | 6.05s |
| #200 | Gemini 2.5 Flash none | 13 | 6.0 | $0.017 | 8/22 | 6.19s |