सामान्य ज्ञान: चुकीचे उत्तर
सामान्य ज्ञान
चुकीचे उत्तर
सामान्य ज्ञान मध्ये कोणत्या AI मॉडेल्सना चुकीचे उत्तर येण्याची शक्यता जास्त आहे ते पाहा, म्हणजे कमकुवत बाजू लवकर ओळखता येतील.
अयशस्वी होण्याची कारणे
197/197
मॉडेल फिल्टर करा
सध्याच्या शोध आणि फिल्टर्सशी जुळणारी कोणतीही मॉडेल्स नाहीत.
| क्रमांक | मॉडेल | कंपनी | चुकीचे उत्तर संख्या | श्रेणी स्कोअर | एकूण खर्च | बरोबर चाचण्या | प्रतिसाद वेळ (सरासरी) |
|---|---|---|---|---|---|---|---|
| #65 | Grok Build 0.1 medium | X AI | 1 | 3.0 | $1.097 | 0/1 | 53.5s |
| #66 | GLM 5 Turbo medium | Z.ai | 1 | 3.0 | $0.323 | 0/1 | 40.2s |
| #67 | GPT-5.6 Luna medium | OpenAI | 1 | 3.0 | $0.036 | 0/1 | 6.64s |
| #68 | Nemotron 3 Ultra medium | NVIDIA | 1 | 3.0 | $0.774 | 0/1 | 38.5s |
| #70 | Kimi K2.7 Code medium | Moonshot AI | 1 | 3.0 | $0.686 | 0/1 | 341.8s |
| #71 | GPT-5.4 Nano medium | OpenAI | 1 | 3.0 | $0.138 | 0/1 | 4.81s |
| #72 | GPT-5.3 Chat none | OpenAI | 1 | 3.0 | $0.571 | 0/1 | 4.38s |
| #73 | GPT-5.6 Terra low | OpenAI | 1 | 3.0 | $0.208 | 0/1 | 5.95s |
| #74 | GPT-5.4 Mini medium | OpenAI | 1 | 3.0 | $0.756 | 0/1 | 30.1s |
| #75 | Qwen3.5 Plus 2026-02-15 medium | Qwen | 1 | 3.0 | $0.437 | 0/1 | 103.8s |
| #76 | Qwen3.5-27B medium | Qwen | 1 | 3.0 | $0.981 | 0/1 | 85.1s |
| #77 | Qwen3.7 Max none | Qwen | 1 | 3.0 | $0.197 | 0/1 | 856ms |
| #78 | LongCat 2.0 medium | Meituan | 1 | 3.0 | $0.478 | 0/1 | 191.2s |
| #80 | KAT-Coder-Pro V2.5 low | Kwaipilot | 1 | 3.0 | $0.387 | 0/1 | 17.1s |
| #81 | Claude Sonnet 4.6 none | Anthropic | 1 | 3.0 | $0.661 | 0/1 | 4.67s |