डोमेन-विशिष्ट: चुकीचे उत्तर
डोमेन-विशिष्ट
चुकीचे उत्तर
डोमेन-विशिष्ट मध्ये कोणत्या AI मॉडेल्सना चुकीचे उत्तर येण्याची शक्यता जास्त आहे ते पाहा, म्हणजे कमकुवत बाजू लवकर ओळखता येतील.
अयशस्वी होण्याची कारणे
202/202
मॉडेल फिल्टर करा
सध्याच्या शोध आणि फिल्टर्सशी जुळणारी कोणतीही मॉडेल्स नाहीत.
| क्रमांक | मॉडेल | कंपनी | चुकीचे उत्तर संख्या | श्रेणी स्कोअर | एकूण खर्च | बरोबर चाचण्या | प्रतिसाद वेळ (सरासरी) |
|---|---|---|---|---|---|---|---|
| #70 | Claude Opus 4.8 none | Anthropic | 2 | 5.3 | $1.166 | 1/3 | 1.70s |
| #71 | Step 3.7 Flash low | Stepfun | 2 | 5.3 | $0.454 | 1/3 | 43.3s |
| #77 | Grok 4.3 medium | X AI | 2 | 5.3 | $0.779 | 1/3 | 181.7s |
| #80 | DeepSeek V3.2 medium | DeepSeek | 2 | 2.9 | $0.078 | 0/3 | 24.3s |
| #81 | Kimi K2.5 medium | Moonshot AI | 2 | 3.5 | $0.600 | 0/3 | 137.3s |
| #86 | DeepSeek V4 Pro none | DeepSeek | 2 | 5.3 | $0.096 | 1/3 | 3.72s |
| #90 | Step 3.7 Flash high | Stepfun | 2 | 4.1 | $1.207 | 0/3 | 149.6s |
| #94 | Qwen3.6 35B A3B medium | Qwen | 2 | 5.3 | $0.746 | 1/3 | 22.5s |
| #96 | LongCat 2.0 low | Meituan | 2 | 3.0 | $0.391 | 0/3 | 86.1s |
| #98 | GLM 5V Turbo medium | Z.ai | 2 | 5.3 | $0.457 | 1/3 | 38.1s |
| #100 | Gemma 4 26B A4B medium | 2 | 2.9 | $0.089 | 0/3 | 23.6s | |
| #101 | GLM 5.2 none | Z.ai | 2 | 5.3 | $0.128 | 1/3 | 4.04s |
| #106 | Hy3 preview medium | Tencent | 2 | 5.3 | $0.018 | 1/3 | 22.3s |
| #110 | Gemini 3.1 Flash Lite Preview low | 2 | 5.3 | $0.646 | 1/3 | 2.36s | |
| #111 | Gemini 3.1 Flash Lite low | 2 | 5.3 | $0.621 | 1/3 | 1.52s |