डेटा पार्सिंग आणि निष्कर्षण: चुकीचे उत्तर
डेटा पार्सिंग आणि निष्कर्षण
चुकीचे उत्तर
डेटा पार्सिंग आणि निष्कर्षण मध्ये कोणत्या AI मॉडेल्सना चुकीचे उत्तर येण्याची शक्यता जास्त आहे ते पाहा, म्हणजे कमकुवत बाजू लवकर ओळखता येतील. क्रम लावा: एकूण खर्च ↓.
अयशस्वी होण्याची कारणे
36/36
मॉडेल फिल्टर करा
सध्याच्या शोध आणि फिल्टर्सशी जुळणारी कोणतीही मॉडेल्स नाहीत.
| क्रमांक | मॉडेल | कंपनी | चुकीचे उत्तर संख्या | श्रेणी स्कोअर | एकूण खर्च | बरोबर चाचण्या | प्रतिसाद वेळ (सरासरी) |
|---|---|---|---|---|---|---|---|
| #41 | Claude Opus 4.8 low | Anthropic | 1 | 6.3 | $2.077 | 1/2 | 2.27s |
| #14 | Claude Opus 4.8 medium | Anthropic | 1 | 7.1 | $1.931 | 1/2 | 12.3s |
| #66 | Claude Opus 4.8 none | Anthropic | 1 | 7.3 | $1.166 | 1/2 | 1.77s |
| #202 | Grok Build 0.1 none | X AI | 1 | 3.8 | $0.547 | 0/2 | 9.33s |
| #97 | LongCat 2.0 high | Meituan | 1 | 3.6 | $0.469 | 0/2 | 11.0s |
| #81 | KAT-Coder-Pro V2.5 medium | Kwaipilot | 1 | 7.3 | $0.467 | 1/2 | 4.70s |
| #67 | Step 3.7 Flash low | Stepfun | 1 | 7.3 | $0.454 | 1/2 | 2.29s |
| #190 | MiniMax M2.5 medium | Minimax | 2 | 4.6 | $0.340 | 0/2 | 7.48s |
| #109 | Mimo V2 PRO medium | Xiaomi | 1 | 7.3 | $0.333 | 1/2 | 17.2s |
| #84 | MiMo-V2.5-Pro medium | Xiaomi | 1 | 7.3 | $0.187 | 1/2 | 18.8s |
| #172 | MiniMax M2.7 medium | Minimax | 1 | 6.3 | $0.163 | 1/2 | 21.9s |
| #155 | Kimi K2.5 none | Moonshot AI | 1 | 7.3 | $0.127 | 1/2 | 42.1s |
| #128 | GPT-5 Nano medium | OpenAI | 2 | 3.7 | $0.114 | 0/2 | 21.4s |
| #108 | Ring-2.6-1T medium | Inclusionai | 1 | 6.5 | $0.103 | 1/2 | 37.4s |
| #78 | Mercury 2 medium | Inception | 1 | 7.3 | $0.093 | 1/2 | 1.11s |