उत्तर नाही अपयशे
कोणत्या AI मॉडेल्सना उत्तर नाही सर्वाधिक वेळा येतो ते पाहा, म्हणजे निवडण्यापूर्वी विश्वासार्हतेचे धोके लक्षात येतील. क्रम लावा: एकूण खर्च ↓.
137/137
मॉडेल फिल्टर करा
सध्याच्या शोध आणि फिल्टर्सशी जुळणारी कोणतीही मॉडेल्स नाहीत.
| क्रमांक | मॉडेल | कंपनी | उत्तर नाही संख्या | स्कोअर | एकूण खर्च | बरोबर चाचण्या | प्रतिसाद वेळ (सरासरी) |
|---|---|---|---|---|---|---|---|
| #19 | Grok 4.6 high | X AI | 1 | 9.3 | $1.908 | 19/22 | 84.1s |
| #40 | Seed 2.1 Turbo high | Bytedance Seed | 1 | 8.9 | $1.797 | 16/22 | 174.0s |
| #266 | Hy4 preview low | Tencent | 1 | 5.6 | $1.745 | 3/22 | 214.3s |
| #38 | Muse Spark 1.3 high | Meta | 1 | 8.9 | $1.653 | 16/22 | 52.5s |
| #2 | Gemini 3.8 Flash high | 1 | 9.9 | $1.595 | 21/22 | 37.2s | |
| #25 | Claude Opus 5 medium | Anthropic | 1 | 9.2 | $1.586 | 18/22 | 10.3s |
| #115 | Claude Opus 5 none | Anthropic | 1 | 7.5 | $1.550 | 12/22 | 7.65s |
| #28 | Seed 2.1 Turbo low | Bytedance Seed | 2 | 9.1 | $1.546 | 17/22 | 163.9s |
| #89 | Grok 4.7 low | X AI | 2 | 7.9 | $1.320 | 14/22 | 59.0s |
| #170 | Seed-2.0-Code high | Bytedance Seed | 1 | 6.9 | $1.273 | 11/22 | 124.2s |
| #21 | Claude Opus 5.5 high | Anthropic | 1 | 9.3 | $1.266 | 18/22 | 25.9s |
| #145 | Kimi K2.6 medium | Moonshot AI | 1 | 7.2 | $1.247 | 12/22 | 115.9s |
| #173 | Step 3.7 Flash high | Stepfun | 3 | 6.8 | $1.229 | 11/22 | 70.1s |
| #64 | GPT-5.2 medium | OpenAI | 1 | 8.4 | $1.182 | 14/22 | 28.5s |
| #144 | Claude Opus 4.8 none | Anthropic | 1 | 7.3 | $1.166 | 13/22 | 4.92s |