डोमेन-विशिष्ट: गलत उत्तर
डोमेन-विशिष्ट
गलत उत्तर
देखें कि डोमेन-विशिष्ट में किन AI मॉडलों में गलत उत्तर आने की सबसे अधिक संभावना है, ताकि आप कमजोरियाँ जल्दी पहचान सकें।
विफलता के कारण
303/303
मॉडल फ़िल्टर करें
मौजूदा खोज और फ़िल्टर से कोई मॉडल मेल नहीं खाता।
| रैंक | मॉडल | कंपनी | गलत उत्तर संख्या | श्रेणी स्कोर | कुल लागत | सही परीक्षण | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|---|
| #123 | Muse Glimmer 30B high | Meta | 2 | 2.9 | $0.397 | 0/3 | 182.6s |
| #132 | GPT-5.6 Sol none | OpenAI | 2 | 5.9 | $0.201 | 1/3 | 1.44s |
| #133 | DeepSeek V3.2 medium | DeepSeek | 2 | 2.9 | $0.078 | 0/3 | 22.9s |
| #135 | GPT-5.5 none | OpenAI | 2 | 5.3 | $0.544 | 1/3 | 1.27s |
| #139 | Kimi K2.5 medium | Moonshot AI | 2 | 2.9 | $0.479 | 0/3 | 111.6s |
| #143 | Seed-2.0-Code high | Bytedance Seed | 2 | 3.5 | $1.273 | 0/3 | 419.7s |
| #144 | Gemini 3.5 Flash none | 2 | 5.3 | $1.093 | 1/3 | 12.2s | |
| #147 | Seed-2.0-Code medium | Bytedance Seed | 2 | 5.3 | $1.153 | 1/3 | 429.8s |
| #151 | GLM 5.3 low | Z.ai | 2 | 5.3 | $0.257 | 1/3 | 19.2s |
| #159 | GLM 5V Turbo medium | Z.ai | 2 | 5.3 | $0.457 | 1/3 | 38.1s |
| #160 | LongCat 2.0 high | Meituan | 2 | 3.6 | $0.492 | 0/3 | 433.7s |
| #162 | Gemini 3.5 Flash Lite low | 2 | 5.9 | $0.138 | 1/3 | 3.55s | |
| #163 | Qwen3.5-27B none | Qwen | 2 | 5.3 | $0.058 | 1/3 | 634ms |
| #170 | Qwen3.6 27B medium | Qwen | 2 | 2.9 | $0.577 | 0/3 | 71.5s |
| #171 | Laguna XS 2.1 medium | Poolside | 2 | 3.5 | $0.068 | 0/3 | 67.5s |