स्वायत्त एजेंट कार्य: गलत उत्तर
स्वायत्त एजेंट कार्य
गलत उत्तर
देखें कि स्वायत्त एजेंट कार्य में किन AI मॉडलों में गलत उत्तर आने की सबसे अधिक संभावना है, ताकि आप कमजोरियाँ जल्दी पहचान सकें।
विफलता के कारण
108/108
मॉडल फ़िल्टर करें
मौजूदा खोज और फ़िल्टर से कोई मॉडल मेल नहीं खाता।
| रैंक | मॉडल | कंपनी | गलत उत्तर संख्या | श्रेणी स्कोर | कुल लागत | सही परीक्षण | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|---|
| #142 | Claude Opus 4.8 low | Anthropic | 1 | 4.7 | $3.787 | 0/1 | 110.7s |
| #143 | Qwen3.7 Flash high | Qwen | 1 | 4.7 | $0.063 | 0/1 | 135.9s |
| #144 | LongCat 2.0 medium | Meituan | 1 | 6.1 | $0.593 | 0/1 | 174.1s |
| #145 | GLM 5 medium | Z.ai | 1 | 4.7 | $0.360 | 0/1 | 110.7s |
| #149 | Claude Opus 5 none | Anthropic | 1 | 5.4 | $2.766 | 0/1 | 79.6s |
| #151 | MiMo-V2.6-Flash low | Xiaomi | 1 | 4.7 | $0.200 | 0/1 | 107.9s |
| #155 | Gemini 3.1 Flash Lite Preview medium | 1 | 5.0 | $0.158 | 0/1 | 54.9s | |
| #156 | Kimi K2.7 Code medium | Moonshot AI | 1 | 5.0 | $0.861 | 0/1 | 104.0s |
| #159 | Grok 4.6 low | X AI | 1 | 5.0 | $0.781 | 0/1 | 58.0s |
| #160 | Gemini 3 Flash Preview low | 1 | 5.0 | $0.254 | 0/1 | 52.6s | |
| #162 | Claude Opus 4.8 none | Anthropic | 1 | 5.4 | $2.328 | 0/1 | 69.1s |
| #163 | Gemini 3.1 Flash Lite medium | 1 | 5.0 | $0.153 | 0/1 | 47.8s | |
| #168 | Kimi K2.6 medium | Moonshot AI | 1 | 5.0 | $1.323 | 0/1 | 233.9s |
| #172 | GPT-6 Sol none | OpenAI | 1 | 5.0 | $0.551 | 0/1 | 57.0s |
| #173 | Space Bunny Alpha max | Stealth | 1 | 6.1 | $0.000 | 0/1 | 90.6s |