स्वायत्त एजेंट कार्य: गलत उत्तर
स्वायत्त एजेंट कार्य
गलत उत्तर
देखें कि स्वायत्त एजेंट कार्य में किन AI मॉडलों में गलत उत्तर आने की सबसे अधिक संभावना है, ताकि आप कमजोरियाँ जल्दी पहचान सकें।
विफलता के कारण
108/108
मॉडल फ़िल्टर करें
मौजूदा खोज और फ़िल्टर से कोई मॉडल मेल नहीं खाता।
| रैंक | मॉडल | कंपनी | गलत उत्तर संख्या | श्रेणी स्कोर | कुल लागत | सही परीक्षण | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|---|
| #299 | Dots 3 Note Preview none | Dots Studio | 1 | 3.9 | $0.000 | 0/1 | 45.7s |
| #300 | GPT-4o-mini none | OpenAI | 1 | 5.0 | $0.024 | 0/1 | 40.0s |
| #304 | Qwen3 Coder Next none | Qwen | 1 | 3.9 | $0.065 | 0/1 | 208.4s |
| #305 | Laguna S 2.1 high | Poolside | 1 | 2.8 | $0.147 | 0/1 | 158.2s |
| #309 | Qwen3.5-9B none | Qwen | 1 | 3.9 | $0.041 | 0/1 | 433.0s |
| #313 | GLM 4.7 Flash none | Z.ai | 1 | 5.0 | $0.027 | 0/1 | 80.7s |
| #316 | North Mini Code none | Cohere | 1 | 3.0 | $0.000 | 0/1 | 18.9s |
| #318 | Granite 4.2 8B high | IBM Granite | 1 | 5.0 | $0.161 | 0/1 | 223.5s |
| #319 | Qwen3 Coder Next medium | Qwen | 1 | 5.0 | $0.069 | 0/1 | 151.4s |
| #320 | DeepSeek V3.2 none | DeepSeek | 1 | 3.0 | $0.121 | 0/1 | 122.5s |
| #321 | GPT-5.4 Nano none | OpenAI | 1 | 3.9 | $0.068 | 0/1 | 45.4s |
| #333 | Nemotron 3 Super none | NVIDIA | 1 | 2.8 | $0.016 | 0/1 | 30.5s |
| #341 | GLM 4.7 Flash medium | Z.ai | 1 | 3.9 | $0.193 | 0/1 | 399.2s |
| #342 | gpt-oss-120b none | OpenAI | 1 | 6.1 | $0.016 | 0/1 | 140.9s |
| #344 | Mercury 2.5 none | Inception | 1 | 5.0 | $0.026 | 0/1 | 63.4s |