स्वायत्त एजेंट कार्य: गलत उत्तर
स्वायत्त एजेंट कार्य
गलत उत्तर
देखें कि स्वायत्त एजेंट कार्य में किन AI मॉडलों में गलत उत्तर आने की सबसे अधिक संभावना है, ताकि आप कमजोरियाँ जल्दी पहचान सकें। क्रमबद्ध करें: प्रतिक्रिया समय (औसत) ↓.
विफलता के कारण
108/108
मॉडल फ़िल्टर करें
मौजूदा खोज और फ़िल्टर से कोई मॉडल मेल नहीं खाता।
| रैंक | मॉडल | कंपनी | गलत उत्तर संख्या | श्रेणी स्कोर | कुल लागत | सही परीक्षण | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|---|
| #309 | Qwen3.5-9B none | Qwen | 1 | 3.9 | $0.041 | 0/1 | 433.0s |
| #341 | GLM 4.7 Flash medium | Z.ai | 1 | 3.9 | $0.193 | 0/1 | 399.2s |
| #134 | Grok 4.7 medium | X AI | 1 | 3.9 | $3.501 | 0/1 | 372.1s |
| #178 | Solar Pro 4 low | Upstage | 1 | 6.1 | $0.174 | 0/1 | 345.4s |
| #281 | Kimi K2.5 none | Moonshot AI | 1 | 5.0 | $0.236 | 0/1 | 321.2s |
| #124 | DeepSeek V4 Flash 0731 low | DeepSeek | 1 | 4.7 | $0.307 | 0/1 | 321.2s |
| #174 | Solar Pro 4 xhigh | Upstage | 1 | 3.0 | $0.167 | 0/1 | 316.6s |
| #219 | Solar Pro 4 high | Upstage | 1 | 2.8 | $0.164 | 0/1 | 312.3s |
| #137 | Qwen3.6 Plus medium | Qwen | 1 | 4.7 | $0.391 | 0/1 | 307.1s |
| #204 | Solar Pro 4 medium | Upstage | 1 | 4.7 | $0.174 | 0/1 | 272.3s |
| #168 | Kimi K2.6 medium | Moonshot AI | 1 | 5.0 | $1.323 | 0/1 | 233.9s |
| #209 | MiMo-V2.5-Pro medium | Xiaomi | 1 | 4.7 | $0.502 | 0/1 | 233.5s |
| #318 | Granite 4.2 8B high | IBM Granite | 1 | 5.0 | $0.161 | 0/1 | 223.5s |
| #116 | Qwen3.8 27B low | Qwen | 1 | 6.1 | ~$0.089 | 0/1 | 211.3s |
| #304 | Qwen3 Coder Next none | Qwen | 1 | 3.9 | $0.065 | 0/1 | 208.4s |