स्वायत्त एजेंट कार्य: गलत उत्तर
स्वायत्त एजेंट कार्य
गलत उत्तर
देखें कि स्वायत्त एजेंट कार्य में किन AI मॉडलों में गलत उत्तर आने की सबसे अधिक संभावना है, ताकि आप कमजोरियाँ जल्दी पहचान सकें। क्रमबद्ध करें: कुल लागत ↓.
विफलता के कारण
108/108
मॉडल फ़िल्टर करें
मौजूदा खोज और फ़िल्टर से कोई मॉडल मेल नहीं खाता।
| रैंक | मॉडल | कंपनी | गलत उत्तर संख्या | श्रेणी स्कोर | कुल लागत | सही परीक्षण | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|---|
| #142 | Claude Opus 4.8 low | Anthropic | 1 | 4.7 | $3.787 | 0/1 | 110.7s |
| #134 | Grok 4.7 medium | X AI | 1 | 3.9 | $3.501 | 0/1 | 372.1s |
| #78 | Claude Opus 4.8 medium | Anthropic | 1 | 6.1 | $3.490 | 0/1 | 99.4s |
| #149 | Claude Opus 5 none | Anthropic | 1 | 5.4 | $2.766 | 0/1 | 79.6s |
| #62 | Grok 4.6 high | X AI | 1 | 5.0 | $2.629 | 0/1 | 160.9s |
| #80 | Grok 4.5 high | X AI | 1 | 5.0 | $2.571 | 0/1 | 77.0s |
| #102 | Grok 4.5 medium | X AI | 1 | 5.0 | $2.454 | 0/1 | 65.2s |
| #162 | Claude Opus 4.8 none | Anthropic | 1 | 5.4 | $2.328 | 0/1 | 69.1s |
| #105 | Grok 4.6 medium | X AI | 1 | 5.0 | $2.270 | 0/1 | 103.6s |
| #127 | Grok 4.7 low | X AI | 1 | 5.0 | $2.263 | 0/1 | 154.9s |
| #65 | Qwen3.7 Max medium | Qwen | 1 | 6.1 | $2.046 | 0/1 | 137.0s |
| #224 | Grok 4.20 medium | X AI | 1 | 3.0 | $1.582 | 0/1 | 128.3s |
| #189 | Step 3.7 Flash high | Stepfun | 1 | 5.4 | $1.350 | 0/1 | 130.4s |
| #108 | Grok 4.5 low | X AI | 1 | 5.0 | $1.345 | 0/1 | 61.5s |
| #168 | Kimi K2.6 medium | Moonshot AI | 1 | 5.0 | $1.323 | 0/1 | 233.9s |