स्वायत्त एजेंट कार्य रैंकिंग
देखें कि स्वायत्त एजेंट कार्य में कौन से AI मॉडल सबसे अच्छा प्रदर्शन करते हैं, कौन से भरोसेमंद बने रहते हैं और सबसे बड़े अंतर कहाँ दिखाई देते हैं। क्रमबद्ध करें: सही परीक्षण ↑.
380/380
मॉडल फ़िल्टर करें
मौजूदा खोज और फ़िल्टर से कोई मॉडल मेल नहीं खाता।
| रैंक | मॉडल | कंपनी | स्वायत्त एजेंट कार्य स्कोर | स्कोर | कुल लागत | सही परीक्षण | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|---|
| #51 | DeepSeek V4.1 Flash high | DeepSeek | 10.0 | 8.7 | $0.190 | 1/1 | 44.0s |
| #52 | DeepSeek V4.1 Flash medium | DeepSeek | 10.0 | 8.7 | $0.182 | 1/1 | 47.6s |
| #53 | Muse Spark 1.2 low | Meta | 10.0 | 8.7 | $0.881 | 1/1 | 56.8s |
| #54 | GPT-5.2 medium | OpenAI | 10.0 | 8.7 | $1.540 | 1/1 | 75.9s |
| #55 | Qwen3.8 27B high | Qwen | 10.0 | 8.7 | ~$0.298 | 1/1 | 132.3s |
| #56 | MiMo-V2.6-Pro medium | Xiaomi | 10.0 | 8.7 | $0.586 | 1/1 | 161.4s |
| #57 | Seed 2.1 Turbo medium | Bytedance Seed | 10.0 | 8.7 | $2.042 | 1/1 | 90.9s |
| #58 | GPT-6 Sol low | OpenAI | 10.0 | 8.7 | $0.477 | 1/1 | 48.4s |
| #59 | DeepSeek V4.1 Flash max | DeepSeek | 10.0 | 8.6 | $0.368 | 1/1 | 66.6s |
| #60 | Muse Spark 1.1 low | Meta | 10.0 | 8.6 | $0.885 | 1/1 | 42.2s |
| #61 | Claude Sonnet 5.5 xhigh | Anthropic | 10.0 | 8.6 | $1.516 | 1/1 | 54.9s |
| #62 | Claude Sonnet 5.5 high | Anthropic | 10.0 | 8.6 | $1.175 | 1/1 | 51.5s |
| #65 | Muse Spark 1.3 low | Meta | 10.0 | 8.5 | $0.911 | 1/1 | 55.1s |
| #66 | Claude Sonnet 5 medium | Anthropic | 10.0 | 8.5 | $1.438 | 1/1 | 69.3s |
| #68 | Qwen3.8 2.4T A95B low | Qwen | 10.0 | 8.4 | $3.172 | 1/1 | 151.8s |