स्वायत्त एजेंट कार्य रैंकिंग
देखें कि स्वायत्त एजेंट कार्य में कौन से AI मॉडल सबसे अच्छा प्रदर्शन करते हैं, कौन से भरोसेमंद बने रहते हैं और सबसे बड़े अंतर कहाँ दिखाई देते हैं। क्रमबद्ध करें: प्रतिक्रिया समय (औसत) ↓.
380/380
मॉडल फ़िल्टर करें
मौजूदा खोज और फ़िल्टर से कोई मॉडल मेल नहीं खाता।
| रैंक | मॉडल | कंपनी | स्वायत्त एजेंट कार्य स्कोर | स्कोर | कुल लागत | सही परीक्षण | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|---|
| #137 | Qwen3.6 Plus medium | Qwen | 4.7 | 7.3 | $0.391 | 0/1 | 307.1s |
| #175 | Grok 4.7 xhigh | X AI | 3.0 | 6.7 | $4.054 | 0/1 | 304.8s |
| #109 | DeepSeek V4 Flash 0731 medium | DeepSeek | 10.0 | 7.8 | $0.462 | 1/1 | 303.3s |
| #204 | Solar Pro 4 medium | Upstage | 4.7 | 6.4 | $0.174 | 0/1 | 272.3s |
| #168 | Kimi K2.6 medium | Moonshot AI | 5.0 | 6.8 | $1.323 | 0/1 | 233.9s |
| #209 | MiMo-V2.5-Pro medium | Xiaomi | 4.7 | 6.4 | $0.502 | 0/1 | 233.5s |
| #118 | GLM 5.1 medium | Z.ai | 10.0 | 7.5 | $1.066 | 1/1 | 225.6s |
| #318 | Granite 4.2 8B high | IBM Granite | 5.0 | 4.7 | $0.161 | 0/1 | 223.5s |
| #116 | Qwen3.8 27B low | Qwen | 6.1 | 7.6 | ~$0.089 | 0/1 | 211.3s |
| #304 | Qwen3 Coder Next none | Qwen | 3.9 | 4.9 | $0.065 | 0/1 | 208.4s |
| #74 | DeepSeek V4 Flash 0731 high | DeepSeek | 10.0 | 8.4 | $0.578 | 1/1 | 204.4s |
| #243 | gpt-oss-120b medium | OpenAI | 5.0 | 5.9 | $0.030 | 0/1 | 203.9s |
| #112 | Qwen3.5 Plus 2026-04-20 medium | Qwen | 10.0 | 7.7 | $0.488 | 1/1 | 203.0s |
| #298 | MiniMax M2.7 medium | Minimax | 4.7 | 5.0 | $0.202 | 0/1 | 198.8s |
| #31 | Qwen3.8 Max (0902) high | Qwen | 10.0 | 9.1 | $3.306 | 1/1 | 197.1s |