स्वायत्त एजेंट कार्य रैंकिंग
देखें कि स्वायत्त एजेंट कार्य में कौन से AI मॉडल सबसे अच्छा प्रदर्शन करते हैं, कौन से भरोसेमंद बने रहते हैं और सबसे बड़े अंतर कहाँ दिखाई देते हैं। क्रमबद्ध करें: प्रतिक्रिया समय (औसत) ↓.
380/380
मॉडल फ़िल्टर करें
मौजूदा खोज और फ़िल्टर से कोई मॉडल मेल नहीं खाता।
| रैंक | मॉडल | कंपनी | स्वायत्त एजेंट कार्य स्कोर | स्कोर | कुल लागत | सही परीक्षण | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|---|
| #126 | GLM 5.3 FlashX high | Z.ai | 10.0 | 7.4 | $0.210 | 1/1 | 78.0s |
| #238 | GLM 5.3 FlashX low | Z.ai | 4.7 | 6.0 | $0.157 | 0/1 | 78.0s |
| #82 | Grok 4.5 high | X AI | 5.0 | 8.2 | $2.571 | 0/1 | 77.0s |
| #36 | Pareto none | Unbiased | 10.0 | 9.1 | $1.520 | 1/1 | 76.5s |
| #241 | Seed-2.0-Lite none | Bytedance Seed | 5.0 | 6.0 | $0.114 | 0/1 | 76.0s |
| #54 | GPT-5.2 medium | OpenAI | 10.0 | 8.7 | $1.540 | 1/1 | 75.9s |
| #268 | Gemma 4 26B A4B none | 5.0 | 5.5 | $0.026 | 0/1 | 75.8s | |
| #262 | GLM 5 none | Z.ai | 5.0 | 5.6 | $0.126 | 0/1 | 74.8s |
| #171 | Mercury 2.5 Preview medium | Inception | 3.9 | 6.8 | $0.037 | 0/1 | 74.6s |
| #150 | GLM 5.3 FlashX medium | Z.ai | 10.0 | 7.1 | $0.114 | 1/1 | 74.4s |
| #78 | Kimi K3 max | Moonshot AI | 10.0 | 8.3 | $4.013 | 1/1 | 74.2s |
| #93 | GPT-5.4 Nano medium | OpenAI | 10.0 | 8.0 | $0.187 | 1/1 | 74.0s |
| #118 | Space Bunny Alpha high | Stealth | 10.0 | 7.5 | $0.000 | 1/1 | 73.4s |
| #42 | Claude Opus 5 low | Anthropic | 10.0 | 9.0 | $2.350 | 1/1 | 73.2s |
| #256 | Seed 2.1 Turbo none | Bytedance Seed | 5.0 | 5.7 | $0.182 | 0/1 | 71.4s |