स्वायत्त एजेंट कार्य रैंकिंग
देखें कि स्वायत्त एजेंट कार्य में कौन से AI मॉडल सबसे अच्छा प्रदर्शन करते हैं, कौन से भरोसेमंद बने रहते हैं और सबसे बड़े अंतर कहाँ दिखाई देते हैं। क्रमबद्ध करें: प्रतिक्रिया समय (औसत) ↓.
380/380
मॉडल फ़िल्टर करें
मौजूदा खोज और फ़िल्टर से कोई मॉडल मेल नहीं खाता।
| रैंक | मॉडल | कंपनी | स्वायत्त एजेंट कार्य स्कोर | स्कोर | कुल लागत | सही परीक्षण | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|---|
| #340 | MiniMax M2.5 medium | Minimax | 3.0 | 4.3 | $0.359 | 0/1 | 600.8s |
| #325 | Nemotron 3.5 Lightning low | NVIDIA | 3.5 | 4.6 | $0.117 | 0/1 | 597.6s |
| #206 | Kimi K2.5 medium | Moonshot AI | 3.9 | 6.4 | $0.603 | 0/1 | 566.8s |
| #287 | Nemotron 3.5 Lightning high | NVIDIA | 3.5 | 5.2 | $0.111 | 0/1 | 491.0s |
| #309 | Qwen3.5-9B none | Qwen | 3.9 | 4.9 | $0.041 | 0/1 | 433.0s |
| #341 | GLM 4.7 Flash medium | Z.ai | 3.9 | 4.2 | $0.193 | 0/1 | 399.2s |
| #134 | Grok 4.7 medium | X AI | 3.9 | 7.3 | $3.501 | 0/1 | 372.1s |
| #178 | Solar Pro 4 low | Upstage | 6.1 | 6.7 | $0.174 | 0/1 | 345.4s |
| #315 | Nemotron 3.5 Lightning medium | NVIDIA | 2.8 | 4.7 | $0.129 | 0/1 | 341.8s |
| #353 | Nemotron 3.5 Lightning none | NVIDIA | 3.0 | 3.8 | $0.007 | 0/1 | 339.6s |
| #179 | Grok 4.7 high | X AI | 3.0 | 6.7 | $3.582 | 0/1 | 322.2s |
| #281 | Kimi K2.5 none | Moonshot AI | 5.0 | 5.3 | $0.236 | 0/1 | 321.2s |
| #124 | DeepSeek V4 Flash 0731 low | DeepSeek | 4.7 | 7.4 | $0.307 | 0/1 | 321.2s |
| #174 | Solar Pro 4 xhigh | Upstage | 3.0 | 6.7 | $0.167 | 0/1 | 316.6s |
| #219 | Solar Pro 4 high | Upstage | 2.8 | 6.3 | $0.164 | 0/1 | 312.3s |