स्वायत्त एजेंट कार्य रैंकिंग
देखें कि स्वायत्त एजेंट कार्य में कौन से AI मॉडल सबसे अच्छा प्रदर्शन करते हैं, कौन से भरोसेमंद बने रहते हैं और सबसे बड़े अंतर कहाँ दिखाई देते हैं। क्रमबद्ध करें: कुल लागत ↓.
380/380
मॉडल फ़िल्टर करें
मौजूदा खोज और फ़िल्टर से कोई मॉडल मेल नहीं खाता।
| रैंक | मॉडल | कंपनी | स्वायत्त एजेंट कार्य स्कोर | स्कोर | कुल लागत | सही परीक्षण | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|---|
| #292 | Mistral Small 4 none | Mistral | 5.0 | 5.1 | $0.047 | 0/1 | 45.5s |
| #343 | GLM 5 Turbo none | Z.ai | 0.0 | 4.2 | $0.047 | 0/0 | 0ms |
| #317 | Laguna S 2.1 none | Poolside | 5.4 | 4.7 | $0.047 | 0/1 | 149.3s |
| #301 | KAT Coder AIR V2.5 low | Kwaipilot | 3.0 | 5.0 | $0.046 | 0/1 | 1.08s |
| #327 | Mimo V2 PRO none | Xiaomi | 0.0 | 4.6 | $0.045 | 0/0 | 0ms |
| #195 | Mercury 2.5 high | Inception | 3.9 | 6.5 | $0.044 | 0/1 | 80.3s |
| #290 | MiMo-V2-Flash medium | Xiaomi | 0.0 | 5.1 | $0.043 | 0/0 | 0ms |
| #330 | Hy3 preview low | Tencent | 0.0 | 4.5 | $0.042 | 0/0 | 0ms |
| #309 | Qwen3.5-9B none | Qwen | 3.9 | 4.9 | $0.041 | 0/1 | 433.0s |
| #194 | Mercury 2.5 Preview high | Inception | 6.1 | 6.5 | $0.039 | 0/1 | 86.8s |
| #171 | Mercury 2.5 Preview medium | Inception | 3.9 | 6.8 | $0.037 | 0/1 | 74.6s |
| #280 | Granite 4.2 8B low | IBM Granite | 6.1 | 5.3 | $0.036 | 0/1 | 142.7s |
| #206 | Mercury 2.5 medium | Inception | 4.7 | 6.4 | $0.034 | 0/1 | 107.9s |
| #338 | Mercury 2 none | Inception | 3.0 | 4.4 | $0.033 | 0/1 | 9.00s |
| #261 | Solar Pro 4 none | Upstage | 5.0 | 5.6 | $0.033 | 0/1 | 69.2s |