स्वायत्त एजेंट कार्य रैंकिंग
देखें कि स्वायत्त एजेंट कार्य में कौन से AI मॉडल सबसे अच्छा प्रदर्शन करते हैं, कौन से भरोसेमंद बने रहते हैं और सबसे बड़े अंतर कहाँ दिखाई देते हैं। क्रमबद्ध करें: कुल लागत ↑.
380/380
मॉडल फ़िल्टर करें
मौजूदा खोज और फ़िल्टर से कोई मॉडल मेल नहीं खाता।
| रैंक | मॉडल | कंपनी | स्वायत्त एजेंट कार्य स्कोर | स्कोर | कुल लागत | सही परीक्षण | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|---|
| #240 | Inkling Small medium | Thinkingmachines | 3.0 | 6.0 | $0.118 | 0/1 | 49ms |
| #189 | Mercury 2 medium | Inception | 4.7 | 6.6 | $0.121 | 0/1 | 34.9s |
| #320 | DeepSeek V3.2 none | DeepSeek | 3.0 | 4.6 | $0.121 | 0/1 | 122.5s |
| #250 | DeepSeek V4.1 Flash none | DeepSeek | 7.4 | 5.8 | $0.123 | 0/1 | 55.8s |
| #291 | Mistral Small 4 medium | Mistral | 5.0 | 5.1 | $0.126 | 0/1 | 54.1s |
| #262 | GLM 5 none | Z.ai | 5.0 | 5.6 | $0.126 | 0/1 | 74.8s |
| #315 | Nemotron 3.5 Lightning medium | NVIDIA | 2.8 | 4.7 | $0.129 | 0/1 | 341.8s |
| #312 | Hy3 preview high | Tencent | 0.0 | 4.8 | $0.135 | 0/0 | 0ms |
| #254 | GPT-5 Nano medium | OpenAI | 4.7 | 5.7 | $0.139 | 0/1 | 94.1s |
| #120 | Seed-2.0-Mini medium | Bytedance Seed | 10.0 | 7.5 | $0.140 | 1/1 | 64.5s |
| #245 | Qwen3.6 Flash none | Qwen | 5.0 | 5.9 | $0.143 | 0/1 | 93.5s |
| #221 | DeepSeek V3.2 medium | DeepSeek | 3.0 | 6.3 | $0.145 | 0/1 | 106.3s |
| #44 | GLM 5.3 Flash max | Z.ai | 10.0 | 9.0 | $0.147 | 1/1 | 96.7s |
| #305 | Laguna S 2.1 high | Poolside | 2.8 | 4.9 | $0.147 | 0/1 | 158.2s |
| #213 | Qwen3.6 27B none | Qwen | 10.0 | 6.3 | $0.147 | 1/1 | 58.6s |