स्वायत्त एजेंट कार्य रैंकिंग
देखें कि स्वायत्त एजेंट कार्य में कौन से AI मॉडल सबसे अच्छा प्रदर्शन करते हैं, कौन से भरोसेमंद बने रहते हैं और सबसे बड़े अंतर कहाँ दिखाई देते हैं। क्रमबद्ध करें: सही परीक्षण ↓.
380/380
मॉडल फ़िल्टर करें
मौजूदा खोज और फ़िल्टर से कोई मॉडल मेल नहीं खाता।
| रैंक | मॉडल | कंपनी | स्वायत्त एजेंट कार्य स्कोर | स्कोर | कुल लागत | सही परीक्षण | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|---|
| #80 | Claude Opus 4.8 medium | Anthropic | 6.1 | 8.3 | $3.490 | 0/1 | 99.4s |
| #82 | Grok 4.5 high | X AI | 5.0 | 8.2 | $2.571 | 0/1 | 77.0s |
| #88 | Claude Opus 4.7 medium | Anthropic | 5.2 | 8.1 | $3.636 | 0/1 | 150.6s |
| #90 | DeepSeek V4.1 Flash low | DeepSeek | 6.1 | 8.0 | $0.153 | 0/1 | 56.0s |
| #94 | Gemini 3.8 Flash medium | 2.8 | 8.0 | $0.769 | 0/1 | 63.7s | |
| #97 | GLM 5.3 FlashX max | Z.ai | 6.1 | 7.9 | $0.623 | 0/1 | 104.8s |
| #98 | Claude Fable 5.1 high | Anthropic | 3.0 | 7.9 | $3.471 | 0/1 | 6.93s |
| #101 | Gemini 3.5 Flash medium | 2.8 | 7.9 | $1.316 | 0/1 | 84.5s | |
| #104 | Grok 4.5 medium | X AI | 5.0 | 7.8 | $2.454 | 0/1 | 65.2s |
| #106 | Step 3.7 Flash medium | Stepfun | 7.4 | 7.8 | $0.571 | 0/1 | 93.9s |
| #107 | Grok 4.6 medium | X AI | 5.0 | 7.8 | $2.270 | 0/1 | 103.6s |
| #109 | Grok 4.5 low | X AI | 5.0 | 7.8 | $1.345 | 0/1 | 61.5s |
| #111 | GPT-6 Luna high | OpenAI | 5.2 | 7.7 | $0.074 | 0/1 | 82.8s |
| #117 | Qwen3.8 27B low | Qwen | 6.1 | 7.6 | ~$0.089 | 0/1 | 211.3s |
| #122 | GPT-5.6 Luna medium | OpenAI | 7.4 | 7.4 | $0.101 | 0/1 | 58.1s |