ترتيب مهام الوكلاء
اكتشف أي نماذج الذكاء الاصطناعي تؤدي أفضل في مهام الوكلاء، وأيها يظل أكثر اعتمادية، وأين تظهر أكبر الفجوات. الترتيب حسب: اختبارات صحيحة ↑.
380/380
تصفية النماذج
لا توجد نماذج تطابق البحث والفلاتر الحالية.
| الترتيب | النموذج | الشركة | درجة مهام الوكلاء | النتيجة | إجمالي التكلفة | اختبارات صحيحة | زمن الاستجابة (المتوسط) |
|---|---|---|---|---|---|---|---|
| #198 | KAT-Coder-Pro V2.5 high | Kwaipilot | 3.0 | 6.5 | $0.506 | 0/1 | 1.52s |
| #199 | Grok 4.3 medium | X AI | 3.9 | 6.5 | $0.989 | 0/1 | 51.6s |
| #200 | Laguna XS 2.1 medium | Poolside | 6.1 | 6.4 | $0.083 | 0/1 | 66.4s |
| #202 | Gemini 3 Flash Preview none | 5.0 | 6.4 | $0.155 | 0/1 | 57.8s | |
| #203 | Solar Pro 4 medium | Upstage | 4.7 | 6.4 | $0.174 | 0/1 | 272.3s |
| #204 | Claude Sonnet 4.6 medium | Anthropic | 0.0 | 6.4 | $2.126 | 0/0 | 0ms |
| #205 | Kimi K2.5 medium | Moonshot AI | 3.9 | 6.4 | $0.603 | 0/1 | 566.8s |
| #206 | Mercury 2.5 medium | Inception | 4.7 | 6.4 | $0.034 | 0/1 | 107.9s |
| #207 | Gemini 3.5 Flash minimal | 5.0 | 6.4 | $0.508 | 0/1 | 49.2s | |
| #208 | MiMo-V2.5-Pro medium | Xiaomi | 4.7 | 6.4 | $0.502 | 0/1 | 233.5s |
| #209 | Dots 3 Note Preview high | Dots Studio | 6.1 | 6.4 | $0.000 | 0/1 | 129.1s |
| #210 | Dots 3 Note Preview low | Dots Studio | 6.1 | 6.4 | $0.000 | 0/1 | 161.2s |
| #211 | LongCat 2.0 none | Meituan | 6.1 | 6.4 | $0.104 | 0/1 | 81.8s |
| #212 | Qwen3.5-35B-A3B medium | Qwen | 7.4 | 6.3 | $1.249 | 0/1 | 126.8s |
| #214 | Gemini 3.5 Flash Lite low | 5.0 | 6.3 | $0.183 | 0/1 | 53.9s |