ترتيب اتباع التعليمات
اكتشف أي نماذج الذكاء الاصطناعي تؤدي أفضل في اتباع التعليمات، وأيها يظل أكثر اعتمادية، وأين تظهر أكبر الفجوات. الترتيب حسب: إجمالي التكلفة ↑.
216/216
تصفية النماذج
لا توجد نماذج تطابق البحث والفلاتر الحالية.
| الترتيب | النموذج | الشركة | درجة اتباع التعليمات | النتيجة | إجمالي التكلفة | اختبارات صحيحة | زمن الاستجابة (المتوسط) |
|---|---|---|---|---|---|---|---|
| #136 | Step 3.5 Flash medium | Stepfun | 8.3 | 6.0 | $0.108 | 1/2 | 4.78s |
| #134 | GPT-5 Nano medium | OpenAI | 9.8 | 6.1 | $0.114 | 2/2 | 15.6s |
| #68 | Gemini 3.1 Flash Lite Preview medium | 10.0 | 7.3 | $0.115 | 2/2 | 1.91s | |
| #69 | Gemini 3.1 Flash Lite medium | 9.9 | 7.3 | $0.117 | 2/2 | 2.59s | |
| #132 | Qwen3.5 Plus 2026-04-20 none | Qwen | 6.2 | 6.1 | $0.122 | 1/2 | 1.17s |
| #161 | Kimi K2.5 none | Moonshot AI | 6.5 | 5.5 | $0.127 | 1/2 | 2.67s |
| #101 | GLM 5.2 none | Z.ai | 9.8 | 6.6 | $0.128 | 2/2 | 3.84s |
| #57 | GPT-5.4 Nano medium | OpenAI | 9.8 | 7.5 | $0.138 | 2/2 | 1.88s |
| #120 | Qwen3.5-Flash medium | Qwen | 10.0 | 6.2 | $0.139 | 2/2 | 63.5s |
| #165 | GPT-5.6 Luna none | OpenAI | 7.1 | 5.4 | $0.142 | 1/2 | 1.23s |
| #95 | Gemini 3.5 Flash-Lite low | 9.8 | 6.7 | $0.145 | 2/2 | 869ms | |
| #170 | Inkling none | Thinkingmachines | 6.3 | 5.2 | $0.147 | 1/2 | 1.72s |
| #178 | MiniMax M2.7 medium | Minimax | 3.8 | 5.0 | $0.163 | 0/2 | 12.8s |
| #157 | GLM 5.1 none | Z.ai | 9.8 | 5.5 | $0.164 | 2/2 | 1.98s |
| #200 | GLM 4.7 Flash medium | Z.ai | 6.2 | 4.3 | $0.166 | 1/2 | 2.97s |