حيل مضادة للذكاء الاصطناعي: لم يتبع التعليمات
حيل مضادة للذكاء الاصطناعي
لم يتبع التعليمات
اكتشف أي نماذج الذكاء الاصطناعي هي الأكثر عرضة لظهور لم يتبع التعليمات في حيل مضادة للذكاء الاصطناعي، حتى ترصد نقاط الضعف بسرعة أكبر.
أسباب الفشل
42/42
تصفية النماذج
لا توجد نماذج تطابق البحث والفلاتر الحالية.
| الترتيب | النموذج | الشركة | عدد لم يتبع التعليمات | درجة الفئة | إجمالي التكلفة | اختبارات صحيحة | زمن الاستجابة (المتوسط) |
|---|---|---|---|---|---|---|---|
| #36 | Muse Spark 1.2 high | Meta | 2 | 7.1 | $1.771 | 2/4 | 6.00s |
| #295 | Hy3 preview none | Tencent | 2 | 4.8 | $0.007 | 1/4 | 11.1s |
| #37 | Muse Spark 1.2 medium | Meta | 1 | 7.3 | $1.339 | 2/4 | 5.38s |
| #44 | Muse Spark 1.2 low | Meta | 1 | 9.2 | $0.655 | 3/4 | 3.26s |
| #47 | GPT-5.2 medium | OpenAI | 1 | 6.5 | $1.182 | 2/4 | 7.81s |
| #57 | GPT-5 Mini medium | OpenAI | 1 | 7.1 | $0.241 | 2/4 | 13.9s |
| #60 | Muse Spark 1.1 high | Meta | 1 | 7.5 | $2.253 | 2/4 | 8.60s |
| #68 | Step 3.7 Flash medium | Stepfun | 1 | 8.7 | $0.495 | 3/4 | 9.65s |
| #92 | MiniMax M3 medium | Minimax | 1 | 5.5 | $0.300 | 1/4 | 14.9s |
| #93 | GPT 5.3 Chat none | OpenAI | 1 | 6.7 | $0.533 | 2/4 | 3.86s |
| #100 | Gemini 3.1 Flash Lite Preview medium | 1 | 9.1 | $0.117 | 3/4 | 2.33s | |
| #112 | Gemini 3.1 Flash Lite medium | 1 | 9.1 | $0.120 | 3/4 | 2.39s | |
| #116 | Kimi K2.6 medium | Moonshot AI | 1 | 7.0 | $1.247 | 2/4 | 11.6s |
| #131 | Mercury 2 medium | Inception | 1 | 6.9 | $0.094 | 2/4 | 1.12s |
| #145 | DeepSeek V4 Pro none | DeepSeek | 1 | 3.2 | $0.226 | 0/4 | 4.02s |