AI BENCHY
Your ad here

إخفاقات الفئات في AI BENCHY

حل الألغاز: إجابة خاطئة

حل الألغاز
إجابة خاطئة

اكتشف أي نماذج الذكاء الاصطناعي هي الأكثر عرضة لظهور إجابة خاطئة في حل الألغاز، حتى ترصد نقاط الضعف بسرعة أكبر.

النماذج المعروضة

15

إجمالي الإخفاقات

85

النموذج الأكثر تأثرًا

Kimi K2.5 3
الترتيب النموذج الشركة عدد إجابة خاطئة درجة الفئة اختبارات صحيحة زمن الاستجابة (المتوسط)
#67 Qwen3.5-27B none Qwen 1 6.7 1/3 1.37s
#68 gpt-oss-120b medium OpenAI 1 3.2 0/3 11.8s
#69 Kimi K2.6 none Moonshot AI 1 3.4 0/3 1.66s
#71 MiniMax M2.5 medium Minimax 1 5.3 1/3 11.5s
#72 Hunter Alpha none OpenRouter 1 5.8 1/3 3.06s
#73 Mistral Small 4 medium Mistral 1 3.4 0/3 2.00s
#74 GLM 4.7 Flash none Z.ai 1 4.4 0/3 1.00s
#75 GLM 5.1 none Z.ai 1 5.7 1/3 1.48s
#77 GLM 5 Turbo none Z.ai 1 5.5 1/3 2.43s
#79 Grok 4.20 Beta none X AI 1 5.9 1/3 541ms
#80 MiniMax M2.7 medium Minimax 1 3.8 0/3 25.6s
#81 Elephant medium Openrouter 1 3.7 0/3 867ms
#82 Grok 4.20 none X AI 1 5.3 1/3 487ms
#83 Mistral Small 4 none Mistral 1 3.1 0/3 589ms
#84 gpt-oss-120b none OpenAI 1 4.5 0/3 6.86s

أفضل النماذج حسب عدد إجابة خاطئة

عدد إجابة خاطئة مقابل النتيجة

أفضل النماذج حسب زمن الاستجابة (المتوسط)

أفضل النماذج حسب التكلفة المهدرة التقديرية