AI BENCHY
Your ad here

AI BENCHY अपयशे

सूचनांचे पालन केले नाही अपयशे

कोणत्या AI मॉडेल्सना सूचनांचे पालन केले नाही सर्वाधिक वेळा येतो ते पाहा, म्हणजे निवडण्यापूर्वी विश्वासार्हतेचे धोके लक्षात येतील. क्रम लावा: प्रतिसाद वेळ (सरासरी) ↓.

दाखवलेली मॉडेल्स

15

एकूण अपयशे

180

सर्वाधिक प्रभावित मॉडेल

Qwen3.5-9B 2
क्रमांक मॉडेल कंपनी सूचनांचे पालन केले नाही संख्या स्कोअर बरोबर चाचण्या प्रतिसाद वेळ (सरासरी)
#9 Qwen3.6 Plus Preview medium Qwen 1 8.5 13/17 13.9s
#23 MiMo-V2-Pro medium Xiaomi 1 8.1 12/18 12.3s
#15 Gemini 2.5 Flash medium Google 1 8.2 13/18 12.1s
#84 gpt-oss-120b none OpenAI 5 5.2 4/18 12.0s
#38 GPT-5.4 Nano medium OpenAI 3 7.6 11/18 11.2s
#92 Qwen3 Coder Next medium Qwen 5 4.7 3/18 10.8s
#50 Hunter Alpha medium OpenRouter 2 6.7 8/18 10.3s
#47 Grok 4.20 medium X AI 4 7.0 9/18 10.3s
#87 Qwen3 Coder Next none Qwen 1 5.1 4/18 10.2s
#25 Grok 4.20 Beta medium X AI 3 8.0 12/18 9.81s
#56 Grok 4.20 Multi Agent Beta medium X AI 4 6.4 7/18 9.80s
#88 Nemotron 3 Super none NVIDIA 4 5.1 4/18 8.54s
#28 GPT-5.2 Chat none OpenAI 1 7.9 12/18 6.84s
#60 Gemma 4 26B A4B none Google 3 6.2 7/18 6.59s
#36 GPT-5.3 Chat none OpenAI 2 7.7 11/18 5.88s

सूचनांचे पालन केले नाही संख्या नुसार शीर्ष मॉडेल्स

सूचनांचे पालन केले नाही संख्या वि स्कोअर

प्रतिसाद वेळ (सरासरी) नुसार शीर्ष मॉडेल्स