AI BENCHY
Your ad here

AI BENCHY अपयशे

सूचनांचे पालन केले नाही अपयशे

कोणत्या AI मॉडेल्सना सूचनांचे पालन केले नाही सर्वाधिक वेळा येतो ते पाहा, म्हणजे निवडण्यापूर्वी विश्वासार्हतेचे धोके लक्षात येतील. क्रम लावा: प्रतिसाद वेळ (सरासरी) ↑.

दाखवलेली मॉडेल्स

15

एकूण अपयशे

180

सर्वाधिक प्रभावित मॉडेल

Mercury 2 1
क्रमांक मॉडेल कंपनी सूचनांचे पालन केले नाही संख्या स्कोअर बरोबर चाचण्या प्रतिसाद वेळ (सरासरी)
#91 Mercury 2 none Inception 1 4.8 4/18 613ms
#83 Mistral Small 4 none Mistral 2 5.2 5/18 665ms
#98 LFM2-24B-A2B none Liquid 2 4.1 1/16 811ms
#62 Gemini 2.5 Flash none Google 1 6.2 7/18 903ms
#82 Grok 4.20 none X AI 2 5.2 5/18 1.11s
#86 GPT-5.4 Mini none OpenAI 3 5.1 5/18 1.17s
#79 Grok 4.20 Beta none X AI 3 5.3 4/18 1.19s
#85 Elephant none Openrouter 3 5.2 5/18 1.23s
#81 Elephant medium Openrouter 3 5.2 5/18 1.27s
#29 Gemini 3.1 Flash Lite Preview none Google 2 7.9 12/18 1.30s
#96 GPT-5.4 Nano none OpenAI 3 4.5 2/18 1.40s
#90 Qwen3.5-9B none Qwen 3 4.8 4/18 1.47s
#66 GPT-5.4 none OpenAI 1 5.9 7/18 1.51s
#67 Qwen3.5-27B none Qwen 2 5.9 6/18 1.74s
#95 Grok 4.1 Fast none X AI 2 4.5 3/18 1.76s

सूचनांचे पालन केले नाही संख्या नुसार शीर्ष मॉडेल्स

सूचनांचे पालन केले नाही संख्या वि स्कोअर

प्रतिसाद वेळ (सरासरी) नुसार शीर्ष मॉडेल्स