AI BENCHY
तुलना करा चार्ट्स Paddhati
❤️ Made by XCS
Your ad here

AI BENCHY श्रेणी अपयशे

सूचनांचे पालन
सूचनांचे पालन केले नाही

सूचनांचे पालन मध्ये कोणत्या AI मॉडेल्सना सूचनांचे पालन केले नाही येण्याची शक्यता जास्त आहे ते पाहा, म्हणजे कमकुवत बाजू लवकर ओळखता येतील. क्रम लावा: प्रतिसाद वेळ (सरासरी) ↑.

दाखवलेली मॉडेल्स

9

एकूण अपयशे

9

सर्वाधिक प्रभावित मॉडेल

Trinity Large Preview 1
क्रमांक मॉडेल कंपनी सूचनांचे पालन केले नाही संख्या श्रेणी स्कोअर बरोबर चाचण्या प्रतिसाद वेळ (सरासरी)
#45 Trinity Large Preview none Arcee AI 1 3.5 0/2 1.09s
#47 GPT-4o-mini none OpenAI 1 4.5 0/2 1.27s
#43 MiniMax M2.5 medium Minimax 1 8.0 1/2 4.64s
#13 Step 3.5 Flash medium Stepfun 1 9.0 1/2 4.98s
#30 Grok 4.1 Fast medium X AI 1 5.5 1/2 5.30s
#50 Qwen3 Coder Next medium Qwen 1 4.5 0/2 7.34s
#34 GPT-5 Nano medium OpenAI 1 9.0 1/2 11.9s
#32 GPT-5 Mini medium OpenAI 1 7.5 1/2 15.7s
#8 Gemini 3.1 Flash Lite Preview high Google 1 9.0 1/2 70.1s

सूचनांचे पालन केले नाही संख्या नुसार शीर्ष मॉडेल्स

सूचनांचे पालन केले नाही संख्या विरुद्ध सरासरी स्कोअर

प्रतिसाद वेळ (सरासरी) नुसार शीर्ष मॉडेल्स

अंदाजित वाया गेलेला खर्च नुसार शीर्ष मॉडेल्स