AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

AI BENCHY श्रेणी

सूचनांचे पालन क्रमवारी

सूचनांचे पालन मध्ये कोणती AI मॉडेल्स सर्वोत्तम काम करतात, कोणती विश्वासार्ह राहतात आणि सर्वात मोठी दरी कुठे दिसते ते पाहा. क्रम लावा: बरोबर चाचण्या ↑.

दाखवलेली मॉडेल्स

15

सरासरी सूचनांचे पालन स्कोअर

8.5

सर्वोत्तम मॉडेल

MiniMax M2.7 3.8
क्रमांक मॉडेल कंपनी सूचनांचे पालन स्कोअर स्कोअर बरोबर चाचण्या प्रतिसाद वेळ (सरासरी)
#61 Gemini 3.1 Flash Lite low Google 10.0 7.2 2/2 1.52s
#63 GPT-5.3 Chat none OpenAI 9.8 7.2 2/2 3.51s
#64 MiMo-V2-Flash medium Xiaomi 10.0 7.2 2/2 4.28s
#65 Grok 4.20 medium X AI 9.8 7.1 2/2 4.26s
#66 Qwen3.5-35B-A3B medium Qwen 10.0 7.1 2/2 24.4s
#67 MiniMax M3 medium Minimax 9.8 7.1 2/2 6.14s
#68 Claude Opus 4.8 none Anthropic 9.9 7.0 2/2 1.37s
#69 Claude Opus 4.6 medium Anthropic 10.0 7.0 2/2 2.43s
#70 GPT-5.4 Nano medium OpenAI 9.8 7.0 2/2 1.88s
#71 Step 3.7 Flash high Stepfun 9.8 7.0 2/2 1.52s
#72 DeepSeek V3.2 medium DeepSeek 10.0 7.0 2/2 35.8s
#73 Seed-2.0-Mini medium Bytedance Seed 10.0 6.9 2/2 17.5s
#74 Qwen3.6 Max Preview none Qwen 9.8 6.9 2/2 1.40s
#75 Ring-2.6-1T medium Inclusionai 9.8 6.9 2/2 11.8s
#76 Kimi K2.5 medium Moonshot AI 10.0 6.8 2/2 92.5s

सूचनांचे पालन स्कोअर नुसार शीर्ष मॉडेल्स

सूचनांचे पालन स्कोअर विरुद्ध एकूण खर्च

प्रतिसाद वेळ (सरासरी) नुसार शीर्ष मॉडेल्स