AI BENCHY
Your ad here

AI BENCHY বিভাগীয় ব্যর্থতা

ডোমেইন-নির্দিষ্ট: অতিরিক্ত ফরম্যাটিং

ডোমেইন-নির্দিষ্ট
অতিরিক্ত ফরম্যাটিং

দেখুন ডোমেইন-নির্দিষ্ট এ কোন AI মডেলগুলোর অতিরিক্ত ফরম্যাটিং হওয়ার সম্ভাবনা সবচেয়ে বেশি, যাতে দুর্বল দিক দ্রুত ধরা যায়। সাজান: সঠিক টেস্ট ↑.

দেখানো মডেল

7

মোট ব্যর্থতা

8

সবচেয়ে বেশি প্রভাবিত মডেল

Claude Sonnet 4.6 1
র‍্যাঙ্ক মডেল কোম্পানি অতিরিক্ত ফরম্যাটিং সংখ্যা বিভাগ স্কোর সঠিক টেস্ট প্রতিক্রিয়া সময় (গড়)
#26 Claude Sonnet 4.6 medium Anthropic 1 2.9 0/3 0ms
#35 MiMo-V2-Omni medium Xiaomi 1 3.0 0/3 55.1s
#37 Claude Opus 4.6 medium Anthropic 2 3.0 0/3 83.4s
#50 Hunter Alpha medium OpenRouter 1 3.0 0/3 10.5s
#56 Grok 4.20 Multi Agent Beta medium X AI 1 2.9 0/3 24.7s
#82 Grok 4.20 none X AI 1 3.0 0/3 687ms
#47 Grok 4.20 medium X AI 1 5.3 1/3 27.0s

অতিরিক্ত ফরম্যাটিং সংখ্যা অনুযায়ী শীর্ষ মডেল

অতিরিক্ত ফরম্যাটিং সংখ্যা বনাম স্কোর

প্রতিক্রিয়া সময় (গড়) অনুযায়ী শীর্ষ মডেল

আনুমানিক অপচয় হওয়া খরচ অনুযায়ী শীর্ষ মডেল