डोमेन-विशिष्ट x गलत उत्तर रैंकिंग

देखें कि डोमेन-विशिष्ट में किन AI मॉडलों में गलत उत्तर आने की सबसे अधिक संभावना है, ताकि आप कमजोरियाँ जल्दी पहचान सकें। क्रमबद्ध करें: सही परीक्षण ↓.

दिखाए गए मॉडल

कुल विफलताएँ

412

सबसे अधिक प्रभावित मॉडल

Gemini 3.5 Flash 1

विफलता के कारण

गलत उत्तर412 समय समाप्त43 अतिरिक्त फॉर्मेटिंग17 कोई उत्तर नहीं8 API त्रुटि7 निर्देशों का पालन नहीं किया1

श्रेणियाँ

डोमेन-विशिष्ट412 एंटी-एआई ट्रिक्स293 कोडिंग252 पहेली समाधान201 सामान्य ज्ञान168 संयुक्त68 निर्देश पालन61 Samanya Buddhimatta59 डेटा पार्सिंग और निष्कर्षण41 टूल कॉलिंग3

198/198

रैंक	मॉडल	कंपनी	गलत उत्तर संख्या	श्रेणी स्कोर	कुल लागत	सही परीक्षण	प्रतिक्रिया समय (औसत)
#2	Gemini 3.5 Flash high	Google	1	7.6	$1.976	2/3	14.1s
कुल टेस्ट 3 गलत टेस्ट 1 कुल लागत $1.976 प्रतिक्रिया समय (औसत) 14.1s
#7	Gemini 3.1 Pro Preview medium	Google	1	7.7	$1.361	2/3	32.7s
कुल टेस्ट 3 गलत टेस्ट 1 कुल लागत $1.361 प्रतिक्रिया समय (औसत) 32.7s
#9	Gemini 3.5 Flash medium	Google	1	7.7	$0.642	2/3	5.24s
कुल टेस्ट 3 गलत टेस्ट 1 कुल लागत $0.642 प्रतिक्रिया समय (औसत) 5.24s
#11	Gemini 3.5 Flash low	Google	1	7.7	$0.433	2/3	3.39s
कुल टेस्ट 3 गलत टेस्ट 1 कुल लागत $0.433 प्रतिक्रिया समय (औसत) 3.39s
#23	Claude Sonnet 5 medium	Anthropic	1	7.7	$0.922	2/3	20.4s
कुल टेस्ट 3 गलत टेस्ट 1 कुल लागत $0.922 प्रतिक्रिया समय (औसत) 20.4s
#28	Inkling high	Thinkingmachines	1	7.7	$1.006	2/3	186.4s
कुल टेस्ट 3 गलत टेस्ट 1 कुल लागत $1.006 प्रतिक्रिया समय (औसत) 186.4s
#29	Step 3.7 Flash medium	Stepfun	1	7.7	$0.515	2/3	48.3s
कुल टेस्ट 3 गलत टेस्ट 1 कुल लागत $0.515 प्रतिक्रिया समय (औसत) 48.3s
#44	GPT-5.6 Luna high	OpenAI	1	7.7	$1.017	2/3	79.0s
कुल टेस्ट 3 गलत टेस्ट 1 कुल लागत $1.017 प्रतिक्रिया समय (औसत) 79.0s
#59	Qwen3.7 Max none	Qwen	1	7.7	$0.197	2/3	975ms
कुल टेस्ट 3 गलत टेस्ट 1 कुल लागत $0.197 प्रतिक्रिया समय (औसत) 975ms
#63	Claude Sonnet 4.6 none	Anthropic	1	7.7	$0.661	2/3	3.54s
कुल टेस्ट 3 गलत टेस्ट 1 कुल लागत $0.661 प्रतिक्रिया समय (औसत) 3.54s
#79	Gemini 3.5 Flash none	Google	1	7.6	$1.079	2/3	10.6s
कुल टेस्ट 3 गलत टेस्ट 1 कुल लागत $1.079 प्रतिक्रिया समय (औसत) 10.6s
#89	Gemini 3 Flash Preview none	Google	1	7.7	$0.085	2/3	963ms
कुल टेस्ट 3 गलत टेस्ट 1 कुल लागत $0.085 प्रतिक्रिया समय (औसत) 963ms
#94	Claude Opus 4.7 none	Anthropic	1	7.7	$0.505	2/3	1.19s
कुल टेस्ट 3 गलत टेस्ट 1 कुल लागत $0.505 प्रतिक्रिया समय (औसत) 1.19s
#98	Qwen3.6 Max Preview none	Qwen	1	7.7	$0.231	2/3	1.22s
कुल टेस्ट 3 गलत टेस्ट 1 कुल लागत $0.231 प्रतिक्रिया समय (औसत) 1.22s
#110	Gemma 4 31B medium	Google	1	7.7	$0.163	2/3	38.5s
कुल टेस्ट 3 गलत टेस्ट 1 कुल लागत $0.163 प्रतिक्रिया समय (औसत) 38.5s

1 2 14

→

मॉडल फ़िल्टर करें

गलत उत्तर संख्या के अनुसार शीर्ष मॉडल

गलत उत्तर संख्या बनाम स्कोर

प्रतिक्रिया समय (औसत) के अनुसार शीर्ष मॉडल

अनुमानित व्यर्थ लागत के अनुसार शीर्ष मॉडल

डोमेन-विशिष्ट: गलत उत्तर

मॉडल फ़िल्टर करें

गलत उत्तर संख्या के अनुसार शीर्ष मॉडल

गलत उत्तर संख्या बनाम स्कोर

प्रतिक्रिया समय (औसत) के अनुसार शीर्ष मॉडल

अनुमानित व्यर्थ लागत के अनुसार शीर्ष मॉडल