डोमेन-विशिष्ट x गलत उत्तर रैंकिंग

देखें कि डोमेन-विशिष्ट में किन AI मॉडलों में गलत उत्तर आने की सबसे अधिक संभावना है, ताकि आप कमजोरियाँ जल्दी पहचान सकें। क्रमबद्ध करें: प्रतिक्रिया समय (औसत) ↓.

दिखाए गए मॉडल

कुल विफलताएँ

412

सबसे अधिक प्रभावित मॉडल

LongCat 2.0 1

विफलता के कारण

गलत उत्तर412 समय समाप्त43 अतिरिक्त फॉर्मेटिंग17 कोई उत्तर नहीं8 API त्रुटि7 निर्देशों का पालन नहीं किया1

श्रेणियाँ

डोमेन-विशिष्ट412 एंटी-एआई ट्रिक्स293 कोडिंग252 पहेली समाधान201 सामान्य ज्ञान168 संयुक्त68 निर्देश पालन61 Samanya Buddhimatta59 डेटा पार्सिंग और निष्कर्षण41 टूल कॉलिंग3

198/198

रैंक	मॉडल	कंपनी	गलत उत्तर संख्या	श्रेणी स्कोर	कुल लागत	सही परीक्षण	प्रतिक्रिया समय (औसत)
#97	LongCat 2.0 high	Meituan	1	3.6	$0.469	0/3	400.3s
कुल टेस्ट 3 गलत टेस्ट 3 कुल लागत $0.469 प्रतिक्रिया समय (औसत) 400.3s
#60	LongCat 2.0 medium	Meituan	2	2.9	$0.478	0/3	339.9s
कुल टेस्ट 3 गलत टेस्ट 3 कुल लागत $0.478 प्रतिक्रिया समय (औसत) 339.9s
#12	Grok 4.5 high	X AI	2	3.6	$1.707	0/3	332.1s
कुल टेस्ट 3 गलत टेस्ट 3 कुल लागत $1.707 प्रतिक्रिया समय (औसत) 332.1s
#190	MiniMax M2.5 medium	Minimax	2	2.9	$0.340	0/3	237.3s
कुल टेस्ट 3 गलत टेस्ट 3 कुल लागत $0.340 प्रतिक्रिया समय (औसत) 237.3s
#128	GPT-5 Nano medium	OpenAI	1	5.2	$0.114	1/3	204.0s
कुल टेस्ट 3 गलत टेस्ट 2 कुल लागत $0.114 प्रतिक्रिया समय (औसत) 204.0s
#22	Grok 4.5 medium	X AI	3	2.9	$1.928	0/3	198.9s
कुल टेस्ट 3 गलत टेस्ट 3 कुल लागत $1.928 प्रतिक्रिया समय (औसत) 198.9s
#28	Inkling high	Thinkingmachines	1	7.7	$1.006	2/3	186.4s
कुल टेस्ट 3 गलत टेस्ट 1 कुल लागत $1.006 प्रतिक्रिया समय (औसत) 186.4s
#73	Grok 4.3 medium	X AI	2	5.3	$0.779	1/3	181.7s
कुल टेस्ट 3 गलत टेस्ट 2 कुल लागत $0.779 प्रतिक्रिया समय (औसत) 181.7s
#194	GLM 4.7 Flash medium	Z.ai	2	3.5	$0.166	0/3	174.6s
कुल टेस्ट 3 गलत टेस्ट 3 कुल लागत $0.166 प्रतिक्रिया समय (औसत) 174.6s
#130	Step 3.5 Flash medium	Stepfun	2	5.3	$0.108	1/3	170.5s
कुल टेस्ट 3 गलत टेस्ट 2 कुल लागत $0.108 प्रतिक्रिया समय (औसत) 170.5s
#10	GPT-5.5 medium	OpenAI	2	5.3	$4.137	1/3	164.1s
कुल टेस्ट 3 गलत टेस्ट 2 कुल लागत $4.137 प्रतिक्रिया समय (औसत) 164.1s
#48	Grok Build 0.1 medium	X AI	1	5.3	$1.097	1/3	158.0s
कुल टेस्ट 3 गलत टेस्ट 2 कुल लागत $1.097 प्रतिक्रिया समय (औसत) 158.0s
#46	DeepSeek V4 Pro high	DeepSeek	2	3.6	$0.200	0/3	151.5s
कुल टेस्ट 3 गलत टेस्ट 3 कुल लागत $0.200 प्रतिक्रिया समय (औसत) 151.5s
#86	Step 3.7 Flash high	Stepfun	2	4.1	$1.207	0/3	149.6s
कुल टेस्ट 3 गलत टेस्ट 3 कुल लागत $1.207 प्रतिक्रिया समय (औसत) 149.6s
#114	Qwen3.5-Flash medium	Qwen	1	5.3	$0.139	1/3	146.5s
कुल टेस्ट 3 गलत टेस्ट 2 कुल लागत $0.139 प्रतिक्रिया समय (औसत) 146.5s

1 2 14

→

मॉडल फ़िल्टर करें

गलत उत्तर संख्या के अनुसार शीर्ष मॉडल

गलत उत्तर संख्या बनाम स्कोर

प्रतिक्रिया समय (औसत) के अनुसार शीर्ष मॉडल

अनुमानित व्यर्थ लागत के अनुसार शीर्ष मॉडल

डोमेन-विशिष्ट: गलत उत्तर

मॉडल फ़िल्टर करें

गलत उत्तर संख्या के अनुसार शीर्ष मॉडल

गलत उत्तर संख्या बनाम स्कोर

प्रतिक्रिया समय (औसत) के अनुसार शीर्ष मॉडल

अनुमानित व्यर्थ लागत के अनुसार शीर्ष मॉडल