डोमेन-विशिष्ट x गलत उत्तर रैंकिंग

देखें कि डोमेन-विशिष्ट में किन AI मॉडलों में गलत उत्तर आने की सबसे अधिक संभावना है, ताकि आप कमजोरियाँ जल्दी पहचान सकें।

दिखाए गए मॉडल

कुल विफलताएँ

412

सबसे अधिक प्रभावित मॉडल

Muse Spark 1.1 3

विफलता के कारण

गलत उत्तर412 समय समाप्त43 अतिरिक्त फॉर्मेटिंग17 कोई उत्तर नहीं8 API त्रुटि7 निर्देशों का पालन नहीं किया1

श्रेणियाँ

डोमेन-विशिष्ट412 एंटी-एआई ट्रिक्स293 कोडिंग252 पहेली समाधान201 सामान्य ज्ञान168 संयुक्त68 निर्देश पालन61 Samanya Buddhimatta59 डेटा पार्सिंग और निष्कर्षण41 टूल कॉलिंग3

198/198

रैंक	मॉडल	कंपनी	गलत उत्तर संख्या	श्रेणी स्कोर	कुल लागत	सही परीक्षण	प्रतिक्रिया समय (औसत)
#16	Muse Spark 1.1 medium	Meta	3	3.5	$1.357	0/3	71.4s
कुल टेस्ट 3 गलत टेस्ट 3 कुल लागत $1.357 प्रतिक्रिया समय (औसत) 71.4s
#19	Qwen3.6 Max Preview medium	Qwen	3	2.9	$1.143	0/3	95.9s
कुल टेस्ट 3 गलत टेस्ट 3 कुल लागत $1.143 प्रतिक्रिया समय (औसत) 95.9s
#20	Grok 4.5 low	X AI	3	3.0	$0.935	0/3	72.6s
कुल टेस्ट 3 गलत टेस्ट 3 कुल लागत $0.935 प्रतिक्रिया समय (औसत) 72.6s
#22	Grok 4.5 medium	X AI	3	2.9	$1.928	0/3	198.9s
कुल टेस्ट 3 गलत टेस्ट 3 कुल लागत $1.928 प्रतिक्रिया समय (औसत) 198.9s
#24	Muse Spark 1.1 low	Meta	3	2.9	$0.647	0/3	29.7s
कुल टेस्ट 3 गलत टेस्ट 3 कुल लागत $0.647 प्रतिक्रिया समय (औसत) 29.7s
#36	Qwen3.7 Plus medium	Qwen	3	3.6	$0.267	0/3	45.3s
कुल टेस्ट 3 गलत टेस्ट 3 कुल लागत $0.267 प्रतिक्रिया समय (औसत) 45.3s
#37	Qwen3.6 Plus medium	Qwen	3	2.9	$0.405	0/3	29.6s
कुल टेस्ट 3 गलत टेस्ट 3 कुल लागत $0.405 प्रतिक्रिया समय (औसत) 29.6s
#45	DeepSeek V4 Flash high	DeepSeek	3	4.1	$0.042	0/3	100.3s
कुल टेस्ट 3 गलत टेस्ट 3 कुल लागत $0.042 प्रतिक्रिया समय (औसत) 100.3s
#51	Nemotron 3 Ultra medium	NVIDIA	3	3.5	$0.774	0/3	24.9s
कुल टेस्ट 3 गलत टेस्ट 3 कुल लागत $0.774 प्रतिक्रिया समय (औसत) 24.9s
#54	GPT-5.3 Chat none	OpenAI	3	3.5	$0.571	0/3	13.0s
कुल टेस्ट 3 गलत टेस्ट 3 कुल लागत $0.571 प्रतिक्रिया समय (औसत) 13.0s
#56	GPT-5.4 Mini medium	OpenAI	3	4.1	$0.756	0/3	65.3s
कुल टेस्ट 3 गलत टेस्ट 3 कुल लागत $0.756 प्रतिक्रिया समय (औसत) 65.3s
#62	KAT-Coder-Pro V2.5 low	Kwaipilot	3	4.1	$0.387	0/3	17.5s
कुल टेस्ट 3 गलत टेस्ट 3 कुल लागत $0.387 प्रतिक्रिया समय (औसत) 17.5s
#64	Gemini 3.1 Flash Lite Preview medium	Google	3	3.0	$0.115	0/3	4.21s
कुल टेस्ट 3 गलत टेस्ट 3 कुल लागत $0.115 प्रतिक्रिया समय (औसत) 4.21s
#65	Gemini 3.1 Flash Lite medium	Google	3	2.9	$0.117	0/3	3.16s
कुल टेस्ट 3 गलत टेस्ट 3 कुल लागत $0.117 प्रतिक्रिया समय (औसत) 3.16s
#69	KAT-Coder-Pro V2.5 high	Kwaipilot	3	2.9	$0.482	0/3	35.3s
कुल टेस्ट 3 गलत टेस्ट 3 कुल लागत $0.482 प्रतिक्रिया समय (औसत) 35.3s

1 2 14

→

मॉडल फ़िल्टर करें

गलत उत्तर संख्या के अनुसार शीर्ष मॉडल

गलत उत्तर संख्या बनाम स्कोर

प्रतिक्रिया समय (औसत) के अनुसार शीर्ष मॉडल

अनुमानित व्यर्थ लागत के अनुसार शीर्ष मॉडल

डोमेन-विशिष्ट: गलत उत्तर

मॉडल फ़िल्टर करें

गलत उत्तर संख्या के अनुसार शीर्ष मॉडल

गलत उत्तर संख्या बनाम स्कोर

प्रतिक्रिया समय (औसत) के अनुसार शीर्ष मॉडल

अनुमानित व्यर्थ लागत के अनुसार शीर्ष मॉडल