एंटी-एआई ट्रिक्स x गलत उत्तर रैंकिंग

देखें कि एंटी-एआई ट्रिक्स में किन AI मॉडलों में गलत उत्तर आने की सबसे अधिक संभावना है, ताकि आप कमजोरियाँ जल्दी पहचान सकें।

दिखाए गए मॉडल

कुल विफलताएँ

293

सबसे अधिक प्रभावित मॉडल

Seed-2.0-Lite 4

विफलता के कारण

गलत उत्तर293 निर्देशों का पालन नहीं किया33 अतिरिक्त फॉर्मेटिंग20 API त्रुटि14 कोई उत्तर नहीं4 समय समाप्त4

श्रेणियाँ

डोमेन-विशिष्ट421 एंटी-एआई ट्रिक्स293 कोडिंग259 पहेली समाधान204 सामान्य ज्ञान172 संयुक्त69 Samanya Buddhimatta62 निर्देश पालन61 डेटा पार्सिंग और निष्कर्षण41 टूल कॉलिंग3

140/140

रैंक	मॉडल	कंपनी	गलत उत्तर संख्या	श्रेणी स्कोर	कुल लागत	सही परीक्षण	प्रतिक्रिया समय (औसत)
#44	Claude Sonnet 4.6 medium	Anthropic	1	6.5	$2.057	2/4	2.98s
कुल टेस्ट 4 गलत टेस्ट 2 कुल लागत $2.057 प्रतिक्रिया समय (औसत) 2.98s
#48	GPT-5.6 Luna high	OpenAI	1	8.3	$1.017	3/4	2.99s
कुल टेस्ट 4 गलत टेस्ट 1 कुल लागत $1.017 प्रतिक्रिया समय (औसत) 2.99s
#49	DeepSeek V4 Flash high	DeepSeek	1	8.3	$0.041	3/4	28.5s
कुल टेस्ट 4 गलत टेस्ट 1 कुल लागत $0.041 प्रतिक्रिया समय (औसत) 28.5s
#54	GPT-5.6 Luna medium	OpenAI	1	8.3	$0.352	3/4	2.52s
कुल टेस्ट 4 गलत टेस्ट 1 कुल लागत $0.352 प्रतिक्रिया समय (औसत) 2.52s
#57	GPT-5.4 Nano medium	OpenAI	1	8.3	$0.138	3/4	4.52s
कुल टेस्ट 4 गलत टेस्ट 1 कुल लागत $0.138 प्रतिक्रिया समय (औसत) 4.52s
#58	GPT-5.3 Chat none	OpenAI	1	6.7	$0.571	2/4	3.86s
कुल टेस्ट 4 गलत टेस्ट 2 कुल लागत $0.571 प्रतिक्रिया समय (औसत) 3.86s
#59	GPT-5.6 Terra low	OpenAI	1	8.3	$0.519	3/4	2.36s
कुल टेस्ट 4 गलत टेस्ट 1 कुल लागत $0.519 प्रतिक्रिया समय (औसत) 2.36s
#60	GPT-5.4 Mini medium	OpenAI	1	8.6	$0.756	3/4	4.05s
कुल टेस्ट 4 गलत टेस्ट 1 कुल लागत $0.756 प्रतिक्रिया समय (औसत) 4.05s
#61	Qwen3.5 Plus 2026-02-15 medium	Qwen	1	8.2	$0.437	3/4	45.8s
कुल टेस्ट 4 गलत टेस्ट 1 कुल लागत $0.437 प्रतिक्रिया समय (औसत) 45.8s
#67	Claude Sonnet 4.6 none	Anthropic	1	4.8	$0.661	1/4	2.94s
कुल टेस्ट 4 गलत टेस्ट 3 कुल लागत $0.661 प्रतिक्रिया समय (औसत) 2.94s
#71	Step 3.7 Flash low	Stepfun	1	8.7	$0.454	3/4	4.02s
कुल टेस्ट 4 गलत टेस्ट 1 कुल लागत $0.454 प्रतिक्रिया समय (औसत) 4.02s
#72	Kimi K2.6 medium	Moonshot AI	1	7.0	$1.036	2/4	11.6s
कुल टेस्ट 4 गलत टेस्ट 2 कुल लागत $1.036 प्रतिक्रिया समय (औसत) 11.6s
#79	Grok 4.20 medium	X AI	1	8.2	$0.777	3/4	3.95s
कुल टेस्ट 4 गलत टेस्ट 1 कुल लागत $0.777 प्रतिक्रिया समय (औसत) 3.95s
#81	Kimi K2.5 medium	Moonshot AI	1	7.3	$0.600	2/4	51.4s
कुल टेस्ट 4 गलत टेस्ट 2 कुल लागत $0.600 प्रतिक्रिया समय (औसत) 51.4s
#82	Mercury 2 medium	Inception	1	6.9	$0.093	2/4	1.12s
कुल टेस्ट 4 गलत टेस्ट 2 कुल लागत $0.093 प्रतिक्रिया समय (औसत) 1.12s

मॉडल फ़िल्टर करें

गलत उत्तर संख्या के अनुसार शीर्ष मॉडल

गलत उत्तर संख्या बनाम स्कोर

प्रतिक्रिया समय (औसत) के अनुसार शीर्ष मॉडल

अनुमानित व्यर्थ लागत के अनुसार शीर्ष मॉडल

एंटी-एआई ट्रिक्स: गलत उत्तर

मॉडल फ़िल्टर करें

गलत उत्तर संख्या के अनुसार शीर्ष मॉडल

गलत उत्तर संख्या बनाम स्कोर

प्रतिक्रिया समय (औसत) के अनुसार शीर्ष मॉडल

अनुमानित व्यर्थ लागत के अनुसार शीर्ष मॉडल