डोमेन-विशिष्ट मॉडल रैंकिंग

देखें कि डोमेन-विशिष्ट में कौन से AI मॉडल सबसे अच्छा प्रदर्शन करते हैं, कौन से भरोसेमंद बने रहते हैं और सबसे बड़े अंतर कहाँ दिखाई देते हैं। क्रमबद्ध करें: सही परीक्षण ↓.

दिखाए गए मॉडल

औसत डोमेन-विशिष्ट स्कोर

4.7

सर्वश्रेष्ठ मॉडल

Gemini 3.6 Flash 10.0

विफलता के कारण

विफलता कारण गलत उत्तर के साथ421 विफलता कारण समय समाप्त के साथ43 विफलता कारण अतिरिक्त फॉर्मेटिंग के साथ17 विफलता कारण कोई उत्तर नहीं के साथ8 विफलता कारण API त्रुटि के साथ7 विफलता कारण निर्देशों का पालन नहीं किया के साथ1

216/216

रैंक	मॉडल	कंपनी	डोमेन-विशिष्ट स्कोर	स्कोर	कुल लागत	सही परीक्षण	प्रतिक्रिया समय (औसत)
#43	GPT-5.6 Terra medium	OpenAI	5.3	7.8	$0.676	1/3	23.4s
कुल टेस्ट 3 गलत टेस्ट 2 कुल लागत $0.676 प्रतिक्रिया समय (औसत) 23.4s
#45	Claude Opus 4.8 low	Anthropic	5.3	7.8	$2.077	1/3	45.5s
कुल टेस्ट 3 गलत टेस्ट 2 कुल लागत $2.077 प्रतिक्रिया समय (औसत) 45.5s
#51	MiniMax M3 medium	Minimax	5.5	7.6	$0.286	1/3	233.1s
कुल टेस्ट 3 गलत टेस्ट 2 कुल लागत $0.286 प्रतिक्रिया समय (औसत) 233.1s
#52	Grok Build 0.1 medium	X AI	5.3	7.6	$1.097	1/3	158.0s
कुल टेस्ट 3 गलत टेस्ट 2 कुल लागत $1.097 प्रतिक्रिया समय (औसत) 158.0s
#54	GPT-5.6 Luna medium	OpenAI	5.3	7.6	$0.352	1/3	17.4s
कुल टेस्ट 3 गलत टेस्ट 2 कुल लागत $0.352 प्रतिक्रिया समय (औसत) 17.4s
#56	Kimi K2.7 Code medium	Moonshot AI	5.5	7.5	$0.740	1/3	213.3s
कुल टेस्ट 3 गलत टेस्ट 2 कुल लागत $0.740 प्रतिक्रिया समय (औसत) 213.3s
#57	GPT-5.4 Nano medium	OpenAI	5.9	7.5	$0.138	1/3	38.2s
कुल टेस्ट 3 गलत टेस्ट 2 कुल लागत $0.138 प्रतिक्रिया समय (औसत) 38.2s
#59	GPT-5.6 Terra low	OpenAI	5.3	7.5	$0.519	1/3	8.34s
कुल टेस्ट 3 गलत टेस्ट 2 कुल लागत $0.519 प्रतिक्रिया समय (औसत) 8.34s
#61	Qwen3.5 Plus 2026-02-15 medium	Qwen	5.3	7.5	$0.437	1/3	17.5s
कुल टेस्ट 3 गलत टेस्ट 2 कुल लागत $0.437 प्रतिक्रिया समय (औसत) 17.5s
#62	Qwen3.5-27B medium	Qwen	5.3	7.4	$1.627	1/3	79.5s
कुल टेस्ट 3 गलत टेस्ट 2 कुल लागत $1.627 प्रतिक्रिया समय (औसत) 79.5s
#65	Gemini 3 Flash Preview low	Google	5.3	7.4	$0.177	1/3	8.05s
कुल टेस्ट 3 गलत टेस्ट 2 कुल लागत $0.177 प्रतिक्रिया समय (औसत) 8.05s
#70	Claude Opus 4.8 none	Anthropic	5.3	7.3	$1.166	1/3	1.70s
कुल टेस्ट 3 गलत टेस्ट 2 कुल लागत $1.166 प्रतिक्रिया समय (औसत) 1.70s
#71	Step 3.7 Flash low	Stepfun	5.3	7.3	$0.454	1/3	43.3s
कुल टेस्ट 3 गलत टेस्ट 2 कुल लागत $0.454 प्रतिक्रिया समय (औसत) 43.3s
#72	Kimi K2.6 medium	Moonshot AI	5.3	7.2	$1.036	1/3	202.4s
कुल टेस्ट 3 गलत टेस्ट 2 कुल लागत $1.036 प्रतिक्रिया समय (औसत) 202.4s
#77	Grok 4.3 medium	X AI	5.3	7.1	$0.779	1/3	181.7s
कुल टेस्ट 3 गलत टेस्ट 2 कुल लागत $0.779 प्रतिक्रिया समय (औसत) 181.7s

डोमेन-विशिष्ट रैंकिंग

मॉडल फ़िल्टर करें

डोमेन-विशिष्ट स्कोर के अनुसार शीर्ष मॉडल

डोमेन-विशिष्ट स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत) के अनुसार शीर्ष मॉडल