डोमेन-विशिष्ट मॉडल रैंकिंग

देखें कि डोमेन-विशिष्ट में कौन से AI मॉडल सबसे अच्छा प्रदर्शन करते हैं, कौन से भरोसेमंद बने रहते हैं और सबसे बड़े अंतर कहाँ दिखाई देते हैं।

दिखाए गए मॉडल

औसत डोमेन-विशिष्ट स्कोर

4.7

सर्वश्रेष्ठ मॉडल

Gemini 3.6 Flash 10.0

विफलता के कारण

विफलता कारण गलत उत्तर के साथ421 विफलता कारण समय समाप्त के साथ43 विफलता कारण अतिरिक्त फॉर्मेटिंग के साथ17 विफलता कारण कोई उत्तर नहीं के साथ8 विफलता कारण API त्रुटि के साथ7 विफलता कारण निर्देशों का पालन नहीं किया के साथ1

216/216

रैंक	मॉडल	कंपनी	डोमेन-विशिष्ट स्कोर	स्कोर	कुल लागत	सही परीक्षण	प्रतिक्रिया समय (औसत)
#13	GPT-5.5 medium	OpenAI	5.3	9.0	$4.137	1/3	164.1s
कुल टेस्ट 3 गलत टेस्ट 2 कुल लागत $4.137 प्रतिक्रिया समय (औसत) 164.1s
#20	Claude Fable 5 medium	Anthropic	5.3	8.6	$3.478	1/3	53.4s
कुल टेस्ट 3 गलत टेस्ट 2 कुल लागत $3.478 प्रतिक्रिया समय (औसत) 53.4s
#21	GPT-5.4 medium	OpenAI	5.3	8.5	$1.533	1/3	74.3s
कुल टेस्ट 3 गलत टेस्ट 2 कुल लागत $1.533 प्रतिक्रिया समय (औसत) 74.3s
#31	Gemini 3.5 Flash-Lite high	Google	5.3	8.1	$0.584	1/3	19.5s
कुल टेस्ट 3 गलत टेस्ट 2 कुल लागत $0.584 प्रतिक्रिया समय (औसत) 19.5s
#36	Inkling medium	Thinkingmachines	5.3	8.0	$0.391	1/3	35.6s
कुल टेस्ट 3 गलत टेस्ट 2 कुल लागत $0.391 प्रतिक्रिया समय (औसत) 35.6s
#59	GPT-5.6 Terra low	OpenAI	5.3	7.5	$0.519	1/3	8.34s
कुल टेस्ट 3 गलत टेस्ट 2 कुल लागत $0.519 प्रतिक्रिया समय (औसत) 8.34s
#65	Gemini 3 Flash Preview low	Google	5.3	7.4	$0.177	1/3	8.05s
कुल टेस्ट 3 गलत टेस्ट 2 कुल लागत $0.177 प्रतिक्रिया समय (औसत) 8.05s
#70	Claude Opus 4.8 none	Anthropic	5.3	7.3	$1.166	1/3	1.70s
कुल टेस्ट 3 गलत टेस्ट 2 कुल लागत $1.166 प्रतिक्रिया समय (औसत) 1.70s
#71	Step 3.7 Flash low	Stepfun	5.3	7.3	$0.454	1/3	43.3s
कुल टेस्ट 3 गलत टेस्ट 2 कुल लागत $0.454 प्रतिक्रिया समय (औसत) 43.3s
#72	Kimi K2.6 medium	Moonshot AI	5.3	7.2	$1.036	1/3	202.4s
कुल टेस्ट 3 गलत टेस्ट 2 कुल लागत $1.036 प्रतिक्रिया समय (औसत) 202.4s
#77	Grok 4.3 medium	X AI	5.3	7.1	$0.779	1/3	181.7s
कुल टेस्ट 3 गलत टेस्ट 2 कुल लागत $0.779 प्रतिक्रिया समय (औसत) 181.7s
#94	Qwen3.6 35B A3B medium	Qwen	5.3	6.7	$0.746	1/3	22.5s
कुल टेस्ट 3 गलत टेस्ट 2 कुल लागत $0.746 प्रतिक्रिया समय (औसत) 22.5s
#98	GLM 5V Turbo medium	Z.ai	5.3	6.7	$0.457	1/3	38.1s
कुल टेस्ट 3 गलत टेस्ट 2 कुल लागत $0.457 प्रतिक्रिया समय (औसत) 38.1s
#118	Claude Sonnet 5 none	Anthropic	5.3	6.3	$0.548	1/3	3.28s
कुल टेस्ट 3 गलत टेस्ट 2 कुल लागत $0.548 प्रतिक्रिया समय (औसत) 3.28s
#120	Qwen3.5-Flash medium	Qwen	5.3	6.2	$0.139	1/3	146.5s
कुल टेस्ट 3 गलत टेस्ट 2 कुल लागत $0.139 प्रतिक्रिया समय (औसत) 146.5s

डोमेन-विशिष्ट रैंकिंग

मॉडल फ़िल्टर करें

डोमेन-विशिष्ट स्कोर के अनुसार शीर्ष मॉडल

डोमेन-विशिष्ट स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत) के अनुसार शीर्ष मॉडल