معلومات عامہ ماڈل درجہ بندی

AI BENCHY زمرہ

دیکھیں کہ معلومات عامہ میں کون سے AI ماڈلز بہترین کارکردگی دکھاتے ہیں، کون سے قابلِ اعتماد رہتے ہیں، اور سب سے بڑے فرق کہاں نظر آتے ہیں۔ ترتیب دیں حسب: ردِعمل کا وقت (اوسط) ↑.

دکھائے گئے ماڈلز

اوسط معلومات عامہ اسکور

3.1

بہترین ماڈل

Grok 4.20 Beta 0.0

ناکامی کی وجوہات

ناکامی کی وجہ غلط جواب کے ساتھ133 ناکامی کی وجہ API خرابی کے ساتھ13 ناکامی کی وجہ کوئی جواب نہیں کے ساتھ8

169/169

درجہ	ماڈل	کمپنی	معلومات عامہ اسکور	اسکور	کل لاگت	درست ٹیسٹس	ردِعمل کا وقت (اوسط)
#42	Grok Build 0.1 medium	X AI	3.0	7.6	$0.927	0/1	53.5s
کل ٹیسٹس 1 غلط ٹیسٹس 1 کل لاگت $0.927 ردِعمل کا وقت (اوسط) 53.5s
#23	DeepSeek V4 Flash high	DeepSeek	3.0	8.3	$0.027	0/1	54.5s
کل ٹیسٹس 1 غلط ٹیسٹس 1 کل لاگت $0.027 ردِعمل کا وقت (اوسط) 54.5s
#87	Nemotron 3 Super medium	NVIDIA	3.0	6.3	$0.021	0/1	55.3s
کل ٹیسٹس 1 غلط ٹیسٹس 1 کل لاگت $0.021 ردِعمل کا وقت (اوسط) 55.3s
#50	Seed-2.0-Mini medium	Bytedance Seed	3.0	7.4	$0.044	0/1	56.8s
کل ٹیسٹس 1 غلط ٹیسٹس 1 کل لاگت $0.044 ردِعمل کا وقت (اوسط) 56.8s
#11	Qwen3.6 Max Preview medium	Qwen	3.0	8.9	$0.960	0/1	60.6s
کل ٹیسٹس 1 غلط ٹیسٹس 1 کل لاگت $0.960 ردِعمل کا وقت (اوسط) 60.6s
#38	Claude Opus 4.6 medium	Anthropic	3.0	7.7	$2.053	0/1	63.2s
کل ٹیسٹس 1 غلط ٹیسٹس 1 کل لاگت $2.053 ردِعمل کا وقت (اوسط) 63.2s
#53	Grok 4.20 medium	X AI	3.0	7.3	$0.609	0/1	63.5s
کل ٹیسٹس 1 غلط ٹیسٹس 1 کل لاگت $0.609 ردِعمل کا وقت (اوسط) 63.5s
#15	GLM 5 medium	Z.ai	3.0	8.6	$0.228	0/1	67.4s
کل ٹیسٹس 1 غلط ٹیسٹس 1 کل لاگت $0.228 ردِعمل کا وقت (اوسط) 67.4s
#146	MiniMax M2.5 medium	Minimax	3.0	4.7	$0.303	0/1	80.8s
کل ٹیسٹس 1 غلط ٹیسٹس 1 کل لاگت $0.303 ردِعمل کا وقت (اوسط) 80.8s
#81	Qwen3.6 27B medium	Qwen	3.0	6.6	$0.440	0/1	81.0s
کل ٹیسٹس 1 غلط ٹیسٹس 1 کل لاگت $0.440 ردِعمل کا وقت (اوسط) 81.0s
#77	Mimo V2 PRO medium	Xiaomi	3.0	6.7	$0.333	0/1	82.7s
کل ٹیسٹس 1 غلط ٹیسٹس 1 کل لاگت $0.333 ردِعمل کا وقت (اوسط) 82.7s
#43	Kimi K2.5 medium	Moonshot AI	3.0	7.5	$0.348	0/1	83.9s
کل ٹیسٹس 1 غلط ٹیسٹس 1 کل لاگت $0.348 ردِعمل کا وقت (اوسط) 83.9s
#48	DeepSeek V3.2 medium	DeepSeek	3.0	7.5	$0.044	0/1	84.0s
کل ٹیسٹس 1 غلط ٹیسٹس 1 کل لاگت $0.044 ردِعمل کا وقت (اوسط) 84.0s
#29	Qwen3.5-27B medium	Qwen	3.0	7.9	$0.536	0/1	85.1s
کل ٹیسٹس 1 غلط ٹیسٹس 1 کل لاگت $0.536 ردِعمل کا وقت (اوسط) 85.1s
#88	Gemma 4 31B medium	Google	3.0	6.3	$0.033	0/1	90.1s
کل ٹیسٹس 1 غلط ٹیسٹس 1 کل لاگت $0.033 ردِعمل کا وقت (اوسط) 90.1s

←

1 9 10 11 12

→

معلومات عامہ درجہ بندی

ماڈلز فلٹر کریں

معلومات عامہ اسکور کے لحاظ سے سرفہرست ماڈلز

معلومات عامہ اسکور بمقابلہ کل لاگت

ردِعمل کا وقت (اوسط) کے لحاظ سے سرفہرست ماڈلز