معلومات عامہ ماڈل درجہ بندی

AI BENCHY زمرہ

دیکھیں کہ معلومات عامہ میں کون سے AI ماڈلز بہترین کارکردگی دکھاتے ہیں، کون سے قابلِ اعتماد رہتے ہیں، اور سب سے بڑے فرق کہاں نظر آتے ہیں۔ ترتیب دیں حسب: درست ٹیسٹس ↓.

دکھائے گئے ماڈلز

اوسط معلومات عامہ اسکور

3.1

بہترین ماڈل

Gemini 3.5 Flash 10.0

ناکامی کی وجوہات

ناکامی کی وجہ غلط جواب کے ساتھ133 ناکامی کی وجہ API خرابی کے ساتھ13 ناکامی کی وجہ کوئی جواب نہیں کے ساتھ8

169/169

درجہ	ماڈل	کمپنی	معلومات عامہ اسکور	اسکور	کل لاگت	درست ٹیسٹس	ردِعمل کا وقت (اوسط)
#106	Qwen3.5 Plus 2026-02-15 none	Qwen	3.0	5.8	$0.016	0/1	1.11s
کل ٹیسٹس 1 غلط ٹیسٹس 1 کل لاگت $0.016 ردِعمل کا وقت (اوسط) 1.11s
#107	North Mini Code medium	Cohere	3.0	5.8	$0.000	0/1	305.0s
کل ٹیسٹس 1 غلط ٹیسٹس 1 کل لاگت $0.000 ردِعمل کا وقت (اوسط) 305.0s
#108	Owl Alpha medium	Openrouter	3.0	5.8	$0.000	0/1	2.38s
کل ٹیسٹس 1 غلط ٹیسٹس 1 کل لاگت $0.000 ردِعمل کا وقت (اوسط) 2.38s
#109	Mimo V2 PRO none	Xiaomi	3.0	5.8	$0.045	0/1	1.63s
کل ٹیسٹس 1 غلط ٹیسٹس 1 کل لاگت $0.045 ردِعمل کا وقت (اوسط) 1.63s
#110	Owl Alpha none	Openrouter	3.0	5.8	$0.000	0/1	2.50s
کل ٹیسٹس 1 غلط ٹیسٹس 1 کل لاگت $0.000 ردِعمل کا وقت (اوسط) 2.50s
#111	Kimi K2.6 none	Moonshot AI	3.0	5.8	$0.079	0/1	1.36s
کل ٹیسٹس 1 غلط ٹیسٹس 1 کل لاگت $0.079 ردِعمل کا وقت (اوسط) 1.36s
#112	GPT-5.4 none	OpenAI	3.0	5.8	$0.122	0/1	990ms
کل ٹیسٹس 1 غلط ٹیسٹس 1 کل لاگت $0.122 ردِعمل کا وقت (اوسط) 990ms
#113	Qwen3.6 Plus Preview medium	Qwen	3.0	5.8	$0.000	0/1	0ms
کل ٹیسٹس 1 غلط ٹیسٹس 1 کل لاگت $0.000 ردِعمل کا وقت (اوسط) 0ms
#114	Mimo V2 Omni none	Xiaomi	3.0	5.7	$0.021	0/1	1.30s
کل ٹیسٹس 1 غلط ٹیسٹس 1 کل لاگت $0.021 ردِعمل کا وقت (اوسط) 1.30s
#115	Grok 4.1 Fast medium	X AI	3.0	5.6	$0.069	0/1	25.5s
کل ٹیسٹس 1 غلط ٹیسٹس 1 کل لاگت $0.069 ردِعمل کا وقت (اوسط) 25.5s
#116	GLM 5.1 none	Z.ai	3.0	5.6	$0.058	0/1	2.34s
کل ٹیسٹس 1 غلط ٹیسٹس 1 کل لاگت $0.058 ردِعمل کا وقت (اوسط) 2.34s
#117	DeepSeek V4 Flash none	DeepSeek	3.0	5.5	$0.007	0/1	3.07s
کل ٹیسٹس 1 غلط ٹیسٹس 1 کل لاگت $0.007 ردِعمل کا وقت (اوسط) 3.07s
#118	Kimi K2.5 none	Moonshot AI	3.0	5.5	$0.027	0/1	3.90s
کل ٹیسٹس 1 غلط ٹیسٹس 1 کل لاگت $0.027 ردِعمل کا وقت (اوسط) 3.90s
#119	MiMo-V2.5-Pro none	Xiaomi	3.0	5.5	$0.017	0/1	1.89s
کل ٹیسٹس 1 غلط ٹیسٹس 1 کل لاگت $0.017 ردِعمل کا وقت (اوسط) 1.89s
#120	Qwen3.6 27B none	Qwen	3.0	5.5	$0.028	0/1	4.03s
کل ٹیسٹس 1 غلط ٹیسٹس 1 کل لاگت $0.028 ردِعمل کا وقت (اوسط) 4.03s

معلومات عامہ درجہ بندی

ماڈلز فلٹر کریں

معلومات عامہ اسکور کے لحاظ سے سرفہرست ماڈلز

معلومات عامہ اسکور بمقابلہ کل لاگت

ردِعمل کا وقت (اوسط) کے لحاظ سے سرفہرست ماڈلز