AI BENCHY زمرہ
ڈومین مخصوص درجہ بندی
دیکھیں کہ ڈومین مخصوص میں کون سے AI ماڈلز بہترین کارکردگی دکھاتے ہیں، کون سے قابلِ اعتماد رہتے ہیں، اور سب سے بڑے فرق کہاں نظر آتے ہیں۔ ترتیب دیں حسب: میٹرک ↑.
| درجہ | ماڈل | کمپنی | ڈومین مخصوص اسکور | اسکور | درست ٹیسٹس | ردِعمل کا وقت (اوسط) |
|---|---|---|---|---|---|---|
| #141 | Nemotron 3 Super none | NVIDIA | 3.6 | 4.9 | 0/3 | 6.23s |
| #145 | Laguna M.1 none | Poolside | 3.6 | 4.8 | 0/3 | 5.50s |
| #156 | Hy3 preview none | Tencent | 3.6 | 4.4 | 0/3 | 17.6s |
| #161 | Qwen3.5-9B medium | Qwen | 3.6 | 4.2 | 0/3 | 137.7s |
| #162 | Nemotron 3 Nano Omni 30b A3b Reasoning none | NVIDIA | 3.6 | 4.1 | 0/3 | 489ms |
| #31 | DeepSeek V4 Flash high | DeepSeek | 4.1 | 7.7 | 0/3 | 100.3s |
| #45 | GPT-5.4 Mini medium | OpenAI | 4.1 | 7.5 | 0/3 | 65.3s |
| #66 | Qwen3.5-35B-A3B medium | Qwen | 4.1 | 7.1 | 0/3 | 88.3s |
| #71 | Step 3.7 Flash high | Stepfun | 4.1 | 7.0 | 0/3 | 149.6s |
| #107 | Laguna Xs.2 medium | Poolside | 4.1 | 5.8 | 0/3 | 11.1s |
| #94 | GPT-5 Nano medium | OpenAI | 5.2 | 6.3 | 1/3 | 204.0s |
| #9 | GPT-5.5 medium | OpenAI | 5.3 | 8.8 | 1/3 | 164.1s |
| #16 | Gemini 3 Flash Preview low | 5.3 | 8.4 | 1/3 | 8.05s | |
| #21 | GPT-5.4 medium | OpenAI | 5.3 | 8.0 | 1/3 | 74.3s |
| #38 | Grok 4.3 medium | X AI | 5.3 | 7.6 | 1/3 | 181.7s |