AI BENCHY زمرہ
معلومات عامہ درجہ بندی
دیکھیں کہ معلومات عامہ میں کون سے AI ماڈلز بہترین کارکردگی دکھاتے ہیں، کون سے قابلِ اعتماد رہتے ہیں، اور سب سے بڑے فرق کہاں نظر آتے ہیں۔
ناکامی کی وجوہات
| درجہ | ماڈل | کمپنی | معلومات عامہ اسکور | اسکور | درست ٹیسٹس | ردِعمل کا وقت (اوسط) |
|---|---|---|---|---|---|---|
| #55 | MiMo-V2-Flash medium | Xiaomi | 3.0 | 7.2 | 0/1 | 1.96s |
| #56 | Seed-2.0-Mini medium | Bytedance Seed | 3.0 | 7.2 | 0/1 | 56.8s |
| #57 | Qwen3.5-35B-A3B medium | Qwen | 3.0 | 7.2 | 0/1 | 177.4s |
| #58 | GPT-5.2 medium | OpenAI | 3.0 | 7.2 | 0/1 | 28.2s |
| #59 | DeepSeek V3.2 medium | DeepSeek | 3.0 | 7.2 | 0/1 | 84.0s |
| #60 | GPT-5.4 Mini medium | OpenAI | 3.0 | 7.2 | 0/1 | 30.1s |
| #61 | Claude Sonnet 4.6 none | Anthropic | 3.0 | 7.2 | 0/1 | 4.67s |
| #62 | MiMo-V2-Omni medium | Xiaomi | 3.0 | 7.2 | 0/1 | 234.2s |
| #64 | Gemma 4 31B none | 3.0 | 6.9 | 0/1 | 1.25s | |
| #65 | DeepSeek V4 Pro high | DeepSeek | 3.0 | 6.9 | 0/1 | 39.1s |
| #66 | Grok 4.20 medium | X AI | 3.0 | 6.9 | 0/1 | 63.5s |
| #67 | GPT-5 Mini medium | OpenAI | 3.0 | 6.8 | 0/1 | 9.99s |
| #68 | Gemini 3.1 Flash Lite minimal | 3.0 | 6.8 | 0/1 | 724ms | |
| #69 | Kimi K2.5 medium | Moonshot AI | 3.0 | 6.8 | 0/1 | 83.9s |
| #70 | Qwen3.6 27B medium | Qwen | 3.0 | 6.8 | 0/1 | 81.0s |