AI BENCHY श्रेणी
कोडिंग रैंकिंग
देखें कि कोडिंग में कौन से AI मॉडल सबसे अच्छा प्रदर्शन करते हैं, कौन से भरोसेमंद बने रहते हैं और सबसे बड़े अंतर कहाँ दिखाई देते हैं। क्रमबद्ध करें: मेट्रिक ↑.
| रैंक | मॉडल | कंपनी | कोडिंग स्कोर | स्कोर | सही परीक्षण | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|
| #87 | GLM 4.7 Flash medium | Z.ai | 3.6 | 4.6 | 0/1 | 21.3s |
| #32 | MiMo-V2-Omni medium | Xiaomi | 4.0 | 7.7 | 0/1 | 68.5s |
| #44 | Grok 4.20 medium | X AI | 4.3 | 7.0 | 0/1 | 24.3s |
| #65 | gpt-oss-120b medium | OpenAI | 4.3 | 5.8 | 0/1 | 26.3s |
| #66 | Qwen3.5-122B-A10B none | Qwen | 4.3 | 5.7 | 0/1 | 3.44s |
| #79 | gpt-oss-120b none | OpenAI | 4.3 | 5.2 | 0/1 | 9.57s |
| #78 | Mistral Small 4 none | Mistral | 4.5 | 5.2 | 0/1 | 1.28s |
| #12 | Gemma 4 31B medium | 4.7 | 8.3 | 0/1 | 71.0s | |
| #17 | Qwen3.5-122B-A10B medium | Qwen | 4.7 | 8.1 | 0/1 | 71.0s |
| #25 | DeepSeek V3.2 medium | DeepSeek | 4.7 | 8.0 | 0/1 | 180.9s |
| #30 | Qwen3.5-Flash medium | Qwen | 4.7 | 7.8 | 0/1 | 45.7s |
| #31 | GLM 5.1 medium | Z.ai | 4.7 | 7.8 | 0/1 | 118.5s |
| #38 | MiMo-V2-Flash medium | Xiaomi | 4.7 | 7.5 | 0/1 | 13.0s |
| #43 | Kimi K2.5 medium | Moonshot AI | 4.7 | 7.0 | 0/1 | 150.8s |
| #57 | Gemma 4 26B A4B none | 4.7 | 6.2 | 0/1 | 7.07s |