ترتيب حل الألغاز
اكتشف أي نماذج الذكاء الاصطناعي تؤدي أفضل في حل الألغاز، وأيها يظل أكثر اعتمادية، وأين تظهر أكبر الفجوات. الترتيب حسب: اختبارات صحيحة ↓.
216/216
تصفية النماذج
لا توجد نماذج تطابق البحث والفلاتر الحالية.
| الترتيب | النموذج | الشركة | درجة حل الألغاز | النتيجة | إجمالي التكلفة | اختبارات صحيحة | زمن الاستجابة (المتوسط) |
|---|---|---|---|---|---|---|---|
| #196 | MiniMax M2.5 medium | Minimax | 5.3 | 4.6 | $0.340 | 1/3 | 11.2s |
| #201 | Elephant Alpha medium | Openrouter | 5.3 | 4.3 | $0.000 | 1/3 | 868ms |
| #202 | Hunter Alpha none | OpenRouter | 5.8 | 4.2 | $0.000 | 1/3 | 3.71s |
| #203 | Grok 4.20 none | X AI | 5.3 | 4.1 | $0.057 | 1/3 | 473ms |
| #204 | Laguna Xs.2 medium | Poolside | 5.3 | 4.1 | $0.015 | 1/3 | 1.93s |
| #206 | MiMo-V2-Flash none | Xiaomi | 5.3 | 4.0 | $0.025 | 1/3 | 1.86s |
| #208 | Grok Build 0.1 none | X AI | 6.4 | 4.0 | $0.547 | 1/3 | 9.55s |
| #211 | Laguna Xs.2 none | Poolside | 5.3 | 3.8 | $0.004 | 1/3 | 650ms |
| #212 | gpt-oss-120b none | OpenAI | 6.0 | 3.7 | $0.010 | 1/3 | 8.21s |
| #57 | GPT-5.4 Nano medium | OpenAI | 4.1 | 7.5 | $0.138 | 0/3 | 3.79s |
| #96 | LongCat 2.0 low | Meituan | 3.1 | 6.7 | $0.391 | 0/3 | 8.15s |
| #102 | LongCat 2.0 high | Meituan | 3.1 | 6.6 | $0.469 | 0/3 | 9.18s |
| #117 | LongCat 2.0 none | Meituan | 4.0 | 6.3 | $0.044 | 0/3 | 2.74s |
| #130 | Qwen3.6 Flash none | Qwen | 3.5 | 6.1 | $0.062 | 0/3 | 1.21s |
| #131 | Qwen3.5-Flash none | Qwen | 3.1 | 6.1 | $0.073 | 0/3 | 10.9s |