التنقل
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

النماذج المقارنة

مقارنة benchmark بين MiniMax M2.7 (medium) vs Kimi K2.5 (medium) vs GLM 5 (medium) vs Gemini 3.1 Flash Lite Preview (medium): يتصدر GLM 5 (medium) في النتيجة بقيمة 7.7. يتصدر MiniMax M2.7 (medium) في الموثوقية بقيمة 10.0. يمتلك Gemini 3.1 Flash Lite Preview (medium) أقل إجمالي التكلفة عند $0.115. Gemini 3.1 Flash Lite Preview (medium) هو الأسرع عند 4.61s.

تم إنشاء نتائج المعايير من مجموعات اختبارات AI BENCHY في: 2026-08-07

الترتيب
#205
إجمالي رموز الإخراج
137,594
زمن الاستجابة (المتوسط)
41.28s
إجمالي التكلفة
$0.176
الترتيب
#97
إجمالي رموز الإخراج
227,367
زمن الاستجابة (المتوسط)
99.00s
إجمالي التكلفة
$0.600
الترتيب
#59
إجمالي رموز الإخراج
124,566
زمن الاستجابة (المتوسط)
33.54s
إجمالي التكلفة
$0.307
الترتيب
#82
إجمالي رموز الإخراج
56,983
زمن الاستجابة (المتوسط)
4.61s
إجمالي التكلفة
$0.115
النموذج الموصى به Gemini 3.1 Flash Lite Preview (medium)

Its score stays close to the best score here (7.3 vs 7.7), while costing about 3.1x less than النماذج الأخرى في هذه المقارنة.

مقارنة تفصيلية

المقياس MiniMax M2.7 MiniMax M2.7 medium الإصدار: 2026-03-18 Kimi K2.5 Kimi K2.5 medium الإصدار: 2026-01-27 GLM 5 GLM 5 medium الإصدار: 2026-02-12 Gemini 3.1 Flash Lite Preview Gemini 3.1 Flash Lite Preview medium الإصدار: 2026-03-03
النتيجة 5.0 7.0 7.7 7.3
الترتيب #205 #97 #59 #82
الموثوقية 10.0 10.0 10.0 10.0
الاتساق 6.6 7.0 8.1 9.9
تغطية الاختبار المعياري 22/22 اختبارات · 66/66 محاولات 22/22 اختبارات · 66/66 محاولات 21/22 اختبارات · 63/66 محاولات 22/22 اختبارات · 66/66 محاولات
اختبارات صحيحة
معدل النجاح لكل محاولة 45.5% 65.2% 78.8% 59.1%
اختبارات غير مستقرة 9 8 4 0
إجمالي مرات التشغيل 66 66 63 66
التكلفة لكل نتيجة 3.906 4.789 1.668 0.884
إجمالي التكلفة $0.176 $0.600 $0.307 $0.115
سعر الإدخال $0.270 / 1M $0.571 / 1M $0.950 / 1M $0.250 / 1M
سعر الإخراج $1.080 / 1M $2.850 / 1M $2.551 / 1M $1.500 / 1M
إجمالي رموز الإدخال 114,518 118,448 35,224 117,480
رموز الإخراج 18,558 62,124 21,570 10,589
رموز الاستدلال 119,036 165,243 102,996 46,394
زمن الاستجابة (المتوسط) 41.28s 99.00s 33.54s 4.61s
زمن الاستجابة (الحد الأقصى) 196.21s 281.00s 99.85s 18.34s
زمن الاستجابة (الإجمالي) 866.81s 1485.04s 435.99s 101.39s

عرض إنشاء النماذج

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#205 MiniMax M2.7

medium
التكلفة
$0.022
الوقت
22.8s
الرموز
9,250 tok

#97 MoonshotAI: Kimi K2.5

medium
التكلفة
$0.030
الوقت
58.6s
الرموز
8,683 tok

#59 GLM 5

medium
التكلفة
$0.005
الوقت
20.7s
الرموز
2,068 tok

#82 Gemini 3.1 Flash Lite Preview

medium
التكلفة
$0.003
الوقت
5.2s
الرموز
1,944 tok

أفضل النماذج حسب الدرجة

الدرجة مقابل التكلفة الإجمالية

زمن الاستجابة (المتوسط)

النتيجة vs زمن الاستجابة (المتوسط)

إجمالي رموز الإخراج

النتيجة vs إجمالي رموز الإخراج

تفصيل الفئات

البرمجة النتيجة الاتساق معدل النجاح لكل محاولة اختبارات غير مستقرة اختبارات صحيحة زمن الاستجابة (المتوسط) رموز الإدخال رموز الإخراج رموز الاستدلال
MiniMax M2.7 5.7 9.1 33.3% 0 101.89s 2,961 1,231 38,841
Kimi K2.5 6.1 4.6 66.7% 2 217.49s 6,935 5,705 74,693
GLM 5 10.0 10.0 100.0% 0 74.30s 7,254 2,997 52,930
Gemini 3.1 Flash Lite Preview 5.5 10.0 33.3% 0 4.09s 8,126 461 8,597

مقارنة سريعة

تبديل زوج المقارنة