التنقل
AI BENCHY
Advertise here

AI BENCHY Compare

StepFun: Step 3.5 Flash vs Z.ai: GLM 5

الملخص

مقارنة benchmark بين Step 3.5 Flash و GLM 5: يتقدم Step 3.5 Flash في متوسط النتيجة بـ 6.6 مقابل 6.0. لدى GLM 5 تكلفة benchmark أقل عند $0.027 مقابل $0.070. GLM 5 أسرع عند 4.03s مقابل 72.53s، مع معدلات نجاح 54.0% مقابل 44.4%.

النموذج الموصى به: GLM 5 - Its score stays close to the best score here (6.0 vs 6.6), while costing about 2.6x less than Step 3.5 Flash.

تم إنشاء نتائج المعايير من مجموعات اختبارات AI BENCHY في: 2026-06-18

المقياس Step 3.5 Flash Step 3.5 Flash medium الإصدار: 2026-02-01 GLM 5 GLM 5 none الإصدار: 2026-02-12
النتيجة 6.6 6.0
الترتيب #80 #101
الموثوقية 10.0 10.0
الاتساق 8.9 9.7
اختبارات صحيحة
معدل النجاح لكل محاولة 54.0% 44.4%
اختبارات غير مستقرة 1 1
إجمالي مرات التشغيل 60 63
التكلفة لكل نتيجة 0.198 0.263
إجمالي التكلفة $0.070 $0.027
سعر الإدخال $0.090 / 1M $0.600 / 1M
سعر الإخراج $0.300 / 1M $1.920 / 1M
إجمالي رموز الإدخال 34,431 37,135
رموز الإخراج 91,587 1,989
رموز الاستدلال 195,973 0
زمن الاستجابة (المتوسط) 72.53s 4.03s
زمن الاستجابة (الحد الأقصى) 453.94s 11.07s
زمن الاستجابة (الإجمالي) 1015.47s 56.37s

عرض إنشاء

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#80 Step 3.5 Flash

medium
التكلفة
$0.008
الوقت
277.1s
الرموز
23,695 tok

#101 GLM 5

none
التكلفة
$0.007
الوقت
32.1s
الرموز
2,023 tok

أفضل النماذج حسب الدرجة

الدرجة مقابل التكلفة الإجمالية

زمن الاستجابة (المتوسط)

النتيجة vs زمن الاستجابة (المتوسط)

إجمالي رموز الإخراج

النتيجة vs إجمالي رموز الإخراج

تفصيل الفئات

حيل مضادة للذكاء الاصطناعي النتيجة الاتساق معدل النجاح لكل محاولة اختبارات غير مستقرة اختبارات صحيحة زمن الاستجابة (المتوسط) رموز الإدخال رموز الإخراج رموز الاستدلال
Step 3.5 Flash 10.0 10.0 100.0% 0 40.57s 694 20,391 24,176
GLM 5 4.8 10.0 25.0% 0 2.37s 510 275 0
البرمجة النتيجة الاتساق معدل النجاح لكل محاولة اختبارات غير مستقرة اختبارات صحيحة زمن الاستجابة (المتوسط) رموز الإدخال رموز الإخراج رموز الاستدلال
Step 3.5 Flash 2.4 5.2 0.0% 0 258.38s 2,211 13,207 22,429
GLM 5 4.0 7.8 11.1% 1 5.12s 7,256 428 0
مجمّع النتيجة الاتساق معدل النجاح لكل محاولة اختبارات غير مستقرة اختبارات صحيحة زمن الاستجابة (المتوسط) رموز الإدخال رموز الإخراج رموز الاستدلال
Step 3.5 Flash 10.0 10.0 100.0% 0 29.57s 13,638 1,176 12,984
GLM 5 3.0 10.0 0.0% 0 4.98s 12,812 406 0
تحليل البيانات واستخراجها النتيجة الاتساق معدل النجاح لكل محاولة اختبارات غير مستقرة اختبارات صحيحة زمن الاستجابة (المتوسط) رموز الإدخال رموز الإخراج رموز الاستدلال
Step 3.5 Flash 10.0 10.0 100.0% 0 15.01s 7,368 600 13,886
GLM 5 10.0 10.0 100.0% 0 5.78s 7,107 203 0
خاص بالمجال النتيجة الاتساق معدل النجاح لكل محاولة اختبارات غير مستقرة اختبارات صحيحة زمن الاستجابة (المتوسط) رموز الإدخال رموز الإخراج رموز الاستدلال
Step 3.5 Flash 5.3 7.2 44.4% 1 170.45s 673 45,350 90,436
GLM 5 3.0 10.0 0.0% 0 2.24s 643 19 0
الذكاء العام النتيجة الاتساق معدل النجاح لكل محاولة اختبارات غير مستقرة اختبارات صحيحة زمن الاستجابة (المتوسط) رموز الإدخال رموز الإخراج رموز الاستدلال
Step 3.5 Flash 5.5 10.0 0.0% 0 22.39s 509 240 3,506
GLM 5 10.0 10.0 100.0% 0 3.27s 477 103 0
اتباع التعليمات النتيجة الاتساق معدل النجاح لكل محاولة اختبارات غير مستقرة اختبارات صحيحة زمن الاستجابة (المتوسط) رموز الإدخال رموز الإخراج رموز الاستدلال
Step 3.5 Flash 8.3 10.0 50.0% 0 4.78s 705 2,364 3,521
GLM 5 10.0 10.0 100.0% 0 1.48s 636 61 0
حل الألغاز النتيجة الاتساق معدل النجاح لكل محاولة اختبارات غير مستقرة اختبارات صحيحة زمن الاستجابة (المتوسط) رموز الإدخال رموز الإخراج رموز الاستدلال
Step 3.5 Flash 5.3 10.0 33.3% 0 7.22s 711 5,630 10,861
GLM 5 7.7 10.0 66.7% 0 1.91s 609 261 0
استدعاء الأدوات النتيجة الاتساق معدل النجاح لكل محاولة اختبارات غير مستقرة اختبارات صحيحة زمن الاستجابة (المتوسط) رموز الإدخال رموز الإخراج رموز الاستدلال
Step 3.5 Flash 10.0 10.0 100.0% 0 11.91s 7,701 275 3,802
GLM 5 10.0 10.0 100.0% 0 11.07s 6,899 220 0
معلومات عامة النتيجة الاتساق معدل النجاح لكل محاولة اختبارات غير مستقرة اختبارات صحيحة زمن الاستجابة (المتوسط) رموز الإدخال رموز الإخراج رموز الاستدلال
Step 3.5 Flash 3.0 10.0 0.0% 0 108.45s 221 2,354 10,372
GLM 5 3.0 10.0 0.0% 0 3.62s 186 13 0

مقارنة سريعة

تبديل زوج المقارنة