التنقل
Advertise here

LongCat 2.0 (medium) vs Qwen3.8 Flash Next (xhigh)

يتقدم LongCat 2.0 (medium) في متوسط النتيجة بـ 7.2 مقابل 7.1. لدى Qwen3.8 Flash Next (xhigh) تكلفة benchmark أقل عند ~$0.195 مقابل $0.767. Qwen3.8 Flash Next (xhigh) أسرع عند 102.66s مقابل 144.88s، مع معدلات نجاح 59.4% مقابل 72.5%.

تم إنشاء نتائج المعايير من مجموعات اختبارات AI BENCHY في: 2026-10-05

النماذج المقارنة

الترتيب
#149
إجمالي رموز الإخراج
422,234
زمن الاستجابة (المتوسط)
144.88s
إجمالي التكلفة
$0.767
الترتيب
#154
إجمالي رموز الإخراج
621,056
زمن الاستجابة (المتوسط)
102.66s
إجمالي التكلفة
~$0.195
النموذج الموصى به Qwen3.8 Flash Next (xhigh)

Its score stays close to the best score here (7.1 vs 7.2), while costing about 3.9x less than LongCat 2.0 (medium).

مقارنة تفصيلية

المقياس LongCat 2.0 LongCat 2.0 medium الإصدار: 2026-07-20 Qwen3.8 Flash Next Qwen3.8 Flash Next xhigh الإصدار: 2026-10-04
النتيجة 7.2 7.1
الترتيب #149 #154
الموثوقية 10.0 9.9
الاتساق 9.0 7.9
محاولات 69/69 69/69
اختبارات صحيحة
معدل النجاح لكل محاولة 59.4% 72.5%
اختبارات غير مستقرة 3 6
إجمالي مرات التشغيل 69 69
التكلفة لكل نتيجة 4.942 ~1.390
إجمالي التكلفة $0.767 ~$0.195
سعر الإدخال $0.300 / 1M غير متاح
سعر الإخراج $1.200 / 1M غير متاح
سعر قراءة ذاكرة التخزين المؤقت $0.006 / 1M غير متاح
سعر الكتابة في ذاكرة التخزين المؤقت غير متاح غير متاح
إجمالي رموز الإدخال 287,669 301,749
رموز الإخراج 47,204 1,033
رموز الاستدلال 375,030 620,023
زمن الاستجابة (المتوسط) 144.88s 102.66s
زمن الاستجابة (الحد الأقصى) 939.52s 674.08s
زمن الاستجابة (الإجمالي) 3332.19s 2361.10s
المعلمات 1.6T الإجمالي (48B النشطة) 180B الإجمالي (6B النشطة)
الإتاحة مفتوح المصدر الأوزان متاحة

تنطبق أسعار التخزين المؤقت على رموز الإدخال. تعيد القراءة استخدام المطالبات المخزنة؛ وتحفظها الكتابة وقد تكلّف أكثر. تُحاسب رموز الإخراج بسعر الإخراج.

عرض إنشاء النماذج

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#149 LongCat 2.0

medium
التكلفة
$0.016
الوقت
285.1s
الرموز
13,057 tok

#154 Qwen3.8 Flash Next

xhigh
التكلفة
~$0.010
الوقت
333.1s
الرموز
30,654 tok

أفضل النماذج حسب الدرجة

الدرجة مقابل التكلفة الإجمالية

زمن الاستجابة (المتوسط)

النتيجة vs زمن الاستجابة (المتوسط)

إجمالي رموز الإخراج

النتيجة vs إجمالي رموز الإخراج

تفصيل الفئات

البرمجة النتيجة الاتساق معدل النجاح لكل محاولة اختبارات غير مستقرة اختبارات صحيحة زمن الاستجابة (المتوسط) رموز الإدخال رموز الإخراج رموز الاستدلال
LongCat 2.0 10.0 10.0 100.0% 0 455.00s 7,419 533 214,143
Qwen3.8 Flash Next 7.4 7.0 77.8% 1 192.20s 8,235 122 186,070

مقارنة سريعة

تبديل زوج المقارنة

LongCat 2.0mediumvsStep 3.7 FlashlowLongCat 2.0mediumvsQwen3.7 FlashhighClaude Opus 4.8lowvsLongCat 2.0mediumClaude Opus 5nonevsLongCat 2.0mediumQwen3.8 Flash NextxhighvsGLM 5.3 FlashXmediumGemini 3.8 FlashlowvsLongCat 2.0mediumQwen3.8 Flash NextxhighvsMiMo-V2.6-FlashlowClaude Opus 5nonevsQwen3.8 Flash NextxhighQwen3.8 Flash NextxhighvsMiMo-V2.5mediumLongCat 2.0mediumvsQwen3.5-27BnoneQwen3.8 Flash NextxhighvsStep 3.7 FlashlowQwen3.8 Flash NextxhighvsGLM 5medium