التنقل
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

LongCat 2.0 (high) vs Qwen3.5 Plus 2026-02-15 (medium)

يتقدم LongCat 2.0 (high) في متوسط النتيجة بـ 7.3 مقابل 7.2. لدى Qwen3.5 Plus 2026-02-15 (medium) تكلفة benchmark أقل عند $0.567 مقابل $0.569. Qwen3.5 Plus 2026-02-15 (medium) أسرع عند 97.68s مقابل 151.67s، مع معدلات نجاح 53.6% مقابل 72.5%.

تم إنشاء نتائج المعايير من مجموعات اختبارات AI BENCHY في: 2026-10-01

النماذج المقارنة

الترتيب
#136
إجمالي رموز الإخراج
404,635
زمن الاستجابة (المتوسط)
151.67s
إجمالي التكلفة
$0.569
الترتيب
#140
إجمالي رموز الإخراج
302,730
زمن الاستجابة (المتوسط)
97.68s
إجمالي التكلفة
$0.567
النموذج الموصى به Qwen3.5 Plus 2026-02-15 (medium)

Its score stays close to the best score here (7.2 vs 7.3), while responding about 1.6x faster than LongCat 2.0 (high).

مقارنة تفصيلية

المقياس LongCat 2.0 LongCat 2.0 high الإصدار: 2026-07-20 Qwen3.5 Plus 2026-02-15 Qwen3.5 Plus 2026-02-15 medium الإصدار: 2026-02-15
النتيجة 7.3 7.2
الترتيب #136 #140
الموثوقية 10.0 10.0
الاتساق 8.5 7.9
محاولات 69/69 69/69
اختبارات صحيحة
معدل النجاح لكل محاولة 53.6% 72.5%
اختبارات غير مستقرة 4 6
إجمالي مرات التشغيل 69 69
التكلفة لكل نتيجة 5.681 4.047
إجمالي التكلفة $0.569 $0.567
سعر الإدخال $0.300 / 1M $0.260 / 1M
سعر الإخراج $1.200 / 1M $1.560 / 1M
إجمالي رموز الإدخال 275,080 249,486
رموز الإخراج 32,447 14,481
رموز الاستدلال 372,188 288,249
زمن الاستجابة (المتوسط) 151.67s 97.68s
زمن الاستجابة (الحد الأقصى) 941.66s 304.85s
زمن الاستجابة (الإجمالي) 3488.43s 1562.81s
المعلمات 1.6T الإجمالي (48B النشطة) ~397B الإجمالي (~17B النشطة)
الإتاحة مفتوح المصدر مغلق المصدر

عرض إنشاء النماذج

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#136 LongCat 2.0

high
Reached the allocated time limit (600 seconds) without receiving showcase output.
التكلفة
$0.000
الوقت
600.0s
الرموز
0 tok

#140 Qwen3.5 Plus 2026-02-15

medium
التكلفة
$0.011
الوقت
125.5s
الرموز
7,040 tok

أفضل النماذج حسب الدرجة

الدرجة مقابل التكلفة الإجمالية

زمن الاستجابة (المتوسط)

النتيجة vs زمن الاستجابة (المتوسط)

إجمالي رموز الإخراج

النتيجة vs إجمالي رموز الإخراج

تفصيل الفئات

البرمجة النتيجة الاتساق معدل النجاح لكل محاولة اختبارات غير مستقرة اختبارات صحيحة زمن الاستجابة (المتوسط) رموز الإدخال رموز الإخراج رموز الاستدلال
LongCat 2.0 7.8 9.3 66.7% 0 505.33s 6,913 244 192,377
Qwen3.5 Plus 2026-02-15 6.6 7.1 44.4% 1 180.70s 6,950 420 80,595

مقارنة سريعة

تبديل زوج المقارنة