التنقل
AI BENCHY
Advertise here

Kwaipilot: KAT-Coder-Pro V2.5 vs Meituan: LongCat 2.0

يتقدم KAT-Coder-Pro V2.5 في متوسط النتيجة بـ 6.7 مقابل 6.6. لدى LongCat 2.0 (high) تكلفة benchmark أقل عند $0.469 مقابل $0.476. KAT-Coder-Pro V2.5 أسرع عند 25.56s مقابل 148.73s، مع معدلات نجاح 68.2% مقابل 53.0%.

النموذج الموصى بهKAT-Coder-Pro V2.5It has the best score here (6.7), while responding about 5.8x faster than LongCat 2.0 (high).

تم إنشاء نتائج المعايير من مجموعات اختبارات AI BENCHY في: 2026-07-20

المقياس KAT-Coder-Pro V2.5 KAT-Coder-Pro V2.5 none الإصدار: 2026-07-14 LongCat 2.0 LongCat 2.0 high الإصدار: 2026-07-20
النتيجة 6.7 6.6
الترتيب #92 #97
الموثوقية 10.0 9.4
الاتساق 7.4 8.2
اختبارات صحيحة
معدل النجاح لكل محاولة 68.2% 53.0%
اختبارات غير مستقرة 7 5
إجمالي مرات التشغيل 66 66
التكلفة لكل نتيجة 4.319 5.202
إجمالي التكلفة $0.476 $0.469
سعر الإدخال $0.740 / 1M $0.300 / 1M
سعر الإخراج $2.960 / 1M $1.200 / 1M
إجمالي رموز الإدخال 98,499 93,357
رموز الإخراج 135,861 30,466
رموز الاستدلال 0 336,325
زمن الاستجابة (المتوسط) 25.56s 148.73s
زمن الاستجابة (الحد الأقصى) 335.41s 941.66s
زمن الاستجابة (الإجمالي) 562.43s 3272.00s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#92 KAT-Coder-Pro V2.5

none
التكلفة
$0.010
الوقت
29.0s
الرموز
3,439 tok

#97 LongCat 2.0

high
SVG غير صالح
التكلفة
$0.000
الوقت
600.0s
الرموز
0 tok

أفضل النماذج حسب الدرجة

الدرجة مقابل التكلفة الإجمالية

زمن الاستجابة (المتوسط)

النتيجة vs زمن الاستجابة (المتوسط)

إجمالي رموز الإخراج

النتيجة vs إجمالي رموز الإخراج

تفصيل الفئات

البرمجة النتيجة الاتساق معدل النجاح لكل محاولة اختبارات غير مستقرة اختبارات صحيحة زمن الاستجابة (المتوسط) رموز الإدخال رموز الإخراج رموز الاستدلال
KAT-Coder-Pro V2.5 6.1 4.7 66.7% 2 22.52s 7,893 22,440 0
LongCat 2.0 7.6 7.2 77.8% 1 505.33s 6,913 244 192,377

مقارنة سريعة

تبديل زوج المقارنة