التنقل
AI BENCHY
Advertise here

Kwaipilot: KAT-Coder-Air V2.5 vs Poolside: Laguna XS 2.1

يتقدم KAT-Coder-Air V2.5 (high) في متوسط النتيجة بـ 5.6 مقابل 5.3. لدى Laguna XS 2.1 تكلفة benchmark أقل عند $0.008 مقابل $0.077. Laguna XS 2.1 أسرع عند 1.55s مقابل 15.90s، مع معدلات نجاح 43.9% مقابل 30.3%.

النموذج الموصى بهLaguna XS 2.1Its score stays close to the best score here (5.3 vs 5.6), while costing about 10.8x less than KAT-Coder-Air V2.5 (high).

تم إنشاء نتائج المعايير من مجموعات اختبارات AI BENCHY في: 2026-07-20

المقياس KAT-Coder-Air V2.5 KAT-Coder-Air V2.5 high الإصدار: 2026-07-14 Laguna XS 2.1 Laguna XS 2.1 none الإصدار: 2026-07-02 متاح مجانًا
النتيجة 5.6 5.3
الترتيب #144 #160
الموثوقية 9.9 10.0
الاتساق 7.7 9.0
اختبارات صحيحة
معدل النجاح لكل محاولة 43.9% 30.3%
اختبارات غير مستقرة 6 3
إجمالي مرات التشغيل 66 66
التكلفة لكل نتيجة 1.097 0.143
إجمالي التكلفة $0.077 $0.008
سعر الإدخال $0.150 / 1M $0.060 / 1M
سعر الإخراج $0.600 / 1M $0.120 / 1M
إجمالي رموز الإدخال 50,470 91,598
رموز الإخراج 3,957 13,377
رموز الاستدلال 111,374 0
زمن الاستجابة (المتوسط) 15.90s 1.55s
زمن الاستجابة (الحد الأقصى) 118.35s 19.02s
زمن الاستجابة (الإجمالي) 349.71s 34.19s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#144 KAT-Coder-Air V2.5

high
SVG غير صالح
التكلفة
$0.000
الوقت
300.0s
الرموز
0 tok

#160 Laguna XS 2.1

none
التكلفة
$0.001
الوقت
27.6s
الرموز
4,344 tok

أفضل النماذج حسب الدرجة

الدرجة مقابل التكلفة الإجمالية

زمن الاستجابة (المتوسط)

النتيجة vs زمن الاستجابة (المتوسط)

إجمالي رموز الإخراج

النتيجة vs إجمالي رموز الإخراج

تفصيل الفئات

البرمجة النتيجة الاتساق معدل النجاح لكل محاولة اختبارات غير مستقرة اختبارات صحيحة زمن الاستجابة (المتوسط) رموز الإدخال رموز الإخراج رموز الاستدلال
KAT-Coder-Air V2.5 4.3 7.3 11.1% 1 39.07s 6,948 1,166 55,883
Laguna XS 2.1 4.3 7.8 22.2% 1 623ms 7,995 562 0

مقارنة سريعة

تبديل زوج المقارنة