التنقل
Advertise here

KAT Coder AIR V2.5 (default) vs gpt-oss-120b

يتقدم KAT Coder AIR V2.5 (default) في متوسط النتيجة بـ 4.4 مقابل 4.2. لدى gpt-oss-120b تكلفة benchmark أقل عند $0.016 مقابل $0.070. KAT Coder AIR V2.5 (default) أسرع عند 11.96s مقابل 28.63s، مع معدلات نجاح 34.8% مقابل 34.8%.

تم إنشاء نتائج المعايير من مجموعات اختبارات AI BENCHY في: 2026-10-07

النماذج المقارنة

الترتيب
#348
إجمالي رموز الإخراج
97,752
زمن الاستجابة (المتوسط)
11.96s
إجمالي التكلفة
$0.070
الترتيب
#356
إجمالي رموز الإخراج
62,213
زمن الاستجابة (المتوسط)
28.63s
إجمالي التكلفة
$0.016
النموذج الموصى به KAT Coder AIR V2.5 (default)

It has the best score here (4.4), while responding about 2.4x faster than gpt-oss-120b.

مقارنة تفصيلية

المقياس KAT Coder AIR V2.5 KAT Coder AIR V2.5 default الإصدار: 2026-07-14 gpt-oss-120b gpt-oss-120b none الإصدار: 2025-08-05
النتيجة 4.4 4.2
الترتيب #348 #356
الموثوقية 10.0 10.0
الاتساق 7.4 7.6
محاولات 69/69 60/69
اختبارات صحيحة
معدل النجاح لكل محاولة 34.8% 34.8%
اختبارات غير مستقرة 7 3
إجمالي مرات التشغيل 69 60
التكلفة لكل نتيجة 1.382 0.274
إجمالي التكلفة $0.070 $0.016
سعر الإدخال $0.150 / 1M $0.037 / 1M
سعر الإخراج $0.600 / 1M $0.170 / 1M
سعر قراءة ذاكرة التخزين المؤقت غير متاح غير متاح
سعر الكتابة في ذاكرة التخزين المؤقت غير متاح غير متاح
إجمالي رموز الإدخال 69,376 131,652
رموز الإخراج 7,792 16,869
رموز الاستدلال 89,960 53,081
زمن الاستجابة (المتوسط) 11.96s 28.63s
زمن الاستجابة (الحد الأقصى) 121.05s 140.90s
زمن الاستجابة (الإجمالي) 275.18s 486.69s
المعلمات ~35B الإجمالي (~3B النشطة) 117B الإجمالي (5.1B النشطة)
الإتاحة مغلق المصدر مفتوح المصدر

تنطبق أسعار التخزين المؤقت على رموز الإدخال. تعيد القراءة استخدام المطالبات المخزنة؛ وتحفظها الكتابة وقد تكلّف أكثر. تُحاسب رموز الإخراج بسعر الإخراج.

عرض إنشاء النماذج

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#348 KAT Coder AIR V2.5

default
التكلفة
$0.002
الوقت
14.5s
الرموز
2,619 tok

#356 gpt-oss-120b

none
لم يتم إنشاء نتيجة عرض لهذا النموذج بعد.
التكلفة
غير متاح
الوقت
-
الرموز
0 tok

أفضل النماذج حسب الدرجة

الدرجة مقابل التكلفة الإجمالية

زمن الاستجابة (المتوسط)

النتيجة vs زمن الاستجابة (المتوسط)

إجمالي رموز الإخراج

النتيجة vs إجمالي رموز الإخراج

تفصيل الفئات

البرمجة النتيجة الاتساق معدل النجاح لكل محاولة اختبارات غير مستقرة اختبارات صحيحة زمن الاستجابة (المتوسط) رموز الإدخال رموز الإخراج رموز الاستدلال
KAT Coder AIR V2.5 3.3 9.6 0.0% 0 14.31s 6,472 2,032 14,886
gpt-oss-120b 1.5 0.4 22.2% 1 9.57s 901 204 3,028

مقارنة سريعة

تبديل زوج المقارنة