التنقل
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Trinity Large Thinking (low) vs Qwen3.5 Plus 2026-02-15

متوسط النتيجة متقارب جدًا عند 6.3 مقابل 6.3. لدى Qwen3.5 Plus 2026-02-15 تكلفة benchmark أقل عند $0.176 مقابل $0.700. Qwen3.5 Plus 2026-02-15 أسرع عند 20.07s مقابل 95.16s، مع معدلات نجاح 47.8% مقابل 52.2%.

تم إنشاء نتائج المعايير من مجموعات اختبارات AI BENCHY في: 2026-10-01

النماذج المقارنة

الترتيب
#222
إجمالي رموز الإخراج
842,200
زمن الاستجابة (المتوسط)
95.16s
إجمالي التكلفة
$0.700
الترتيب
#218
إجمالي رموز الإخراج
53,060
زمن الاستجابة (المتوسط)
20.07s
إجمالي التكلفة
$0.176
النموذج الموصى به Qwen3.5 Plus 2026-02-15

It has the best score here (6.3), while costing about 4.0x less than Trinity Large Thinking (low).

مقارنة تفصيلية

المقياس Trinity Large Thinking Trinity Large Thinking low الإصدار: 2026-07-28 Qwen3.5 Plus 2026-02-15 Qwen3.5 Plus 2026-02-15 none الإصدار: 2026-02-15
النتيجة 6.3 6.3
الترتيب #222 #218
الموثوقية 10.0 10.0
الاتساق 8.1 9.1
محاولات 69/69 69/69
اختبارات صحيحة
معدل النجاح لكل محاولة 47.8% 52.2%
اختبارات غير مستقرة 6 3
إجمالي مرات التشغيل 69 69
التكلفة لكل نتيجة 9.163 1.593
إجمالي التكلفة $0.700 $0.176
سعر الإدخال $0.250 / 1M $0.260 / 1M
سعر الإخراج $0.800 / 1M $1.560 / 1M
إجمالي رموز الإدخال 347,980 346,064
رموز الإخراج 121,898 53,060
رموز الاستدلال 720,302 0
زمن الاستجابة (المتوسط) 95.16s 20.07s
زمن الاستجابة (الحد الأقصى) 540.96s 183.50s
زمن الاستجابة (الإجمالي) 2188.74s 341.27s
المعلمات 398B الإجمالي (13B النشطة) ~397B الإجمالي (~17B النشطة)
الإتاحة الأوزان متاحة مغلق المصدر

عرض إنشاء النماذج

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#222 Trinity Large Thinking

low
التكلفة
$0.021
الوقت
173.2s
الرموز
24,586 tok

#218 Qwen3.5 Plus 2026-02-15

none
التكلفة
$0.012
الوقت
153.2s
الرموز
7,787 tok

أفضل النماذج حسب الدرجة

الدرجة مقابل التكلفة الإجمالية

زمن الاستجابة (المتوسط)

النتيجة vs زمن الاستجابة (المتوسط)

إجمالي رموز الإخراج

النتيجة vs إجمالي رموز الإخراج

تفصيل الفئات

البرمجة النتيجة الاتساق معدل النجاح لكل محاولة اختبارات غير مستقرة اختبارات صحيحة زمن الاستجابة (المتوسط) رموز الإدخال رموز الإخراج رموز الاستدلال
Trinity Large Thinking 5.3 10.0 33.3% 0 344.45s 5,441 27,039 217,241
Qwen3.5 Plus 2026-02-15 4.3 7.9 11.1% 1 2.05s 7,913 473 0

مقارنة سريعة

تبديل زوج المقارنة