التنقل
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

النماذج المقارنة

مقارنة benchmark بين GPT-5.2 Chat vs GPT 5.3 Chat vs Gemini 3.1 Flash Lite Preview (low): يتصدر GPT-5.2 Chat في النتيجة بقيمة 7.9. يتصدر GPT-5.2 Chat في الموثوقية بقيمة 10.0. يمتلك GPT 5.3 Chat أقل إجمالي التكلفة عند $0.533. GPT 5.3 Chat هو الأسرع عند 6.56s.

تم إنشاء نتائج المعايير من مجموعات اختبارات AI BENCHY في: 2026-09-04

الترتيب
#72
إجمالي رموز الإخراج
29,742
زمن الاستجابة (المتوسط)
7.73s
إجمالي التكلفة
$0.594
الترتيب
#98
إجمالي رموز الإخراج
28,179
زمن الاستجابة (المتوسط)
6.56s
إجمالي التكلفة
$0.533
الترتيب
#164
إجمالي رموز الإخراج
412,179
زمن الاستجابة (المتوسط)
16.67s
إجمالي التكلفة
$0.646
النموذج الموصى به GPT-5.2 Chat

It has the best score here (7.9), while responding about 1.5x faster than النماذج الأخرى في هذه المقارنة.

مقارنة تفصيلية

المقياس GPT-5.2 Chat GPT-5.2 Chat none الإصدار: 2025-12-11 GPT 5.3 Chat GPT 5.3 Chat none الإصدار: 2026-03-03 Gemini 3.1 Flash Lite Preview Gemini 3.1 Flash Lite Preview low الإصدار: 2026-03-03
النتيجة 7.9 7.5 6.6
الترتيب #72 #98 #164
الموثوقية 10.0 10.0 10.0
الاتساق 8.6 8.6 10.0
محاولات 66/66 66/66 66/66
اختبارات صحيحة
معدل النجاح لكل محاولة 69.7% 65.2% 63.6%
اختبارات غير مستقرة 4 4 0
إجمالي مرات التشغيل 66 66 66
التكلفة لكل نتيجة 4.564 4.097 4.613
إجمالي التكلفة $0.594 $0.533 $0.646
سعر الإدخال $1.750 / 1M $1.750 / 1M $0.250 / 1M
سعر الإخراج $14.000 / 1M $14.000 / 1M $1.500 / 1M
إجمالي رموز الإدخال 101,104 78,846 110,196
رموز الإخراج 29,742 28,179 14,717
رموز الاستدلال 0 0 397,462
زمن الاستجابة (المتوسط) 7.73s 6.56s 16.67s
زمن الاستجابة (الحد الأقصى) 38.52s 18.33s 309.35s
زمن الاستجابة (الإجمالي) 162.40s 137.77s 366.69s
المعلمات ~400B الإجمالي (~17B النشطة) ~400B الإجمالي (~17B النشطة) ~150B الإجمالي (~10B النشطة)
الإتاحة مغلق المصدر مغلق المصدر مغلق المصدر

عرض إنشاء النماذج

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#72 GPT-5.2 Chat

none
التكلفة
$0.010
الوقت
15.3s
الرموز
797 tok

#98 GPT 5.3 Chat

none
التكلفة
$0.008
الوقت
8.1s
الرموز
634 tok

#164 Gemini 3.1 Flash Lite Preview

low
التكلفة
$0.002
الوقت
3.7s
الرموز
1,203 tok

أفضل النماذج حسب الدرجة

الدرجة مقابل التكلفة الإجمالية

زمن الاستجابة (المتوسط)

النتيجة vs زمن الاستجابة (المتوسط)

إجمالي رموز الإخراج

النتيجة vs إجمالي رموز الإخراج

تفصيل الفئات

البرمجة النتيجة الاتساق معدل النجاح لكل محاولة اختبارات غير مستقرة اختبارات صحيحة زمن الاستجابة (المتوسط) رموز الإدخال رموز الإخراج رموز الاستدلال
GPT-5.2 Chat 8.8 7.8 88.9% 1 9.82s 7,305 6,731 0
GPT 5.3 Chat 5.6 4.7 55.6% 2 10.52s 7,302 6,632 0
Gemini 3.1 Flash Lite Preview 5.5 10.0 33.3% 0 1.39s 8,138 660 1,060

مقارنة سريعة

تبديل زوج المقارنة