التنقل
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

النماذج المقارنة

مقارنة benchmark بين Claude Opus 4.6 (medium) vs Claude Sonnet 4.6 (medium) vs GPT-5.3-Codex (medium) vs Gemini 3.1 Pro Preview (medium): يتصدر Gemini 3.1 Pro Preview (medium) في النتيجة بقيمة 9.2. يتصدر Claude Opus 4.6 (medium) في الموثوقية بقيمة 10.0. يمتلك GPT-5.3-Codex (medium) أقل إجمالي التكلفة عند $0.920. GPT-5.3-Codex (medium) هو الأسرع عند 16.96s.

تم إنشاء نتائج المعايير من مجموعات اختبارات AI BENCHY في: 2026-08-07

الترتيب
#60
إجمالي رموز الإخراج
100,601
زمن الاستجابة (المتوسط)
34.27s
إجمالي التكلفة
$3.059
الترتيب
#56
إجمالي رموز الإخراج
115,865
زمن الاستجابة (المتوسط)
25.91s
إجمالي التكلفة
$2.057
الترتيب
#18
إجمالي رموز الإخراج
55,525
زمن الاستجابة (المتوسط)
16.96s
إجمالي التكلفة
$0.920
الترتيب
#9
إجمالي رموز الإخراج
97,958
زمن الاستجابة (المتوسط)
21.47s
إجمالي التكلفة
$1.361
النموذج الموصى به GPT-5.3-Codex (medium)

Its score stays close to the best score here (8.9 vs 9.2), while costing about 2.3x less than النماذج الأخرى في هذه المقارنة.

مقارنة تفصيلية

المقياس Claude Opus 4.6 Claude Opus 4.6 medium الإصدار: 2026-02-05 Claude Sonnet 4.6 Claude Sonnet 4.6 medium الإصدار: 2026-02-17 GPT-5.3-Codex GPT-5.3-Codex medium الإصدار: 2026-02-05 Gemini 3.1 Pro Preview Gemini 3.1 Pro Preview medium الإصدار: 2026-02-19
النتيجة 7.7 7.8 8.9 9.2
الترتيب #60 #56 #18 #9
الموثوقية 10.0 10.0 10.0 10.0
الاتساق 8.8 9.2 8.6 10.0
تغطية الاختبار المعياري 22/22 اختبارات · 66/66 محاولات 22/22 اختبارات · 66/66 محاولات 22/22 اختبارات · 66/66 محاولات 22/22 اختبارات · 66/66 محاولات
اختبارات صحيحة
معدل النجاح لكل محاولة 63.6% 66.7% 83.3% 90.9%
اختبارات غير مستقرة 3 2 4 0
إجمالي مرات التشغيل 66 66 66 66
التكلفة لكل نتيجة 23.524 14.692 5.748 6.801
إجمالي التكلفة $3.059 $2.057 $0.920 $1.361
سعر الإدخال $5.000 / 1M $3.000 / 1M $1.750 / 1M $2.000 / 1M
سعر الإخراج $25.000 / 1M $15.000 / 1M $14.000 / 1M $12.000 / 1M
إجمالي رموز الإدخال 108,615 106,292 81,268 92,287
رموز الإخراج 72,286 80,748 6,251 5,232
رموز الاستدلال 28,315 35,117 49,274 92,726
زمن الاستجابة (المتوسط) 34.27s 25.91s 16.96s 21.47s
زمن الاستجابة (الحد الأقصى) 151.51s 140.96s 100.93s 88.68s
زمن الاستجابة (الإجمالي) 513.99s 362.78s 373.19s 322.08s

عرض إنشاء النماذج

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#60 Claude Opus 4.6

medium
SVG غير صالح
التكلفة
$0.000
الوقت
300.0s
الرموز
0 tok

#56 Claude Sonnet 4.6

medium
SVG غير صالح
التكلفة
$0.000
الوقت
300.0s
الرموز
0 tok

#18 GPT-5.3-Codex

medium
التكلفة
$0.049
الوقت
54.9s
الرموز
3,580 tok

#9 Gemini 3.1 Pro Preview

medium
التكلفة
$0.115
الوقت
87.2s
الرموز
9,629 tok

أفضل النماذج حسب الدرجة

الدرجة مقابل التكلفة الإجمالية

زمن الاستجابة (المتوسط)

النتيجة vs زمن الاستجابة (المتوسط)

إجمالي رموز الإخراج

النتيجة vs إجمالي رموز الإخراج

تفصيل الفئات

البرمجة النتيجة الاتساق معدل النجاح لكل محاولة اختبارات غير مستقرة اختبارات صحيحة زمن الاستجابة (المتوسط) رموز الإدخال رموز الإخراج رموز الاستدلال
Claude Opus 4.6 5.7 7.1 44.4% 1 30.10s 8,522 13,057 4,121
Claude Sonnet 4.6 5.7 6.6 44.4% 1 33.29s 6,995 16,089 3,686
GPT-5.3-Codex 10.0 10.0 100.0% 0 19.50s 7,302 535 10,890
Gemini 3.1 Pro Preview 7.9 9.9 66.7% 0 40.17s 8,124 435 41,247

مقارنة سريعة

تبديل زوج المقارنة