التنقل
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

النماذج المقارنة

مقارنة benchmark بين Claude Opus 4.6 (medium) vs Claude Sonnet 4.6 (medium) vs GPT-5.3-Codex (medium) vs Gemini 3.1 Pro Preview (medium): يتصدر GPT-5.3-Codex (medium) في النتيجة بقيمة 9.1. يتصدر Claude Opus 4.6 (medium) في الموثوقية بقيمة 10.0. يمتلك GPT-5.3-Codex (medium) أقل إجمالي التكلفة عند $1.318. GPT-5.3-Codex (medium) هو الأسرع عند 18.87s.

تم إنشاء نتائج المعايير من مجموعات اختبارات AI BENCHY في: 2026-10-06

النماذج المقارنة

الترتيب
#228
إجمالي رموز الإخراج
96,722
زمن الاستجابة (المتوسط)
32.23s
إجمالي التكلفة
$2.961
الترتيب
#212
إجمالي رموز الإخراج
120,427
زمن الاستجابة (المتوسط)
28.08s
إجمالي التكلفة
$2.126
الترتيب
#34
إجمالي رموز الإخراج
66,287
زمن الاستجابة (المتوسط)
18.87s
إجمالي التكلفة
$1.318
الترتيب
#71
إجمالي رموز الإخراج
102,691
زمن الاستجابة (المتوسط)
22.71s
إجمالي التكلفة
$1.585
النموذج الموصى به GPT-5.3-Codex (medium)

It has the best score here (9.1), while costing about 1.7x less than النماذج الأخرى في هذه المقارنة.

مقارنة تفصيلية

المقياس Claude Opus 4.6 Claude Opus 4.6 medium الإصدار: 2026-02-05 Claude Sonnet 4.6 Claude Sonnet 4.6 medium الإصدار: 2026-02-17 GPT-5.3-Codex GPT-5.3-Codex medium الإصدار: 2026-02-05 Gemini 3.1 Pro Preview Gemini 3.1 Pro Preview medium الإصدار: 2026-02-19
النتيجة 6.3 6.4 9.1 8.4
الترتيب #228 #212 #34 #71
الموثوقية 10.0 10.0 10.0 9.8
الاتساق 8.5 9.1 8.6 9.6
محاولات 66/69 66/69 69/69 69/69
اختبارات صحيحة
معدل النجاح لكل محاولة 60.9% 62.3% 84.1% 89.9%
اختبارات غير مستقرة 3 1 4 1
إجمالي مرات التشغيل 66 66 69 69
التكلفة لكل نتيجة 22.777 15.182 7.753 7.924
إجمالي التكلفة $2.961 $2.126 $1.318 $1.585
سعر الإدخال $5.000 / 1M $3.000 / 1M $1.750 / 1M $2.000 / 1M
سعر الإخراج $25.000 / 1M $15.000 / 1M $14.000 / 1M $12.000 / 1M
سعر قراءة ذاكرة التخزين المؤقت $0.500 / 1M $0.300 / 1M $0.175 / 1M $0.200 / 1M
سعر الكتابة في ذاكرة التخزين المؤقت $6.250 / 1M $3.750 / 1M غير متاح $0.375 / 1M
إجمالي رموز الإدخال 108,573 106,316 222,794 176,208
رموز الإخراج 69,994 79,338 7,357 6,093
رموز الاستدلال 26,728 41,089 58,930 96,598
زمن الاستجابة (المتوسط) 32.23s 28.08s 18.87s 22.71s
زمن الاستجابة (الحد الأقصى) 151.51s 140.96s 100.93s 88.68s
زمن الاستجابة (الإجمالي) 515.65s 421.15s 433.94s 386.11s
المعلمات ~5T الإجمالي (~500B النشطة) ~1T الإجمالي (~100B النشطة) ~1.2T الإجمالي (~80B النشطة) ~1.2T الإجمالي (~20B النشطة)
الإتاحة مغلق المصدر مغلق المصدر مغلق المصدر مغلق المصدر

تنطبق أسعار التخزين المؤقت على رموز الإدخال. تعيد القراءة استخدام المطالبات المخزنة؛ وتحفظها الكتابة وقد تكلّف أكثر. تُحاسب رموز الإخراج بسعر الإخراج.

عرض إنشاء النماذج

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#228 Claude Opus 4.6

medium
Reached the allocated time limit (300 seconds) without receiving showcase output.
التكلفة
$0.000
الوقت
300.0s
الرموز
0 tok

#212 Claude Sonnet 4.6

medium
Reached the allocated time limit (300 seconds) without receiving showcase output.
التكلفة
$0.000
الوقت
300.0s
الرموز
0 tok

#34 GPT-5.3-Codex

medium
التكلفة
$0.049
الوقت
54.9s
الرموز
3,580 tok

#71 Gemini 3.1 Pro Preview

medium
التكلفة
$0.115
الوقت
87.2s
الرموز
9,629 tok

أفضل النماذج حسب الدرجة

الدرجة مقابل التكلفة الإجمالية

زمن الاستجابة (المتوسط)

النتيجة vs زمن الاستجابة (المتوسط)

إجمالي رموز الإخراج

النتيجة vs إجمالي رموز الإخراج

تفصيل الفئات

البرمجة النتيجة الاتساق معدل النجاح لكل محاولة اختبارات غير مستقرة اختبارات صحيحة زمن الاستجابة (المتوسط) رموز الإدخال رموز الإخراج رموز الاستدلال
Claude Opus 4.6 5.7 7.1 44.4% 1 30.10s 8,522 13,057 4,121
Claude Sonnet 4.6 5.7 6.6 44.4% 1 33.29s 6,995 16,089 3,686
GPT-5.3-Codex 10.0 10.0 100.0% 0 19.50s 7,302 535 10,890
Gemini 3.1 Pro Preview 7.9 9.9 66.7% 0 40.17s 8,124 435 41,247

مقارنة سريعة

تبديل زوج المقارنة