AI BENCHY Compare

Anthropic: Claude Opus 4.7 vs OpenAI: GPT-5.3-Codex

الملخص

يتقدم GPT-5.3-Codex (medium) في متوسط النتيجة بـ 8.9 مقابل 8.7. لدى Claude Opus 4.7 (medium) تكلفة benchmark أقل عند $0.679 مقابل $0.740. Claude Opus 4.7 (medium) أسرع عند 4.73s مقابل 16.22s، مع معدلات نجاح 82.5% مقابل 82.5%.

النموذج الموصى بهClaude Opus 4.7 (medium)Its score stays close to the best score here (8.7 vs 8.9), while responding about 3.4x faster than GPT-5.3-Codex (medium).

تم إنشاء نتائج المعايير من مجموعات اختبارات AI BENCHY في: 2026-07-14

المقياس	Claude Opus 4.7 Claude Opus 4.7 medium الإصدار: 2026-04-16	GPT-5.3-Codex GPT-5.3-Codex medium الإصدار: 2026-02-05

المقياس	Claude Opus 4.7 Claude Opus 4.7 medium الإصدار: 2026-04-16	GPT-5.3-Codex GPT-5.3-Codex medium الإصدار: 2026-02-05
النتيجة	8.7	8.9
الترتيب	#16	#13
الموثوقية	10.0	10.0
الاتساق	9.6	8.5
اختبارات صحيحة
معدل النجاح لكل محاولة	82.5%	82.5%
اختبارات غير مستقرة	1	4
إجمالي مرات التشغيل	63	63
التكلفة لكل نتيجة	3.991	4.932
إجمالي التكلفة	$0.679	$0.740
سعر الإدخال	$5.000 / 1M	$1.750 / 1M
سعر الإخراج	$25.000 / 1M	$14.000 / 1M
إجمالي رموز الإدخال	65,406	34,299
رموز الإخراج	11,858	2,357
رموز الاستدلال	2,198	46,189
زمن الاستجابة (المتوسط)	4.73s	16.22s
زمن الاستجابة (الحد الأقصى)	23.18s	100.93s
زمن الاستجابة (الإجمالي)	94.51s	340.67s

عرض إنشاء

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#16 Claude Opus 4.7

medium

التكلفة: $0.059
الوقت: 26.8s
الرموز: 2,475 tok

#13 GPT-5.3-Codex

medium

التكلفة: $0.049
الوقت: 54.9s
الرموز: 3,580 tok

أفضل النماذج حسب الدرجة

الدرجة مقابل التكلفة الإجمالية

زمن الاستجابة (المتوسط)

النتيجة vs زمن الاستجابة (المتوسط)

إجمالي رموز الإخراج

النتيجة vs إجمالي رموز الإخراج

تفصيل الفئات

الفئة:

حيل مضادة للذكاء الاصطناعي	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإدخال	رموز الإخراج	رموز الاستدلال
Claude Opus 4.7	8.3	10.0	75.0%	0		1.85s	894	348	0
GPT-5.3-Codex	8.7	7.9	91.7%	1		4.16s	606	240	1,722

البرمجة	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإدخال	رموز الإخراج	رموز الاستدلال
Claude Opus 4.7	7.6	7.2	77.8%	1		12.96s	10,635	7,629	1,114
GPT-5.3-Codex	10.0	10.0	100.0%	0		19.50s	7,302	535	10,890

مجمّع	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإدخال	رموز الإخراج	رموز الاستدلال
Claude Opus 4.7	10.0	10.0	100.0%	0		21.45s	24,501	2,369	1,084
GPT-5.3-Codex	10.0	10.0	100.0%	0		19.56s	11,019	364	2,731

تحليل البيانات واستخراجها	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإدخال	رموز الإخراج	رموز الاستدلال
Claude Opus 4.7	10.0	10.0	100.0%	0		2.37s	10,533	324	0
GPT-5.3-Codex	10.0	10.0	100.0%	0		3.07s	7,140	234	728

خاص بالمجال	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإدخال	رموز الإخراج	رموز الاستدلال
Claude Opus 4.7	7.7	10.0	66.7%	0		1.17s	630	51	0
GPT-5.3-Codex	5.9	7.2	55.6%	1		64.31s	813	64	25,308

الذكاء العام	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإدخال	رموز الإخراج	رموز الاستدلال
Claude Opus 4.7	10.0	10.0	100.0%	0		2.87s	723	256	0
GPT-5.3-Codex	4.6	10.0	0.0%	0		4.87s	477	187	331

اتباع التعليمات	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإدخال	رموز الإخراج	رموز الاستدلال
Claude Opus 4.7	10.0	10.0	100.0%	0		1.57s	939	114	0
GPT-5.3-Codex	10.0	10.0	100.0%	0		3.04s	660	93	693

حل الألغاز	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإدخال	رموز الإخراج	رموز الاستدلال
Claude Opus 4.7	10.0	10.0	100.0%	0		2.43s	939	370	0
GPT-5.3-Codex	9.0	7.9	88.9%	1		5.05s	642	356	1,593

استدعاء الأدوات	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإدخال	رموز الإخراج	رموز الاستدلال
Claude Opus 4.7	10.0	10.0	100.0%	0		4.17s	15,339	373	0
GPT-5.3-Codex	10.0	10.0	100.0%	0		6.37s	5,445	254	492

معلومات عامة	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإدخال	رموز الإخراج	رموز الاستدلال
Claude Opus 4.7	3.0	10.0	0.0%	0		2.25s	273	24	0
GPT-5.3-Codex	2.8	1.6	33.3%	1		14.43s	195	30	1,701

مقارنة سريعة

تبديل زوج المقارنة

Claude Opus 4.7mediumvsGPT-5.2 Chatnone Gemini 3.5 FlashlowvsGPT-5.3-Codexmedium Claude Opus 4.7mediumvsDeepSeek V4 Flashhigh Claude Opus 4.7mediumvsGPT-5.6 Terrahigh Claude Opus 4.7mediumvsGemini 3.5 Flashlow Claude Opus 4.7mediumvsGPT-5.5low Claude Opus 4.7mediumvsGPT-5.6 Solhigh DeepSeek V4 FlashhighvsGPT-5.3-Codexmedium Claude Opus 4.7mediumvsGLM 5.2high Claude Opus 4.7mediumvsKAT-Coder-Pro V2.5low Claude Opus 4.7mediumvsGPT-5.6 Sollow Claude Opus 4.7mediumvsGrok 4.5low