AI BENCHY Compare

Anthropic: Claude Opus 4.8 vs OpenAI: GPT-5 Mini

الملخص

مقارنة benchmark بين Claude Opus 4.8 و GPT-5 Mini: يتقدم GPT-5 Mini في متوسط النتيجة بـ 8.5 مقابل 7.7. لدى GPT-5 Mini تكلفة benchmark أقل عند $0.159 مقابل $1.270. Claude Opus 4.8 أسرع عند 10.83s مقابل 23.64s، مع معدلات نجاح 79.4% مقابل 63.5%.

النموذج الموصى به: GPT-5 Mini - It has the best score here (8.5), while costing about 8.0x less than Claude Opus 4.8.

تم إنشاء نتائج المعايير من مجموعات اختبارات AI BENCHY في: 2026-07-02

المقياس	Claude Opus 4.8 Claude Opus 4.8 low الإصدار: 2026-05-28	GPT-5 Mini GPT-5 Mini medium الإصدار: 2025-08-07

المقياس	Claude Opus 4.8 Claude Opus 4.8 low الإصدار: 2026-05-28	GPT-5 Mini GPT-5 Mini medium الإصدار: 2025-08-07
النتيجة	7.7	8.5
الترتيب	#38	#16
الموثوقية	10.0	10.0
الاتساق	8.8	9.1
اختبارات صحيحة
معدل النجاح لكل محاولة	79.4%	63.5%
اختبارات غير مستقرة	3	2
إجمالي مرات التشغيل	63	63
التكلفة لكل نتيجة	8.466	1.319
إجمالي التكلفة	$1.270	$0.159
سعر الإدخال	$5.000 / 1M	$0.250 / 1M
سعر الإخراج	$25.000 / 1M	$2.000 / 1M
إجمالي رموز الإدخال	60,946	37,100
رموز الإخراج	31,771	6,801
رموز الاستدلال	6,831	67,690
زمن الاستجابة (المتوسط)	10.83s	23.64s
زمن الاستجابة (الحد الأقصى)	127.97s	88.15s
زمن الاستجابة (الإجمالي)	227.39s	496.44s

عرض إنشاء

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#38 Claude Opus 4.8

low

التكلفة: $0.031
الوقت: 14.1s
الرموز: 1,345 tok

#16 GPT-5 Mini

medium

التكلفة: $0.007
الوقت: 42.9s
الرموز: 3,432 tok

أفضل النماذج حسب الدرجة

الدرجة مقابل التكلفة الإجمالية

زمن الاستجابة (المتوسط)

النتيجة vs زمن الاستجابة (المتوسط)

إجمالي رموز الإخراج

النتيجة vs إجمالي رموز الإخراج

تفصيل الفئات

حيل مضادة للذكاء الاصطناعي	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإدخال	رموز الإخراج	رموز الاستدلال
Claude Opus 4.8	10.0	10.0	100.0%	0		3.30s	834	793	371
GPT-5 Mini	7.1	7.6	66.7%	1		13.86s	606	1,715	6,378

البرمجة	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإدخال	رموز الإخراج	رموز الاستدلال
Claude Opus 4.8	6.6	4.6	77.8%	2		7.58s	10,590	3,637	809
GPT-5 Mini	10.0	10.0	100.0%	0		27.63s	7,302	658	17,152

مجمّع	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإدخال	رموز الإخراج	رموز الاستدلال
Claude Opus 4.8	9.8	10.0	100.0%	0		20.84s	23,500	2,216	1,081
GPT-5 Mini	10.0	10.0	100.0%	0		88.15s	14,118	754	11,520

تحليل البيانات واستخراجها	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإدخال	رموز الإخراج	رموز الاستدلال
Claude Opus 4.8	6.3	5.8	66.7%	1		2.27s	10,503	310	0
GPT-5 Mini	10.0	10.0	100.0%	0		12.58s	7,140	453	3,200

خاص بالمجال	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإدخال	رموز الإخراج	رموز الاستدلال
Claude Opus 4.8	5.3	10.0	33.3%	0		45.53s	975	23,311	3,908
GPT-5 Mini	3.6	7.2	22.2%	1		44.63s	515	293	14,016

الذكاء العام	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإدخال	رموز الإخراج	رموز الاستدلال
Claude Opus 4.8	10.0	10.0	100.0%	0		2.55s	708	231	0
GPT-5 Mini	4.5	10.0	0.0%	0		13.50s	477	349	1,856

اتباع التعليمات	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإدخال	رموز الإخراج	رموز الاستدلال
Claude Opus 4.8	9.8	10.0	100.0%	0		2.78s	909	111	221
GPT-5 Mini	10.0	10.0	100.0%	0		11.59s	660	310	3,968

حل الألغاز	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإدخال	رموز الإخراج	رموز الاستدلال
Claude Opus 4.8	10.0	10.0	100.0%	0		3.01s	894	592	184
GPT-5 Mini	5.6	9.8	33.3%	0		15.20s	642	1,622	6,144

استدعاء الأدوات	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإدخال	رموز الإخراج	رموز الاستدلال
Claude Opus 4.8	10.0	10.0	100.0%	0		6.85s	11,775	370	35
GPT-5 Mini	10.0	10.0	100.0%	0		18.64s	5,445	487	1,600

معلومات عامة	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإدخال	رموز الإخراج	رموز الاستدلال
Claude Opus 4.8	3.0	10.0	0.0%	0		5.48s	258	200	222
GPT-5 Mini	3.0	10.0	0.0%	0		9.99s	195	160	1,856

مقارنة سريعة

تبديل زوج المقارنة