AI BENCHY Compare

Inception: Mercury 2 vs Owl Alpha

تم إنشاء نتائج المعايير من مجموعات اختبارات AI BENCHY في: 2026-06-03

المقياس	Mercury 2 Mercury 2 none الإصدار: 2026-02-24	Owl Alpha Owl Alpha medium الإصدار: 2026-04-30

المقياس	Mercury 2 Mercury 2 none الإصدار: 2026-02-24	Owl Alpha Owl Alpha medium الإصدار: 2026-04-30
النتيجة	4.6	5.8
الترتيب	#153	#107
الموثوقية	10.0	10.0
الاتساق	9.1	9.6
اختبارات صحيحة
معدل النجاح لكل محاولة	25.0%	41.7%
اختبارات غير مستقرة	2	1
إجمالي مرات التشغيل	60	60
التكلفة لكل نتيجة	0.216	0.000
إجمالي التكلفة	$0.009	$0.000
سعر الإدخال	$0.250 / 1M	$0.000 / 1M
سعر الإخراج	$0.750 / 1M	$0.000 / 1M
إجمالي رموز الإدخال	25,515	40,601
رموز الإخراج	3,001	2,965
رموز الاستدلال	0	0
زمن الاستجابة (المتوسط)	614ms	11.64s
زمن الاستجابة (الحد الأقصى)	1.27s	58.63s
زمن الاستجابة (الإجمالي)	12.28s	232.83s

أفضل النماذج حسب الدرجة

الدرجة مقابل التكلفة الإجمالية

زمن الاستجابة (المتوسط)

النتيجة vs زمن الاستجابة (المتوسط)

إجمالي رموز الإخراج

النتيجة vs إجمالي رموز الإخراج

تفصيل الفئات

حيل مضادة للذكاء الاصطناعي	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإدخال	رموز الإخراج	رموز الاستدلال
Mercury 2	3.0	10.0	0.0%	0		483ms	631	286	0
Owl Alpha	4.8	10.0	25.0%	0		3.97s	1,596	87	0

البرمجة	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإدخال	رموز الإخراج	رموز الاستدلال
Mercury 2	3.5	9.4	0.0%	0		831ms	4,631	1,650	0
Owl Alpha	6.6	10.0	50.0%	0		19.08s	3,872	1,754	0

مجمّع	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإدخال	رموز الإخراج	رموز الاستدلال
Mercury 2	3.0	10.0	0.0%	0		606ms	4,821	131	0
Owl Alpha	3.0	10.0	0.0%	0		10.01s	14,259	315	0

تحليل البيانات واستخراجها	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإدخال	رموز الإخراج	رموز الاستدلال
Mercury 2	7.3	5.9	83.3%	1		667ms	6,362	180	0
Owl Alpha	10.0	10.0	100.0%	0		21.64s	8,157	246	0

خاص بالمجال	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإدخال	رموز الإخراج	رموز الاستدلال
Mercury 2	5.3	7.2	44.4%	1		534ms	784	46	0
Owl Alpha	5.3	10.0	33.3%	0		8.58s	1,458	28	0

الذكاء العام	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإدخال	رموز الإخراج	رموز الاستدلال
Mercury 2	4.8	10.0	0.0%	0		628ms	495	159	0
Owl Alpha	4.3	10.0	0.0%	0		58.63s	732	98	0

اتباع التعليمات	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإدخال	رموز الإخراج	رموز الاستدلال
Mercury 2	6.5	10.0	50.0%	0		551ms	691	82	0
Owl Alpha	6.5	10.0	50.0%	0		10.15s	1,161	57	0

حل الألغاز	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإدخال	رموز الإخراج	رموز الاستدلال
Mercury 2	3.1	10.0	0.0%	0		535ms	694	251	0
Owl Alpha	5.3	7.2	44.4%	1		3.40s	1,392	135	0

استدعاء الأدوات	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإدخال	رموز الإخراج	رموز الاستدلال
Mercury 2	10.0	10.0	100.0%	0		1.27s	6,193	197	0
Owl Alpha	10.0	10.0	100.0%	0		8.26s	7,524	228	0

معلومات عامة	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإدخال	رموز الإخراج	رموز الاستدلال
Mercury 2	3.0	10.0	0.0%	0		548ms	213	19	0
Owl Alpha	3.0	10.0	0.0%	0		2.38s	450	17	0

مقارنة سريعة

تبديل زوج المقارنة

Owl AlphamediumvsGLM 5.1none DeepSeek V4 PrononevsOwl Alphamedium Owl AlphamediumvsQwen3.5 Plus 2026-04-20none Seed-2.0-LitenonevsOwl Alphamedium Owl AlphamediumvsQwen3.5-35B-A3Bnone Owl AlphamediumvsGLM 5V Turbonone Owl AlphamediumvsQwen3.5-27Bnone Owl AlphamediumvsQwen3.6 27Bnone Owl AlphamediumvsQwen3.5-Flashnone Mercury 2nonevsQwen3 Coder Nextmedium Owl AlphamediumvsMimo V2 PROnone Mercury 2nonevsGLM 4.7 Flashmedium