قارن الرسوم البيانية

اللغة:

❤️ Made by XCS

AI BENCHY Compare

Inception: Mercury 2 vs OpenAI: GPT-5.4

قارن:

تم إنشاء نتائج المعايير من مجموعات اختبارات AI BENCHY في: 2026-03-05

المقياس	Inception: Mercury 2 medium الإصدار: 2026-02-24	OpenAI: GPT-5.4 none الإصدار: 2026-03-05
الترتيب	#35	#44
متوسط الدرجة	54	46
الاتساق	83	89
التكلفة لكل نتيجة	0.622	1.496
إجمالي التكلفة	$0.044	$0.090
زمن الاستجابة (المتوسط)	2.47s	1.46s
زمن الاستجابة (الحد الأقصى)	14.63s	2.89s
زمن الاستجابة (الإجمالي)	34.56s	21.86s
اختبارات صحيحة
معدل النجاح لكل محاولة	57.8%	44.4%
اختبارات غير مستقرة	3	2
رموز الإخراج	3,571	1,635
رموز الاستدلال	45,379	0

أفضل النماذج حسب الدرجة

زمن الاستجابة (المتوسط)

الدرجة مقابل التكلفة الإجمالية

متوسط الدرجة vs زمن الاستجابة (المتوسط)

تفصيل الفئات

حيل مضادة للذكاء الاصطناعي	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
Inception: Mercury 2	73	98	66.7%	0		1.30s	2,531	2,410
OpenAI: GPT-5.4	100	73	11.1%	1		1.41s	388	0

مجمّع	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
Inception: Mercury 2	100	100	100.0%	0		3.28s	268	4,887
OpenAI: GPT-5.4	100	100	0.0%	0		2.89s	291	0

تحليل البيانات واستخراجها	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
Inception: Mercury 2	55	59	83.3%	1		1.11s	183	1,656
OpenAI: GPT-5.4	99	100	100.0%	0		1.04s	222	0

خاص بالمجال	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
Inception: Mercury 2	100	72	11.1%	1		6.48s	41	30,754
OpenAI: GPT-5.4	40	72	44.4%	1		1.07s	50	0

اتباع التعليمات	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
Inception: Mercury 2	100	100	100.0%	0		1.07s	14	958
OpenAI: GPT-5.4	55	100	50.0%	0		1.07s	81	0

Puzzle Solving	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
Inception: Mercury 2	17	75	22.2%	1		934ms	354	2,758
OpenAI: GPT-5.4	40	98	33.3%	0		1.52s	357	0

استدعاء الأدوات	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
Inception: Mercury 2	100	100	100.0%	0		1.89s	180	1,956
OpenAI: GPT-5.4	100	100	100.0%	0		2.75s	246	0

مقارنة سريعة

تبديل زوج المقارنة

Gemini 2.5 FlashnonevsMercury 2medium MiniMax M2.5mediumvsGPT-5.4none DeepSeek V3.2nonevsMercury 2medium Mercury 2mediumvsQwen3.5-122B-A10Bnone Mercury 2mediumvsGLM 5none Mercury 2mediumvsQwen3.5-Flashnone Mercury 2mediumvsQwen3.5-27Bnone Mercury 2mediumvsQwen3.5-35B-A3Bnone Mercury 2mediumvsQwen3.5 Plus 2026-02-15none Trinity Large Preview (free)noneمتاح مجانًاvsMercury 2medium GPT-5.4nonevsQwen3.5-35B-A3Bmedium GPT-5.4nonevsQwen3 Coder Nextmedium