AI BENCHY Compare

Anthropic: Claude Opus 4.7 vs Xiaomi: MiMo-V2.5

تم إنشاء نتائج المعايير من مجموعات اختبارات AI BENCHY في: 2026-04-22

المقياس	Claude Opus 4.7 Claude Opus 4.7 none الإصدار: 2026-04-16	MiMo-V2.5 MiMo-V2.5 medium الإصدار: 2026-04-22

المقياس	Claude Opus 4.7 Claude Opus 4.7 none الإصدار: 2026-04-16	MiMo-V2.5 MiMo-V2.5 medium الإصدار: 2026-04-22
النتيجة	9.2	7.8
الترتيب	#4	#35
الاتساق	10.0	8.6
اختبارات صحيحة
معدل النجاح لكل محاولة	88.9%	74.1%
اختبارات غير مستقرة	0	3
إجمالي مرات التشغيل	54	54
التكلفة لكل نتيجة	3.155	2.102
إجمالي التكلفة	$0.505	$0.253
??? ???????	$5.000 / 1M	$0.400 / 1M
??? ???????	$25.000 / 1M	$2.000 / 1M
رموز الإخراج	6,326	2,840
رموز الاستدلال	0	116,242
زمن الاستجابة (المتوسط)	3.13s	13.71s
زمن الاستجابة (الحد الأقصى)	18.27s	86.93s
زمن الاستجابة (الإجمالي)	56.33s	246.73s

أفضل النماذج حسب الدرجة

الدرجة مقابل التكلفة الإجمالية

زمن الاستجابة (المتوسط)

النتيجة vs زمن الاستجابة (المتوسط)

إجمالي رموز الإخراج

النتيجة vs إجمالي رموز الإخراج

تفصيل الفئات

حيل مضادة للذكاء الاصطناعي	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
Claude Opus 4.7	8.3	10.0	75.0%	0		2.12s	522	0
MiMo-V2.5	10.0	10.0	100.0%	0		1.98s	303	2,022

البرمجة	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
Claude Opus 4.7	10.0	10.0	100.0%	0		2.84s	494	0
MiMo-V2.5	10.0	10.0	100.0%	0		31.48s	488	14,813

مجمّع	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
Claude Opus 4.7	9.5	10.0	100.0%	0		18.27s	3,504	0
MiMo-V2.5	10.0	10.0	100.0%	0		16.86s	363	7,609

تحليل البيانات واستخراجها	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
Claude Opus 4.7	10.0	10.0	100.0%	0		2.15s	324	0
MiMo-V2.5	2.7	5.7	16.7%	1		6.33s	306	5,714

خاص بالمجال	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
Claude Opus 4.7	7.7	10.0	66.7%	0		1.19s	78	0
MiMo-V2.5	5.3	10.0	33.3%	0		34.53s	507	49,478

الذكاء العام	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
Claude Opus 4.7	10.0	10.0	100.0%	0		3.47s	257	0
MiMo-V2.5	3.8	2.5	33.3%	1		1.55s	118	170

اتباع التعليمات	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
Claude Opus 4.7	10.0	10.0	100.0%	0		1.46s	114	0
MiMo-V2.5	9.9	10.0	100.0%	0		1.80s	88	801

حل الألغاز	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
Claude Opus 4.7	10.0	10.0	100.0%	0		2.58s	661	0
MiMo-V2.5	8.2	7.2	88.9%	1		20.60s	364	33,211

استدعاء الأدوات	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
Claude Opus 4.7	10.0	10.0	100.0%	0		4.74s	372	0
MiMo-V2.5	10.0	10.0	100.0%	0		7.29s	303	2,424

مقارنة سريعة

تبديل زوج المقارنة

GPT-5.3 ChatnonevsMiMo-V2.5medium Gemini 3.1 Flash Lite PreviewnonevsMiMo-V2.5medium GPT-5.2 ChatnonevsMiMo-V2.5medium Claude Sonnet 4.6nonevsMiMo-V2.5medium Gemini 3.1 Flash Lite PreviewlowvsMiMo-V2.5medium Claude Opus 4.7nonevsGemini 3 Flash Previewlow Gemini 3 Flash PreviewnonevsMiMo-V2.5medium Claude Opus 4.7nonevsGemini 3.1 Pro Previewmedium Claude Opus 4.7nonevsSeed-2.0-Litemedium Claude Opus 4.7nonevsGPT-5.3-Codexmedium Claude Opus 4.7nonevsQwen3.5 Plus 2026-02-15medium Claude Opus 4.7nonevsQwen3.6 Plus Previewmediumمتاح مجانًا