AI BENCHY Compare

Trinity Large Preview vs MoonshotAI: Kimi K2.5

تم إنشاء نتائج المعايير من مجموعات اختبارات AI BENCHY في: 2026-04-16

المقياس	Trinity Large Preview Trinity Large Preview none الإصدار: 2026-01-27 متاح مجانًا	Kimi K2.5 Kimi K2.5 none الإصدار: 2026-01-27

المقياس	Trinity Large Preview Trinity Large Preview none الإصدار: 2026-01-27 متاح مجانًا	Kimi K2.5 Kimi K2.5 none الإصدار: 2026-01-27
النتيجة	5.3	5.5
الترتيب	#76	#74
الاتساق	9.6	8.7
اختبارات صحيحة
معدل النجاح لكل محاولة	29.6%	40.7%
اختبارات غير مستقرة	1	3
إجمالي مرات التشغيل	52	54
التكلفة لكل نتيجة	0.000	0.271
إجمالي التكلفة	$0.000	$0.017
??? ???????	$0.000 / 1M	$0.383 / 1M
??? ???????	$0.000 / 1M	$1.720 / 1M
رموز الإخراج	1,985	2,659
رموز الاستدلال	0	0
زمن الاستجابة (المتوسط)	5.07s	13.37s
زمن الاستجابة (الحد الأقصى)	39.47s	42.13s
زمن الاستجابة (الإجمالي)	91.23s	147.05s

أفضل النماذج حسب الدرجة

الدرجة مقابل التكلفة الإجمالية

زمن الاستجابة (المتوسط)

النتيجة vs زمن الاستجابة (المتوسط)

إجمالي رموز الإخراج

النتيجة vs إجمالي رموز الإخراج

تفصيل الفئات

حيل مضادة للذكاء الاصطناعي	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
Trinity Large Preview	3.0	10.0	0.0%	0		3.02s	593	0
Kimi K2.5	3.6	8.4	8.3%	1		6.24s	373	0

البرمجة	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
Trinity Large Preview	6.3	10.0	0.0%	0		39.47s	142	0
Kimi K2.5	10.0	10.0	100.0%	0		38.78s	649	0

مجمّع	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
Trinity Large Preview	3.0	10.0	0.0%	0		8.91s	294	0
Kimi K2.5	2.8	2.1	33.3%	1		19.16s	748	0

تحليل البيانات واستخراجها	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
Trinity Large Preview	10.0	10.0	100.0%	0		3.26s	186	0
Kimi K2.5	7.3	5.8	83.3%	1		42.13s	187	0

خاص بالمجال	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
Trinity Large Preview	5.3	10.0	33.3%	0		877ms	25	0
Kimi K2.5	5.3	10.0	33.3%	0		4.38s	29	0

الذكاء العام	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
Trinity Large Preview	4.4	9.9	0.0%	0		2.86s	124	0
Kimi K2.5	10.0	10.0	100.0%	0		4.00s	76	0

اتباع التعليمات	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
Trinity Large Preview	4.1	6.7	16.7%	1		1.09s	63	0
Kimi K2.5	6.5	10.0	50.0%	0		2.67s	60	0

حل الألغاز	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
Trinity Large Preview	5.4	10.0	33.3%	0		3.30s	291	0
Kimi K2.5	3.1	10.0	0.0%	0		4.73s	317	0

استدعاء الأدوات	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
Trinity Large Preview	10.0	10.0	100.0%	0		6.67s	267	0
Kimi K2.5	10.0	10.0	100.0%	0		13.99s	220	0

مقارنة سريعة

تبديل زوج المقارنة

Trinity Large Previewnoneمتاح مجانًاvsMiniMax M2.7medium Trinity Large Previewnoneمتاح مجانًاvsElephantmedium Mistral Small 4mediumvsKimi K2.5none MiniMax M2.5mediumمتاح مجانًاvsKimi K2.5none MiniMax M2.7mediumvsKimi K2.5none Kimi K2.5nonevsgpt-oss-120bmediumمتاح مجانًا Kimi K2.5nonevsElephantmedium Trinity Large Previewnoneمتاح مجانًاvsMistral Small 4medium Trinity Large Previewnoneمتاح مجانًاvsMiniMax M2.5mediumمتاح مجانًا Trinity Large Previewnoneمتاح مجانًاvsgpt-oss-120bmediumمتاح مجانًا Trinity Large Previewnoneمتاح مجانًاvsQwen3 Coder Nextmedium Kimi K2.5nonevsGPT-5 Nanomedium