قارن الرسوم البيانية

اللغة:

❤️ Made by XCS

AI BENCHY Compare

Anthropic: Claude Sonnet 4.6 vs Inception: Mercury 2

قارن:

تم إنشاء نتائج المعايير من مجموعات اختبارات AI BENCHY في: 2026-03-05

المقياس	Anthropic: Claude Sonnet 4.6 none الإصدار: 2026-02-17	Inception: Mercury 2 medium الإصدار: 2026-02-24
الترتيب	#25	#35
متوسط الدرجة	6.9	5.4
اختبارات صحيحة
الاتساق	10.0	8.3
التكلفة لكل نتيجة	2.460	0.622
إجمالي التكلفة	$0.246	$0.044
معدل النجاح لكل محاولة	66.7%	57.8%
اختبارات غير مستقرة	0	3
common.totalAttempts	45 (15 x 3)	45 (15 x 3)
رموز الإخراج	6,703	3,571
رموز الاستدلال	0	45,379
زمن الاستجابة (المتوسط)	5.94s	2.47s
زمن الاستجابة (الحد الأقصى)	23.84s	14.63s
زمن الاستجابة (الإجمالي)	47.55s	34.56s

أفضل النماذج حسب الدرجة

زمن الاستجابة (المتوسط)

الدرجة مقابل التكلفة الإجمالية

متوسط الدرجة vs زمن الاستجابة (المتوسط)

تفصيل الفئات

حيل مضادة للذكاء الاصطناعي	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
Anthropic: Claude Sonnet 4.6	4.0	10.0	33.3%	0		4.83s	1,199	0
Inception: Mercury 2	7.3	9.8	66.7%	0		1.30s	2,531	2,410

مجمّع	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
Anthropic: Claude Sonnet 4.6	9.0	10.0	100.0%	0		23.84s	3,766	0
Inception: Mercury 2	10.0	10.0	100.0%	0		3.28s	268	4,887

تحليل البيانات واستخراجها	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
Anthropic: Claude Sonnet 4.6	9.9	10.0	100.0%	0		3.43s	252	0
Inception: Mercury 2	5.5	5.9	83.3%	1		1.11s	183	1,656

خاص بالمجال	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
Anthropic: Claude Sonnet 4.6	7.0	10.0	66.7%	0		3.54s	413	0
Inception: Mercury 2	10.0	7.2	11.1%	1		6.48s	41	30,754

اتباع التعليمات	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
Anthropic: Claude Sonnet 4.6	5.5	10.0	50.0%	0		1.96s	90	0
Inception: Mercury 2	10.0	10.0	100.0%	0		1.07s	14	958

Puzzle Solving	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
Anthropic: Claude Sonnet 4.6	7.0	10.0	66.7%	0		2.92s	536	0
Inception: Mercury 2	1.7	7.5	22.2%	1		934ms	354	2,758

استدعاء الأدوات	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	زمن الاستجابة (المتوسط)	رموز الإخراج	رموز الاستدلال
Anthropic: Claude Sonnet 4.6	10.0	10.0	100.0%	0		4.11s	447	0
Inception: Mercury 2	10.0	10.0	100.0%	0		1.89s	180	1,956

مقارنة سريعة

تبديل زوج المقارنة

Claude Sonnet 4.6nonevsGPT-5.2medium Claude Sonnet 4.6nonevsQwen3.5-Flashmedium Claude Sonnet 4.6nonevsSeed-2.0-Minimedium Gemini 2.5 FlashnonevsMercury 2medium DeepSeek V3.2nonevsMercury 2medium Mercury 2mediumvsQwen3.5-122B-A10Bnone Mercury 2mediumvsGLM 5none Claude Sonnet 4.6nonevsGrok 4.1 Fastmedium Claude Sonnet 4.6nonevsGemini 3.1 Flash Lite Previewmedium Claude Sonnet 4.6nonevsKimi K2.5medium Mercury 2mediumvsQwen3.5-Flashnone Mercury 2mediumvsQwen3.5-27Bnone