قارن الرسوم البيانية

اللغة:

❤️ Made by XCS

AI BENCHY Compare

Anthropic: Claude Sonnet 4.6 vs Google: Gemini 3.1 Flash Lite Preview

قارن:

تم إنشاء نتائج المعايير من مجموعات اختبارات AI BENCHY في: 2026-03-03

المقياس	Anthropic: Claude Sonnet 4.6 none الإصدار: 2026-02-17	Google: Gemini 3.1 Flash Lite Preview low الإصدار: 2026-03-03
الترتيب	#22	#8
متوسط الدرجة	6.36	7.84
الاتساق	9.50	10.00
التكلفة لكل نتيجة	1.325	0.151
إجمالي التكلفة	$0.106	$0.016
اختبارات صحيحة
معدل النجاح لكل محاولة	59.5%	71.4%
اختبارات غير مستقرة	1	0
رموز الإخراج	2,637	1,317
رموز الاستدلال	0	6,126

أفضل النماذج حسب الدرجة

الدرجة مقابل التكلفة الإجمالية

تفصيل الفئات

حيل مضادة للذكاء الاصطناعي	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	رموز الإخراج	رموز الاستدلال
Anthropic: Claude Sonnet 4.6	4.00	10.00	33.3%	0		1,199	0
Google: Gemini 3.1 Flash Lite Preview	7.00	10.00	66.7%	0		456	1,224

تحليل البيانات واستخراجها	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	رموز الإخراج	رموز الاستدلال
Anthropic: Claude Sonnet 4.6	10.00	10.00	100.0%	0		252	0
Google: Gemini 3.1 Flash Lite Preview	9.88	10.00	100.0%	0		291	696

خاص بالمجال	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	رموز الإخراج	رموز الاستدلال
Anthropic: Claude Sonnet 4.6	7.00	10.00	66.7%	0		54	0
Google: Gemini 3.1 Flash Lite Preview	4.00	10.00	33.3%	0		18	1,212

اتباع التعليمات	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	رموز الإخراج	رموز الاستدلال
Anthropic: Claude Sonnet 4.6	5.50	10.00	50.0%	0		90	0
Google: Gemini 3.1 Flash Lite Preview	8.50	10.00	50.0%	0		72	753

Puzzle Solving	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	رموز الإخراج	رموز الاستدلال
Anthropic: Claude Sonnet 4.6	5.00	7.68	44.4%	1		595	0
Google: Gemini 3.1 Flash Lite Preview	10.00	10.00	100.0%	0		243	1,248

استدعاء الأدوات	النتيجة	الاتساق	معدل النجاح لكل محاولة	اختبارات غير مستقرة	اختبارات صحيحة	رموز الإخراج	رموز الاستدلال
Anthropic: Claude Sonnet 4.6	10.00	10.00	100.0%	0		447	0
Google: Gemini 3.1 Flash Lite Preview	10.00	10.00	100.0%	0		237	993

مقارنة سريعة

تبديل زوج المقارنة

Claude Sonnet 4.6nonevsGrok 4.1 Fastmedium Claude Sonnet 4.6nonevsKimi K2.5medium Gemini 3.1 Flash Lite PreviewlowvsGPT-5.3-Codexmedium Claude Sonnet 4.6nonevsSeed-2.0-Minimedium Claude Sonnet 4.6nonevsMiMo-V2-Flashmedium Claude Sonnet 4.6mediumvsGemini 3.1 Flash Lite Previewlow Claude Sonnet 4.6nonevsQwen3.5-122B-A10Bmedium Claude Sonnet 4.6nonevsQwen3.5-35B-A3Bmedium Gemini 3.1 Flash Lite PreviewlowvsGPT-5.2 Chatnone Claude Sonnet 4.6nonevsGPT-5 Nanomedium Gemini 3.1 Flash Lite PreviewlowvsGLM 5medium Claude Sonnet 4.6nonevsGemini 3.1 Flash Lite Previewmedium