#7

GPT-5.4

OpenAI · الإصدار: 2026-03-05 · openai/gpt-5.4::medium

متوسط الدرجة

8.2

التكلفة لكل نتيجة

6.533

الاتساق

8.9

إجمالي التكلفة

$0.784

اختبارات صحيحة

12

يعد الاختبار ناجحا بالكامل فقط إذا نجحت كل تشغيلاته.

الاختبارات الخاطئة

3

معدل النجاح لكل محاولة: 86.7%

اختبارات غير مستقرة

2

الاختبارات غير المستقرة لها نتائج مختلطة بين التشغيلات (نجاح واحد على الأقل وفشل واحد على الأقل).

زمن الاستجابة (المتوسط)

21.06s

زمن الاستجابة (الحد الأقصى): 100.41s

زمن الاستجابة (الإجمالي): 315.95s

إجابة خاطئة: 2 لم يتبع التعليمات: 1

أفضل النماذج حسب الدرجة

اختر النموذج الأول، ثم انقر على نموذج ثانٍ لفتح صفحة مقارنة جنبًا إلى جنب.

#1 Gemini 3 Flash Preview 10.0

#2 Gemini 3.1 Pro Preview 9.3

#3 Qwen3.5 Plus 2026-02-15 8.8

#4 GPT-5.3-Codex 8.7

#5 Qwen3.5-27B 8.5

#6 Qwen3.5-122B-A10B 8.2

#7 GPT-5.4 8.2

#8 Gemini 3 Flash Preview 8.1

#9 Gemini 3 Pro Preview 8.1

#10 Gemini 3.1 Flash Lite Preview 8.1

#11 GPT-5.2 Chat 7.7

#12 Gemini 3.1 Flash Lite Preview 7.6

#13 DeepSeek V3.2 7.6

الفئة	متوسط الدرجة	الاتساق	اختبارات صحيحة
Anti-AI Tricks	10.0	10.0	3/3
Combined	10.0	10.0	1/1
Data parsing and extraction	9.9	10.0	2/2
Domain specific	4.0	7.2	1/3
Instructions following	10.0	10.0	2/2
Puzzle Solving	7.0	7.2	2/3
Tool Calling	10.0	10.0	1/1