Compare Charts

Language:

❤️ Made by XCS

AI BENCHY Compare

OpenAI: GPT-5.4 vs Z.ai: GLM 4.7 Flash

Compare:

Last updated at: 2026-03-05

Metric	OpenAI: GPT-5.4 none Release: 2026-03-05	Z.ai: GLM 4.7 Flash none Release: 2026-01-19
Avg Score	4.6	3.9
Tests Correct
Rank	#44	#47
Consistency	8.9	8.3
Cost per result	1.496	0.064
Total Cost	$0.090	$0.003
Attempt pass rate	44.4%	37.8%
Flaky tests	2	3
common.totalAttempts	45 (15 x 3)	45 (15 x 3)
Output Tokens	1,635	1,721
Reasoning Tokens	0	0
Response Time (avg)	1.46s	3.16s
Response Time (max)	2.89s	7.05s
Response Time (total)	21.86s	25.31s

Top Models by Score

Score vs Total Cost

Response Time (avg)

Avg Score vs Response Time (avg)

Category Breakdown

Anti-AI Tricks	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
OpenAI: GPT-5.4	10.0	7.3	11.1%	1		1.41s	388	0
Z.ai: GLM 4.7 Flash	10.0	7.2	22.2%	1		6.59s	430	0

Combined	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
OpenAI: GPT-5.4	10.0	10.0	0.0%	0		2.89s	291	0
Z.ai: GLM 4.7 Flash	10.0	10.0	0.0%	0		3.22s	704	0

Data parsing and extraction	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
OpenAI: GPT-5.4	9.9	10.0	100.0%	0		1.04s	222	0
Z.ai: GLM 4.7 Flash	5.4	5.8	83.3%	1		4.82s	196	0

Domain specific	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
OpenAI: GPT-5.4	4.0	7.2	44.4%	1		1.07s	50	0
Z.ai: GLM 4.7 Flash	7.0	10.0	66.7%	0		744ms	19	0

Instructions following	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
OpenAI: GPT-5.4	5.5	10.0	50.0%	0		1.07s	81	0
Z.ai: GLM 4.7 Flash	5.5	10.0	50.0%	0		888ms	62	0

Puzzle Solving	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
OpenAI: GPT-5.4	4.0	9.8	33.3%	0		1.52s	357	0
Z.ai: GLM 4.7 Flash	3.7	10.0	0.0%	0		1.00s	98	0

Tool Calling	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
OpenAI: GPT-5.4	10.0	10.0	100.0%	0		2.75s	246	0
Z.ai: GLM 4.7 Flash	10.0	1.6	33.3%	1		7.05s	212	0

Quick Compare

Switch Comparison Pair

MiniMax M2.5mediumvsGPT-5.4none Qwen3 Coder NextmediumvsGLM 4.7 Flashnone Mercury 2mediumvsGPT-5.4none MiniMax M2.5mediumvsGLM 4.7 Flashnone GPT-5.4nonevsQwen3.5-35B-A3Bmedium GPT-5.4nonevsQwen3 Coder Nextmedium GPT-5.4nonevsGLM 4.7 Flashmedium gpt-oss-120bmediumFree AvailablevsGLM 4.7 Flashnone Mercury 2mediumvsGLM 4.7 Flashnone GPT-5 NanomediumvsGLM 4.7 Flashnone Claude Opus 4.6mediumvsGPT-5.4none Kimi K2.5mediumvsGPT-5.4none