导航
AI BENCHY
Advertise here

AI BENCHY 对比

Inception: Mercury 2 vs Z.ai: GLM 4.7 Flash

基准结果生成自 AI BENCHY 测试套件,时间:: 2026-06-03

指标 Mercury 2 Mercury 2 none 发布日期: 2026-02-24 GLM 4.7 Flash GLM 4.7 Flash medium 发布日期: 2026-01-19
分数 4.6 4.5
排名 #153 #155
可靠性 10.0 10.0
一致性 9.1 6.7
测试正确
尝试通过率 25.0% 35.0%
不稳定测试 2 8
总运行次数 60 60
每个结果成本 0.216 1.337
总成本 $0.009 $0.054
输入价格 $0.250 / 1M $0.060 / 1M
输出价格 $0.750 / 1M $0.400 / 1M
总输入令牌 25,515 37,206
输出令牌 3,001 43,754
推理令牌 0 89,079
响应时间(平均) 614ms 35.10s
响应时间(最大) 1.27s 174.55s
响应时间(总计) 12.28s 456.24s

按分数排名的模型

分数 vs 总成本

响应时间(平均)

分数 vs 响应时间(平均)

总输出令牌

分数 vs 总输出令牌

类别细分

反AI技巧 分数 一致性 尝试通过率 不稳定测试 测试正确 响应时间(平均) 输入令牌 输出令牌 推理令牌
Mercury 2 3.0 10.0 0.0% 0 483ms 631 286 0
GLM 4.7 Flash 4.7 5.9 41.7% 2 14.95s 555 1,122 6,110
编程 分数 一致性 尝试通过率 不稳定测试 测试正确 响应时间(平均) 输入令牌 输出令牌 推理令牌
Mercury 2 3.5 9.4 0.0% 0 831ms 4,631 1,650 0
GLM 4.7 Flash 3.4 6.0 16.7% 1 55.33s 3,106 4,981 22,387
综合 分数 一致性 尝试通过率 不稳定测试 测试正确 响应时间(平均) 输入令牌 输出令牌 推理令牌
Mercury 2 3.0 10.0 0.0% 0 606ms 4,821 131 0
GLM 4.7 Flash 2.8 2.1 33.3% 1 65.57s 17,185 2,585 20,648
数据解析与提取 分数 一致性 尝试通过率 不稳定测试 测试正确 响应时间(平均) 输入令牌 输出令牌 推理令牌
Mercury 2 7.3 5.9 83.3% 1 667ms 6,362 180 0
GLM 4.7 Flash 6.3 10.0 50.0% 0 1.51s 7,107 584 2,755
领域专项 分数 一致性 尝试通过率 不稳定测试 测试正确 响应时间(平均) 输入令牌 输出令牌 推理令牌
Mercury 2 5.3 7.2 44.4% 1 534ms 784 46 0
GLM 4.7 Flash 3.5 4.4 33.3% 2 174.55s 643 33,000 25,394
通用智能 分数 一致性 尝试通过率 不稳定测试 测试正确 响应时间(平均) 输入令牌 输出令牌 推理令牌
Mercury 2 4.8 10.0 0.0% 0 628ms 495 159 0
GLM 4.7 Flash 3.6 9.7 0.0% 0 18.14s 318 18 2,138
指令遵循 分数 一致性 尝试通过率 不稳定测试 测试正确 响应时间(平均) 输入令牌 输出令牌 推理令牌
Mercury 2 6.5 10.0 50.0% 0 551ms 691 82 0
GLM 4.7 Flash 6.2 5.8 66.7% 1 2.97s 636 388 2,181
谜题求解 分数 一致性 尝试通过率 不稳定测试 测试正确 响应时间(平均) 输入令牌 输出令牌 推理令牌
Mercury 2 3.1 10.0 0.0% 0 535ms 694 251 0
GLM 4.7 Flash 2.9 7.2 11.1% 1 12.93s 521 781 5,255
工具调用 分数 一致性 尝试通过率 不稳定测试 测试正确 响应时间(平均) 输入令牌 输出令牌 推理令牌
Mercury 2 10.0 10.0 100.0% 0 1.27s 6,193 197 0
GLM 4.7 Flash 10.0 10.0 100.0% 0 15.95s 6,949 224 1,014
常识问答 分数 一致性 尝试通过率 不稳定测试 测试正确 响应时间(平均) 输入令牌 输出令牌 推理令牌
Mercury 2 3.0 10.0 0.0% 0 548ms 213 19 0
GLM 4.7 Flash 3.0 10.0 0.0% 0 11.13s 186 71 1,197

快速对比

切换对比组合