导航
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

AI BENCHY 对比

Inception: Mercury 2 vs Owl Alpha

基准结果生成自 AI BENCHY 测试套件,时间:: 2026-06-03

指标 Mercury 2 Mercury 2 none 发布日期: 2026-02-24 Owl Alpha Owl Alpha medium 发布日期: 2026-04-30
分数 4.6 5.8
排名 #153 #107
可靠性 10.0 10.0
一致性 9.1 9.6
测试正确
尝试通过率 25.0% 41.7%
不稳定测试 2 1
总运行次数 60 60
每个结果成本 0.216 0.000
总成本 $0.009 $0.000
输入价格 $0.250 / 1M $0.000 / 1M
输出价格 $0.750 / 1M $0.000 / 1M
总输入令牌 25,515 40,601
输出令牌 3,001 2,965
推理令牌 0 0
响应时间(平均) 614ms 11.64s
响应时间(最大) 1.27s 58.63s
响应时间(总计) 12.28s 232.83s

按分数排名的模型

分数 vs 总成本

响应时间(平均)

分数 vs 响应时间(平均)

总输出令牌

分数 vs 总输出令牌

类别细分

反AI技巧 分数 一致性 尝试通过率 不稳定测试 测试正确 响应时间(平均) 输入令牌 输出令牌 推理令牌
Mercury 2 3.0 10.0 0.0% 0 483ms 631 286 0
Owl Alpha 4.8 10.0 25.0% 0 3.97s 1,596 87 0
编程 分数 一致性 尝试通过率 不稳定测试 测试正确 响应时间(平均) 输入令牌 输出令牌 推理令牌
Mercury 2 3.5 9.4 0.0% 0 831ms 4,631 1,650 0
Owl Alpha 6.6 10.0 50.0% 0 19.08s 3,872 1,754 0
综合 分数 一致性 尝试通过率 不稳定测试 测试正确 响应时间(平均) 输入令牌 输出令牌 推理令牌
Mercury 2 3.0 10.0 0.0% 0 606ms 4,821 131 0
Owl Alpha 3.0 10.0 0.0% 0 10.01s 14,259 315 0
数据解析与提取 分数 一致性 尝试通过率 不稳定测试 测试正确 响应时间(平均) 输入令牌 输出令牌 推理令牌
Mercury 2 7.3 5.9 83.3% 1 667ms 6,362 180 0
Owl Alpha 10.0 10.0 100.0% 0 21.64s 8,157 246 0
领域专项 分数 一致性 尝试通过率 不稳定测试 测试正确 响应时间(平均) 输入令牌 输出令牌 推理令牌
Mercury 2 5.3 7.2 44.4% 1 534ms 784 46 0
Owl Alpha 5.3 10.0 33.3% 0 8.58s 1,458 28 0
通用智能 分数 一致性 尝试通过率 不稳定测试 测试正确 响应时间(平均) 输入令牌 输出令牌 推理令牌
Mercury 2 4.8 10.0 0.0% 0 628ms 495 159 0
Owl Alpha 4.3 10.0 0.0% 0 58.63s 732 98 0
指令遵循 分数 一致性 尝试通过率 不稳定测试 测试正确 响应时间(平均) 输入令牌 输出令牌 推理令牌
Mercury 2 6.5 10.0 50.0% 0 551ms 691 82 0
Owl Alpha 6.5 10.0 50.0% 0 10.15s 1,161 57 0
谜题求解 分数 一致性 尝试通过率 不稳定测试 测试正确 响应时间(平均) 输入令牌 输出令牌 推理令牌
Mercury 2 3.1 10.0 0.0% 0 535ms 694 251 0
Owl Alpha 5.3 7.2 44.4% 1 3.40s 1,392 135 0
工具调用 分数 一致性 尝试通过率 不稳定测试 测试正确 响应时间(平均) 输入令牌 输出令牌 推理令牌
Mercury 2 10.0 10.0 100.0% 0 1.27s 6,193 197 0
Owl Alpha 10.0 10.0 100.0% 0 8.26s 7,524 228 0
常识问答 分数 一致性 尝试通过率 不稳定测试 测试正确 响应时间(平均) 输入令牌 输出令牌 推理令牌
Mercury 2 3.0 10.0 0.0% 0 548ms 213 19 0
Owl Alpha 3.0 10.0 0.0% 0 2.38s 450 17 0

快速对比

切换对比组合