AI Benchy 排行榜

Name: AI BENCHY 模型基准结果
Creator: AI BENCHY
License: https://aibenchy.com/methodology/

基准结果生成自 AI BENCHY 测试套件，时间：: 2026-07-20 已评估模型: 210

210/210

排名	模型	分数	公司	总成本	响应时间（平均）
#112#112	Claude Sonnet 5none	6.3	Anthropic	$0.548	6.04s
查看模型卡片总测试数 22 错误测试数 14 可靠性 10.0 尝试通过率 45.5% 不稳定测试 4 输入令牌 161,035 输出令牌 22,511 推理令牌 0 响应时间（平均） 6.04s 响应时间（总计） 132.85s 响应时间（最大） 33.39s 答案错误: 7 额外格式: 4 无答案: 2 未遵循指令: 1 反AI技巧 : 5.3 编程 : 4.6 综合 : 6.5 数据解析与提取 : 10.0 领域专项 : 5.3 通用智能 : 4.7 指令遵循 : 6.4 谜题求解 : 6.0 工具调用 : 10.0 常识问答 : 3.0
#116#116	Seed-2.0-Litenone	6.2	Bytedance Seed	$0.066	4.40s
查看模型卡片总测试数 22 错误测试数 14 可靠性 10.0 尝试通过率 43.9% 不稳定测试 4 输入令牌 142,197 输出令牌 14,746 推理令牌 0 响应时间（平均） 4.40s 响应时间（总计） 96.84s 响应时间（最大） 44.58s 答案错误: 13 无答案: 1 反AI技巧 : 3.0 编程 : 5.6 综合 : 3.0 数据解析与提取 : 10.0 领域专项 : 3.6 通用智能 : 10.0 指令遵循 : 10.0 谜题求解 : 5.3 工具调用 : 10.0 常识问答 : 3.0
#125#125	Qwen3.5-Flashnone	6.1	Qwen	$0.073 ↓	25.28s
查看模型卡片总测试数 22 错误测试数 14 可靠性 10.0 尝试通过率 39.4% 不稳定测试 2 输入令牌 282,347 输出令牌 209,201 推理令牌 0 响应时间（平均） 25.28s 响应时间（总计） 556.24s 响应时间（最大） 480.96s 答案错误: 13 无效工具调用: 1 反AI技巧 : 3.5 编程 : 5.5 综合 : 2.9 数据解析与提取 : 10.0 领域专项 : 7.7 通用智能 : 10.0 指令遵循 : 6.3 谜题求解 : 3.1 工具调用 : 10.0 常识问答 : 3.0
#126#126	Qwen3.5 Plus 2026-04-20none	6.1	Qwen	$0.122 ↓	13.56s
查看模型卡片总测试数 22 错误测试数 14 可靠性 10.0 尝试通过率 43.9% 不稳定测试 4 输入令牌 94,468 输出令牌 51,487 推理令牌 0 响应时间（平均） 13.56s 响应时间（总计） 298.31s 响应时间（最大） 206.05s 答案错误: 12 未遵循指令: 2 反AI技巧 : 4.8 编程 : 3.9 综合 : 6.4 数据解析与提取 : 10.0 领域专项 : 5.3 通用智能 : 4.8 指令遵循 : 6.2 谜题求解 : 6.7 工具调用 : 10.0 常识问答 : 3.0
#129#129	Nemotron 3 Ultranone	6.1	NVIDIA	$0.095 ↕	3.87s
查看模型卡片总测试数 22 错误测试数 14 可靠性 10.0 尝试通过率 42.4% 不稳定测试 2 输入令牌 101,275 输出令牌 9,474 推理令牌 0 响应时间（平均） 3.87s 响应时间（总计） 85.15s 响应时间（最大） 37.50s 答案错误: 12 API 错误: 1 未遵循指令: 1 反AI技巧 : 3.5 编程 : 5.5 综合 : 3.0 数据解析与提取 : 10.0 领域专项 : 5.3 通用智能 : 5.0 指令遵循 : 10.0 谜题求解 : 5.9 工具调用 : 10.0 常识问答 : 3.0
#132#132	GPT-5.6 Terranone	6.0	OpenAI	$0.349	1.65s
查看模型卡片总测试数 22 错误测试数 14 可靠性 10.0 尝试通过率 42.4% 不稳定测试 3 输入令牌 102,259 输出令牌 6,203 推理令牌 0 响应时间（平均） 1.65s 响应时间（总计） 36.28s 响应时间（最大） 10.07s 答案错误: 11 未遵循指令: 1 无效工具调用: 1 无答案: 1 反AI技巧 : 4.8 编程 : 5.5 综合 : 2.9 数据解析与提取 : 10.0 领域专项 : 5.3 通用智能 : 5.0 指令遵循 : 8.5 谜题求解 : 5.3 工具调用 : 9.6 常识问答 : 3.0
#140#140	Nemotron 3 Supermedium	5.7	NVIDIA	$0.050 ↑	51.99s
查看模型卡片总测试数 22 错误测试数 14 可靠性 8.7 尝试通过率 40.9% 不稳定测试 3 输入令牌 81,429 输出令牌 18,371 推理令牌 98,853 响应时间（平均） 51.99s 响应时间（总计） 1039.89s 响应时间（最大） 431.98s 答案错误: 5 API 错误: 4 未遵循指令: 3 无答案: 1 超时: 1 反AI技巧 : 8.3 编程 : 3.1 综合 : 6.4 数据解析与提取 : 10.0 领域专项 : 2.9 通用智能 : 4.1 指令遵循 : 7.3 谜题求解 : 3.0 工具调用 : 10.0 常识问答 : 3.0
#149#149	KAT-Coder-Air V2.5medium	5.6	Kwaipilot	$0.048	8.42s
查看模型卡片总测试数 22 错误测试数 14 可靠性 9.9 尝试通过率 45.5% 不稳定测试 3 输入令牌 51,472 输出令牌 7,822 推理令牌 58,352 响应时间（平均） 8.42s 响应时间（总计） 185.24s 响应时间（最大） 48.19s 答案错误: 11 API 错误: 1 额外格式: 1 未遵循指令: 1 反AI技巧 : 8.7 编程 : 3.6 综合 : 6.5 数据解析与提取 : 6.5 领域专项 : 3.0 通用智能 : 5.0 指令遵循 : 10.0 谜题求解 : 3.6 工具调用 : 10.0 常识问答 : 3.0
#156#156	Gemma 4 26B A4Bnone	5.5	Google	$0.015 ↓	7.64s
查看模型卡片总测试数 22 错误测试数 14 可靠性 10.0 尝试通过率 42.4% 不稳定测试 2 输入令牌 131,282 输出令牌 15,781 推理令牌 0 响应时间（平均） 7.64s 响应时间（总计） 167.98s 响应时间（最大） 57.10s 答案错误: 10 未遵循指令: 2 无效工具调用: 1 超时: 1 反AI技巧 : 8.3 编程 : 3.7 综合 : 3.0 数据解析与提取 : 10.0 领域专项 : 3.6 通用智能 : 4.0 指令遵循 : 6.3 谜题求解 : 6.2 工具调用 : 10.0 常识问答 : 3.0
#202#202	Grok Build 0.1none	4.0	X AI	$0.547	28.69s
查看模型卡片总测试数 19 错误测试数 12 可靠性 10.0 尝试通过率 43.9% 不稳定测试 4 输入令牌 11,793 输出令牌 267,275 推理令牌 0 响应时间（平均） 28.69s 响应时间（总计） 459.00s 响应时间（最大） 138.35s 答案错误: 7 API 错误: 3 未遵循指令: 2 反AI技巧 : 8.7 编程 : 3.3 综合 : 1.5 数据解析与提取 : 3.8 领域专项 : 3.6 通用智能 : 4.3 指令遵循 : 9.8 谜题求解 : 6.4 工具调用 : 3.0 常识问答 : 3.0
#145#145	GLM 5V Turbonone	5.6	Z.ai	$0.052	2.99s
查看模型卡片总测试数 21 错误测试数 13 可靠性 10.0 尝试通过率 36.4% 不稳定测试 0 输入令牌 37,100 输出令牌 1,766 推理令牌 0 响应时间（平均） 2.99s 响应时间（总计） 62.74s 响应时间（最大） 6.51s 答案错误: 11 未遵循指令: 2 反AI技巧 : 4.8 编程 : 5.5 综合 : 1.5 数据解析与提取 : 10.0 领域专项 : 5.3 通用智能 : 4.6 指令遵循 : 6.5 谜题求解 : 5.3 工具调用 : 10.0 常识问答 : 3.0
#146#146	Owl Alphamedium	5.6	Openrouter	$0.000	11.95s
查看模型卡片总测试数 21 错误测试数 13 可靠性 10.0 尝试通过率 37.9% 不稳定测试 1 输入令牌 43,478 输出令牌 2,974 推理令牌 0 响应时间（平均） 11.95s 响应时间（总计） 250.88s 响应时间（最大） 58.63s 答案错误: 10 未遵循指令: 2 API 错误: 1 反AI技巧 : 4.8 编程 : 5.4 综合 : 1.5 数据解析与提取 : 10.0 领域专项 : 5.3 通用智能 : 4.3 指令遵循 : 6.5 谜题求解 : 5.3 工具调用 : 10.0 常识问答 : 3.0
#157#157	Mimo V2 Omninone	5.5	Xiaomi	$0.021 ↓	2.44s
查看模型卡片总测试数 21 错误测试数 13 可靠性 10.0 尝试通过率 37.9% 不稳定测试 1 输入令牌 40,852 输出令牌 3,314 推理令牌 0 响应时间（平均） 2.44s 响应时间（总计） 48.81s 响应时间（最大） 6.81s 答案错误: 10 API 错误: 1 额外格式: 1 未遵循指令: 1 反AI技巧 : 3.6 编程 : 4.4 综合 : 1.5 数据解析与提取 : 10.0 领域专项 : 5.3 通用智能 : 4.1 指令遵循 : 6.5 谜题求解 : 10.0 工具调用 : 10.0 常识问答 : 3.0
#97#97	LongCat 2.0high	6.6	Meituan	$0.469	148.73s
查看模型卡片总测试数 22 错误测试数 13 可靠性 9.4 尝试通过率 53.0% 不稳定测试 5 输入令牌 93,357 输出令牌 30,466 推理令牌 336,325 响应时间（平均） 148.73s 响应时间（总计） 3272.00s 响应时间（最大） 941.66s 答案错误: 6 超时: 3 未遵循指令: 2 无答案: 2 反AI技巧 : 8.9 编程 : 7.6 综合 : 10.0 数据解析与提取 : 3.6 领域专项 : 3.6 通用智能 : 5.1 指令遵循 : 6.5 谜题求解 : 3.1 工具调用 : 10.0 常识问答 : 3.0
#102#102	Laguna XS 2.1medium	6.5	Poolside	$0.068	47.93s
查看模型卡片总测试数 22 错误测试数 13 可靠性 10.0 尝试通过率 42.4% 不稳定测试 1 输入令牌 118,989 输出令牌 30,750 推理令牌 491,833 响应时间（平均） 47.93s 响应时间（总计） 1054.49s 响应时间（最大） 422.72s 答案错误: 11 无效工具调用: 1 无答案: 1 反AI技巧 : 4.8 编程 : 5.5 综合 : 6.3 数据解析与提取 : 10.0 领域专项 : 2.9 通用智能 : 5.0 指令遵循 : 9.8 谜题求解 : 5.3 工具调用 : 10.0 常识问答 : 3.0
#118#118	Gemini 2.5 Flashnone	6.2	Google	$0.017	6.20s
查看模型卡片总测试数 22 错误测试数 13 可靠性 10.0 尝试通过率 43.9% 不稳定测试 1 输入令牌 39,877 输出令牌 1,890 推理令牌 0 响应时间（平均） 6.20s 响应时间（总计） 136.37s 响应时间（最大） 118.00s 答案错误: 12 无效工具调用: 1 反AI技巧 : 3.0 编程 : 5.5 综合 : 3.0 数据解析与提取 : 10.0 领域专项 : 5.9 通用智能 : 5.0 指令遵循 : 10.0 谜题求解 : 7.7 工具调用 : 10.0 常识问答 : 3.0
#121#121	gpt-oss-120bmedium	6.1	OpenAI	$0.019 ↓	21.91s
查看模型卡片总测试数 22 错误测试数 13 可靠性 10.0 尝试通过率 50.0% 不稳定测试 5 输入令牌 108,747 输出令牌 29,772 推理令牌 68,044 响应时间（平均） 21.91s 响应时间（总计） 328.70s 响应时间（最大） 68.16s 答案错误: 9 未遵循指令: 3 无效工具调用: 1 反AI技巧 : 6.7 编程 : 5.9 综合 : 6.5 数据解析与提取 : 6.4 领域专项 : 2.9 通用智能 : 4.3 指令遵循 : 9.9 谜题求解 : 5.3 工具调用 : 9.8 常识问答 : 3.0
#122#122	Gemini 3.1 Flash Litenone	6.1	Google	$0.046	1.75s
查看模型卡片总测试数 22 错误测试数 13 可靠性 10.0 尝试通过率 50.0% 不稳定测试 4 输入令牌 118,050 输出令牌 10,723 推理令牌 0 响应时间（平均） 1.75s 响应时间（总计） 38.60s 响应时间（最大） 16.25s 答案错误: 11 未遵循指令: 1 无答案: 1 反AI技巧 : 7.5 编程 : 5.5 综合 : 3.0 数据解析与提取 : 10.0 领域专项 : 2.9 通用智能 : 4.0 指令遵循 : 10.0 谜题求解 : 6.3 工具调用 : 10.0 常识问答 : 3.0
#128#128	GPT-5 Nanomedium	6.1	OpenAI	$0.114	54.87s
查看模型卡片总测试数 22 错误测试数 13 可靠性 10.0 尝试通过率 56.1% 不稳定测试 8 输入令牌 94,935 输出令牌 12,042 推理令牌 261,056 响应时间（平均） 54.87s 响应时间（总计） 822.99s 响应时间（最大） 227.89s 答案错误: 9 未遵循指令: 2 无答案: 1 超时: 1 反AI技巧 : 6.5 编程 : 7.0 综合 : 6.4 数据解析与提取 : 3.7 领域专项 : 5.2 通用智能 : 4.1 指令遵循 : 9.8 谜题求解 : 5.3 工具调用 : 10.0 常识问答 : 3.0
#137#137	North Mini Codemedium	5.9	Cohere	$0.000	137.11s
查看模型卡片总测试数 22 错误测试数 13 可靠性 8.6 尝试通过率 48.5% 不稳定测试 4 输入令牌 81,813 输出令牌 424,772 推理令牌 1,342,029 响应时间（平均） 137.11s 响应时间（总计） 3016.42s 响应时间（最大） 786.72s 答案错误: 9 额外格式: 2 API 错误: 1 无效工具调用: 1 反AI技巧 : 8.4 编程 : 4.5 综合 : 2.9 数据解析与提取 : 10.0 领域专项 : 5.3 通用智能 : 5.1 指令遵循 : 9.8 谜题求解 : 3.3 工具调用 : 10.0 常识问答 : 3.0
#179#179	Ring-2.6-1Tnone	4.8	Inclusionai	$0.026 ↕	55.10s
查看模型卡片总测试数 22 错误测试数 13 可靠性 10.0 尝试通过率 45.5% 不稳定测试 2 输入令牌 7,599 输出令牌 39,954 推理令牌 0 响应时间（平均） 55.10s 响应时间（总计） 881.55s 响应时间（最大） 143.82s API 错误: 6 答案错误: 5 未遵循指令: 2 反AI技巧 : 9.2 编程 : 5.3 综合 : 3.0 数据解析与提取 : 3.0 领域专项 : 5.3 通用智能 : 4.3 指令遵循 : 9.8 谜题求解 : 7.7 工具调用 : 3.0 常识问答 : 3.0
#141#141	GLM 5none	5.7	Z.ai	$0.041 ↑	4.03s
查看模型卡片总测试数 21 错误测试数 12 可靠性 10.0 尝试通过率 42.4% 不稳定测试 1 输入令牌 37,135 输出令牌 1,989 推理令牌 0 响应时间（平均） 4.03s 响应时间（总计） 56.37s 响应时间（最大） 11.07s 答案错误: 12 反AI技巧 : 4.8 编程 : 4.0 综合 : 1.5 数据解析与提取 : 10.0 领域专项 : 3.0 通用智能 : 10.0 指令遵循 : 10.0 谜题求解 : 7.7 工具调用 : 10.0 常识问答 : 3.0
#181#181	Grok 4.20 Multi Agent Betamedium	4.8	X AI	$5.599 ↑	9.69s
查看模型卡片总测试数 18 错误测试数 10 可靠性不适用尝试通过率 48.5% 不稳定测试 5 输入令牌 721,952 输出令牌 294,668 推理令牌 305,374 响应时间（平均） 9.69s 响应时间（总计） 155.07s 响应时间（最大） 35.28s 答案错误: 4 API 错误: 2 额外格式: 2 未遵循指令: 2 反AI技巧 : 6.9 编程 : 3.3 综合 : 1.5 数据解析与提取 : 10.0 领域专项 : 2.9 通用智能 : 5.8 指令遵循 : 9.8 谜题求解 : 6.7 工具调用 : 3.0 常识问答 : 0.0
#184#184	Hunter Alphamedium	4.7	OpenRouter	$0.000	10.33s
查看模型卡片总测试数 18 错误测试数 10 可靠性不适用尝试通过率 53.0% 不稳定测试 6 输入令牌 28,927 输出令牌 4,682 推理令牌 17,969 响应时间（平均） 10.33s 响应时间（总计） 175.58s 响应时间（最大） 30.53s 答案错误: 4 未遵循指令: 2 超时: 2 API 错误: 1 额外格式: 1 反AI技巧 : 7.3 编程 : 9.8 综合 : 2.3 数据解析与提取 : 10.0 领域专项 : 3.0 通用智能 : 7.0 指令遵循 : 9.9 谜题求解 : 6.1 工具调用 : 10.0 常识问答 : 0.0
#46#46	DeepSeek V4 Prohigh	7.7	DeepSeek	$0.200	79.14s
查看模型卡片总测试数 22 错误测试数 12 可靠性 10.0 尝试通过率 63.6% 不稳定测试 6 输入令牌 90,748 输出令牌 10,462 推理令牌 178,719 响应时间（平均） 79.14s 响应时间（总计） 1740.97s 响应时间（最大） 416.76s 答案错误: 6 未遵循指令: 2 API 错误: 1 额外格式: 1 无答案: 1 超时: 1 反AI技巧 : 5.7 编程 : 6.3 综合 : 10.0 数据解析与提取 : 10.0 领域专项 : 3.6 通用智能 : 10.0 指令遵循 : 7.8 谜题求解 : 6.9 工具调用 : 9.8 常识问答 : 3.0
#77#77	Kimi K2.5medium	7.0	Moonshot AI	$0.600 ↑	99.00s
查看模型卡片总测试数 22 错误测试数 12 可靠性 10.0 尝试通过率 65.2% 不稳定测试 8 输入令牌 118,448 输出令牌 62,124 推理令牌 165,243 响应时间（平均） 99.00s 响应时间（总计） 1485.04s 响应时间（最大） 281.00s 答案错误: 5 未遵循指令: 2 无答案: 2 超时: 2 无效工具调用: 1 反AI技巧 : 7.3 编程 : 6.1 综合 : 6.7 数据解析与提取 : 10.0 领域专项 : 3.5 通用智能 : 6.5 指令遵循 : 10.0 谜题求解 : 5.3 工具调用 : 10.0 常识问答 : 3.0
#78#78	Mercury 2medium	7.0	Inception	$0.093	2.72s
查看模型卡片总测试数 22 错误测试数 12 可靠性 10.0 尝试通过率 51.5% 不稳定测试 3 输入令牌 109,572 输出令牌 10,313 推理令牌 76,806 响应时间（平均） 2.72s 响应时间（总计） 57.12s 响应时间（最大） 14.63s 答案错误: 8 未遵循指令: 3 无效工具调用: 1 反AI技巧 : 6.9 编程 : 8.2 综合 : 6.7 数据解析与提取 : 7.3 领域专项 : 2.9 通用智能 : 4.8 指令遵循 : 10.0 谜题求解 : 5.4 工具调用 : 10.0 常识问答 : 3.0
#82#82	DeepSeek V4 Pronone	6.9	DeepSeek	$0.096	11.55s
查看模型卡片总测试数 22 错误测试数 12 可靠性 10.0 尝试通过率 51.5% 不稳定测试 4 输入令牌 148,069 输出令牌 35,551 推理令牌 0 响应时间（平均） 11.55s 响应时间（总计） 254.11s 响应时间（最大） 119.44s 答案错误: 8 未遵循指令: 2 额外格式: 1 无效工具调用: 1 反AI技巧 : 3.2 编程 : 5.6 综合 : 7.9 数据解析与提取 : 10.0 领域专项 : 5.3 通用智能 : 5.0 指令遵循 : 6.3 谜题求解 : 10.0 工具调用 : 10.0 常识问答 : 3.0
#91#91	LongCat 2.0low	6.7	Meituan	$0.391	100.31s
查看模型卡片总测试数 22 错误测试数 12 可靠性 9.6 尝试通过率 53.0% 不稳定测试 3 输入令牌 90,909 输出令牌 5,679 推理令牌 297,369 响应时间（平均） 100.31s 响应时间（总计） 2206.82s 响应时间（最大） 560.39s 答案错误: 8 API 错误: 1 未遵循指令: 1 无答案: 1 超时: 1 反AI技巧 : 10.0 编程 : 6.6 综合 : 10.0 数据解析与提取 : 6.3 领域专项 : 3.0 通用智能 : 3.4 指令遵循 : 6.5 谜题求解 : 3.1 工具调用 : 10.0 常识问答 : 3.0
#99#99	Qwen3.6 27Bmedium	6.5	Qwen	$0.779 ↑	106.32s
查看模型卡片总测试数 22 错误测试数 12 可靠性 10.0 尝试通过率 59.1% 不稳定测试 6 输入令牌 106,167 输出令牌 32,889 推理令牌 241,303 响应时间（平均） 106.32s 响应时间（总计） 2339.12s 响应时间（最大） 1085.11s 答案错误: 6 无答案: 3 无效工具调用: 2 未遵循指令: 1 反AI技巧 : 8.3 编程 : 7.7 综合 : 6.7 数据解析与提取 : 3.5 领域专项 : 2.9 通用智能 : 6.5 指令遵循 : 10.0 谜题求解 : 7.7 工具调用 : 10.0 常识问答 : 3.0

←

1 2 3 4 5 6 7

→

快速对比

AI Benchy 排行榜

筛选模型

快速对比