OpenCode 模型能力排行
非 OpenCode 官方页面,仅为个人学习研究用途的第三方整理。
本页全部排名与点评
由 AI 自动生成,仅供参考,不构成任何购买或使用建议;模型能力、价格与额度以
Zen 官方文档 ·
Go 官方文档 为准。
数据来源:
zen/v1/models ·
zen/go/v1/models ·
Zen 文档 ·
Go 文档
,模型规格来自
models.dev,
基准成绩来自 vals.ai / Artificial Analysis / 各厂商模型卡。
数据版本:
2026-09-05(每次数据更新时由维护者手动填写;官方文档随时可能调整,请以官方页面为准) · 点击任意行展开「长处 / 短板 / 定位 / 推荐场景 / 备注」,点击顶部标签切换排序维度。
—OCGO 模型
—OCZen 模型
—免费模型
5核心基准维度
五项核心基准为什么选这 5 个
- SWE-bench Verified
- 500 个真实 GitHub issue,模型生成补丁后跑单元测试。编码 Agent 的头号指标,vals.ai 用统一的 mini-swe-agent(仅 bash 工具)复现,可比性最好。
- SWE-bench Pro
- 1865 个任务、41 个仓库、跨文件平均改动 107 行,且用 copyleft/专有代码抗污染。衡量「能不能干生产级重活」,与 Verified 拉开层次。
- Terminal-Bench 2.1
- 真实 Shell / 运维 / DevOps 任务,考察规划、迭代、工具协调与错误恢复 —— 这正是 OpenCode 这类终端 Agent 的日常。
- GPQA Diamond
- 博士级物理/化学/生物问答,衡量推理深度与知识密度(Artificial Analysis 榜单,覆盖 174 个模型)。
- HLE
- Humanity's Last Exam,极难跨学科知识考试,是目前最有区分度的推理基准 —— 前四项已接近饱和,HLE 仍能拉开差距。
评分方法
- 综合能力评分结合公开基准成绩与编辑评定得出;公开成绩越全,所占比重越大。
分数后的 3/5 标记表示该模型有几项公开成绩,展开详情可见构成说明。
- 可连续调用时长以「小时:分钟」显示(≈ 表示估算值)。Go 按官方额度折算,Zen 按月预算折算,免费档按保守估算;时长越长得分越高。
- 综合最推荐同时考虑能力与连续可用时长,能力占更大比重;存在数据收集风险的模型会适当下调。
- 价格按日常使用成本估算,仅 Zen 表提供价格排序(价格越低越靠前);Go 表按额度使用,详情中的价格仅供参考。
读表提醒
1. 不同基准的 harness、上下文上限、超时、评分程序并不统一,厂商自报值与第三方独立复现值混用,2–3 分之差通常小于口径误差,别把它当决定性依据。
2. SWE-bench Verified 已高度饱和(7 个模型 ≥95%),真正区分度在 SWE-bench Pro 与 HLE。OpenAI 内部审计发现约 30% 的 SWE-bench Pro 任务存在问题,该列需谨慎解读。
3. Terminal-Bench 2.1 与 3.0 差异极大(同一模型可从 88 掉到 28),引用时请带上版本号。
4. 标注「弃用」的模型仍可从 API 拉到,但官方已停止支持,不建议新项目使用。
5. 带有「数据收集」标记的模型可能会留存提示词与补全内容,或将其用于模型训练,请勿用于涉密或商业代码。该标记按官方「隐私」条款逐个模型核对(免费期间收集反馈的模型,以及用训练数据换取优惠的贡献者版本,均已标注)。
6. 免费范围以官网「定价 › 免费模型」清单为准。部分接口 id 带有 -free 后缀,但不在官网清单内(如 DeepSeek V4 Flash 在官网为按量付费),未列入本页免费排行。
7. 「综合额度」结合月请求数、$ 月额度、5 小时请求数、周请求数给出综合评分(0~100),不是只按 $ 档位排。单价越贵、同档 $ 能跑的次数越少,所以 $ 档高不等于额度充裕。额度未全部公开的型号不参与该项排序,排在末尾。
8. Go 与 Zen 计费方式不同:Go 按额度使用,表中没有价格排序与价格列;Zen 按量付费,表中有价格排序(价格越低越靠前),没有额度相关列;免费表两者都没有。「可连跑」列统一显示为「小时:分钟」。