OpenCode 模型能力排行

非 OpenCode 官方页面,仅为个人学习研究用途的第三方整理。
本页全部排名与点评由 AI 自动生成,仅供参考,不构成任何购买或使用建议;模型能力、价格与额度以 Zen 官方文档 · Go 官方文档 为准。
数据来源: zen/v1/models · zen/go/v1/models · Zen 文档 · Go 文档 ,模型规格来自 models.dev, 基准成绩来自 vals.ai / Artificial Analysis / 各厂商模型卡。
数据版本:2026-09-05(每次数据更新时由维护者手动填写;官方文档随时可能调整,请以官方页面为准) · 点击任意行展开「长处 / 短板 / 定位 / 推荐场景 / 备注」,点击顶部标签切换排序维度。
OCGO 模型
OCZen 模型
免费模型
5核心基准维度
Go 为订阅制,按额度使用。「可连跑」是连续使用时长的估算(小时:分钟);「综合额度」是多个额度维度的综合评分,具体说明见下方
Zen 按量付费;价格越低排名越靠前
免费模型以官网「定价 › 免费模型」清单为准(当前 7 个,见下方免费表)。各模型的数据政策以官方「隐私」条款为准,详情见备注。

五项核心基准为什么选这 5 个

SWE-bench Verified
500 个真实 GitHub issue,模型生成补丁后跑单元测试。编码 Agent 的头号指标,vals.ai 用统一的 mini-swe-agent(仅 bash 工具)复现,可比性最好。
SWE-bench Pro
1865 个任务、41 个仓库、跨文件平均改动 107 行,且用 copyleft/专有代码抗污染。衡量「能不能干生产级重活」,与 Verified 拉开层次。
Terminal-Bench 2.1
真实 Shell / 运维 / DevOps 任务,考察规划、迭代、工具协调与错误恢复 —— 这正是 OpenCode 这类终端 Agent 的日常。
GPQA Diamond
博士级物理/化学/生物问答,衡量推理深度与知识密度(Artificial Analysis 榜单,覆盖 174 个模型)。
HLE
Humanity's Last Exam,极难跨学科知识考试,是目前最有区分度的推理基准 —— 前四项已接近饱和,HLE 仍能拉开差距。

评分方法

读表提醒
1. 不同基准的 harness、上下文上限、超时、评分程序并不统一,厂商自报值与第三方独立复现值混用,2–3 分之差通常小于口径误差,别把它当决定性依据。
2. SWE-bench Verified 已高度饱和(7 个模型 ≥95%),真正区分度在 SWE-bench Pro 与 HLE。OpenAI 内部审计发现约 30% 的 SWE-bench Pro 任务存在问题,该列需谨慎解读。
3. Terminal-Bench 2.1 与 3.0 差异极大(同一模型可从 88 掉到 28),引用时请带上版本号
4. 标注「弃用」的模型仍可从 API 拉到,但官方已停止支持,不建议新项目使用。
5. 带有「数据收集」标记的模型可能会留存提示词与补全内容,或将其用于模型训练,请勿用于涉密或商业代码。该标记按官方「隐私」条款逐个模型核对(免费期间收集反馈的模型,以及用训练数据换取优惠的贡献者版本,均已标注)。
6. 免费范围以官网「定价 › 免费模型」清单为准。部分接口 id 带有 -free 后缀,但不在官网清单内(如 DeepSeek V4 Flash 在官网为按量付费),未列入本页免费排行。
7. 「综合额度」结合月请求数、$ 月额度、5 小时请求数、周请求数给出综合评分(0~100),不是只按 $ 档位排。单价越贵、同档 $ 能跑的次数越少,所以 $ 档高不等于额度充裕。额度未全部公开的型号不参与该项排序,排在末尾。
8. Go 与 Zen 计费方式不同:Go 按额度使用,表中没有价格排序与价格列;Zen 按量付费,表中有价格排序(价格越低越靠前),没有额度相关列;免费表两者都没有。「可连跑」列统一显示为「小时:分钟」。