新模型
2026-09-10
Cognition 发布 SWE-2 编程模型:成本比 Claude Fable 5.1 低 64%
来源:HuggingNews
Cognition 发布 SWE-2 编程模型:成本比 Claude Fable 5.1 低 64%
一句话说清:做 AI 编程助手 Devin 的 Cognition 公司,9 月 10 日发布了新编程模型 SWE-2——跑分追平顶尖的 Claude Fable 5.1,但价格只要它的约三分之一,还支持"调节用力程度"省成本。
发生了什么
2026 年 9 月 10 日,Cognition 发布其迄今最强的编程模型 SWE-2(来源:HuggingNews / Cognition,2026-09-10)。
- 在编程基准 FrontierCode 1.1 Main 拿到 50.0%,与 Claude Fable 5.1(50.9%)基本持平,但成本比 Fable 5.1 低 64%;相比 GPT-6 Astra 则只用约四分之一的价格。
- 关键突破:首次把强化学习(RL)扩展到多万亿参数规模,并让模型在一次训练里同时学会"轻 / 中 / 重"多档用力程度(effort levels),用户可按任务调节,平衡成本与智能。
- 在中等力度下,SWE-2 比上一代 SWE-1.7 用的轮次少 58%、平均成本低 81%,还更快给出首个有效修改。
- 模型基于月之暗面 Kimi K3(2.8T 参数)做后训练,即日起在 Devin Desktop 和 CLI 可用,Devin Web / Fusion 陆续上线;Pro、Max、Teams 订阅用户有 1 个月免费试用。
对我有什么用
- 如果你用 Devin 或其他 AI 编程工具:意味着同样干完一个编程任务,账单可能明显变便宜,还能自己选"用多少力"来控制花费。
- 对整个行业:打工人用 AI 写代码的成本门槛在快速下降,小团队也能用上接近顶尖水平的编程智能体。
我可以怎么做
- 有 Devin 账号(Pro / Max / Teams):9 月 10 日起在 Devin Desktop 或命令行(CLI)里把模型切到 SWE-2。
- 新用户:去 Devin 官网注册,订阅 Pro/Max/Teams 可享 1 个月 SWE-2 免费试用。
- 想省钱:在任务设置里把 effort 调到 medium,看效果够用就别开 max。
- 关注 Benchmark:FrontierCode 1.1 Main 上 50.0% 的成绩可作为你选型时的参考。
温馨提醒
- SWE-2 目前没有公开独立 API 和模型权重,只在 Devin 产品内可用,无法本地部署或单独调用。
- 官方数字来自 Cognition 自评基准;独立第三方复现结果以官方公告为准,理性看待跑分。
- 它在超长程任务基准 Terminal-Bench 4.0 上(27.3%)与顶尖模型仍有明显差距,复杂长任务未必最优。
📤 一键转发小助手
帮你写好小红书文案、微信群推荐语,还配一张中文海报,复制就能发
💬 说说你的看法