新模型 2026-09-15

云知声发布 U2-Flash:2660 亿参数国产大模型,Token 消耗省掉两三成

云知声发布 U2-Flash:2660 亿参数国产大模型,Token 消耗省掉两三成

发生了什么

9 月 15 日,港股上市公司云知声(09678.HK)发布新一代高性能主力模型 U2-Flash。根据公司公告与官方介绍,它的核心特点有:

  • 架构省、跑得快:采用稀疏混合专家(MoE)架构,总参数约 2660 亿,但单次推理只激活约 100 亿参数(激活比例不到 4%),用更小的算力撬动主力级能力。
  • 基准亮眼:在编程榜 DeepSWE v1.1 拿到 64.6 分(超过 GLM5.3-Flash、DeepSeek-V4-Pro 等),TerminalBench 3.0 达 24.3 分,SWE-Bench Pro 达 61.6 分。
  • 更省钱:Agent 任务迭代步数减少 20%–30%,任务执行周期缩短 35%,Token 消耗降低 20%–30%,首字响应控制在 3 秒内。
  • 国产适配:已完成对主流国产算力平台的系统性适配,并引入“模型参与自身训练”的递归自我改进(RSI)思路。

对我有什么用

大模型竞争正在从“拼参数、拼跑分”转向“拼落地成本”。U2-Flash 这类模型的意义不在于又大了多少,而在于用很少的激活参数干主力级的活——这意味着以后调用 AI 更便宜、响应更快,对做智能体、自动化办公、行业应用的中小团队是实打实的降本。国产模型在推理效率上的持续突破,也在推动 AI 应用真正“用得起、跑得动”。

我可以怎么做

  • 关注“便宜好用”的国产模型:如果你或你公司要用 AI 做客服、写文案、跑自动化流程,可以留意这类高性价比国产模型,成本往往比顶级闭源模型低一大截。
  • 看“Token 消耗”这项指标:选模型别只看谁聪明,也要看用一次花多少钱(Token 费)。对用量大的场景,省 20%–30% 是很可观的。
  • 优先选已适配国产算力的:这样服务更稳定、不易被外部供应链卡脖子,长期用更省心。

温馨提醒

  • U2-Flash 目前主要面向企业与开发者开放,普通用户想直接体验需等云知声或其合作平台的接入,别轻信“内部体验链接”类推广。
  • 任何模型的具体表现都要以你自己的实际任务为准,基准分数高不等于所有场景都强。
  • 用 AI 处理业务数据时,注意确认服务商的隐私与数据合规条款。
📤 一键转发小助手 帮你写好小红书文案、微信群推荐语,还配一张中文海报,复制就能发