中金公司研究部在2026年9月23日发布的《AI应用参考(2):从WorkBuddy看生产力Agent发展》中提出,生产力Agent的评价标准不是单一模型能力,而是模型、上下文与Harness(工程框架)的综合结果,并将此称为「三维竞争」。这一判断属于来源方推论,与腾讯WorkBuddy Bench等公开评测事实需要分开看待:前者是对竞争格局的解释框架,后者是特定条件下的测量结果。

「三维竞争」说的是什么

来源方认为,AI发展经历「先泛化(Chatbot)—再聚焦(编程Agent)—然后又泛化(生产力Agent)」的阶段。在这一框架下,来源方主张生产力Agent的竞争力由模型、上下文与Harness三者协同决定,即便竞争对手模型能力领先,在上下文与工程循环上也未必占优,三者协同可能带来相对更好的综合体验。来源方据此认为,这是模型能力处于追赶位置的厂商的结构性机会,并称腾讯不以模型智能上限提升为唯一目标,反而可能在考验综合能力的Agent产品侧具备机遇。

需要区分的是,这是来源方对竞争格局的判断,不是已被独立核验的结论。来源方同时提示,混元当前仍处于追赶阶段,WorkBuddy的相对优势主要来自上下文与循环对模型短板的补位;若混元能力提升持续慢于主要竞争对手,可能拖累综合体验、任务完成率及数据飞轮效率。

Bench测出了什么

据腾讯WorkBuddy Bench(2026年7月),固定底模和任务后,CodeBuddy与Claude Code的框架表现相近。该Bench的测量方法为:只替换Harness,固定底模和任务,比较在CodeBuddy和Claude两套Harness下的任务完成表现,同时统一上下文长度、推理强度及关键工具配置;Code、Web、Office、Security是四类真实任务,每个任务独立运行3次并取均值。

来源方据此认为,工程能力可在一定程度上补齐模型差距。这一结论的边界在于:它测量的是特定底模、特定任务与统一配置下的Harness差异,不能直接外推为产品整体体验或商业表现的对比。

支撑判断的其他事实

  • 产品沿革:WorkBuddy复用CodeBuddy三年积累的上下文工程、任务循环、MCP、Skills及沙箱能力;2026年1月转向非技术用户的办公场景,2026年3月公测;2026年7月升格为腾讯云独立部门。
  • 运营数据(来源:易观分析,经中金公司研究部引用):2026年6月,WorkBuddy PC端月访问量达2,097万次,超过第二名字节TRAE IDE(1,279万次)与第三名阿里QoderWork(788万次)之和。
  • 定价:企业版SaaS与专有云定价分别为198元、316元/人/月。
  • 空间测算属情景假设:来源方给出最窄、横向、纵向三种口径,并强调结果取决于WorkBuddy未来定位,非确定事实。

来源方还提示了产品竞争加剧、商业化兑现、模型能力追赶、数据安全与合规四类不确定性,并称WorkBuddy的社交生态与工程数据飞轮仍处于壁垒建立初期。

常见问题

「三维竞争」是已证实的事实吗?

不是。它是中金公司研究部提出的解释框架,用于说明生产力Agent的评价维度,属于来源方判断。可与之对照的公开事实是腾讯WorkBuddy Bench的测量结果,但该Bench本身也有明确的测量条件限制。

Bench结果能说明CodeBuddy框架已追平Claude Code吗?

来源方的表述是「框架表现相近」,且限定在固定底模和任务、统一上下文长度与推理强度及关键工具配置的条件下。这不等同于产品整体能力或商业结果的对比,来源材料未提供该Bench之外的外推验证。

来源方对市场空间的测算是确定预期吗?

不是。来源方明确将其列为情景假设,并强调取决于WorkBuddy未来定位。最窄口径对应年收入空间约几百亿元,横向口径称即使取得个位数分发份额也可能对应百亿至千亿元级空间,纵向口径指向万亿元级云市场,均为条件性推演。