获悉,作者|Cynthia 科技新闻。
相似的变化也发生在老对手 OpenAI 上。在 OpenAI,一部分用户在 ChatGPT 里处理编程问题,另一部分用户则在 Codex 中完成报告、图片和数据处理等非编程任务。聊天、编程和办公之间原本清晰的产品边界, 开端被用户主动打破。于是,7 月下旬,OpenAI 将独立运行近一年的 Codex 并入 ChatGPT 桌面客户端内,至此 Chat、Work、Codex 三端合一。
模型和 Agent,成为智能飞轮
办公背景与起因
读懂它,就读懂了企业级 Agent 真正的赛点。
企业面对的是另一类难题。
当然,客观来说,千问办公这次整合完成,并不意味着阿里关于 Agent 的探索从此就可以高枕无忧了。但它至少说明,阿里已经找到了自己的主线。
办公事件经过
办公各方回应
云作为 Agent 核心 infra 的重要性不比多说。这里我们主要看看 IM 的整合叙事。
三款产品代表了三种不同判断。
体现在企业内部产品协同上,豆包产品线融合飞书的同时,也与火山引擎深度结合。千问办公合并了此前主攻钉钉场景的悟空,也同时继承了阿里云过去在企业级服务市面上关于行业认知、数据管理、资源调度的全方位资源。
办公影响分析
从今年 6 月到 8 月初,短短不到 60 天时间,有一件事几乎同时在新 BAT 发生。
状况在于,试错期不会一直持续。今年上半年,行业对通用 Agent 的理解发生了明显变化。
模型解决了 Agent 的底层能力问题,Agent 也可以为模型带来比聊天记录更完整的反馈 。
在这个过程中,IM 的上下文,infra 的基础能力建设,模型与 Agent 的飞轮缺一不可。
当越来越多 Agent 都能制作 PPT、分析表格、控制浏览器时,各种 To C 式 Agent 的功能差异会快速缩小。未来真正的差距,将来自产品背后的系统能力:它掌握多少企业上下文,能够获得多大的执行权限,又能否把每一次 Agent 真实任务变成下一次模型升级的依据。
千问办公,已经拿到了半张门票。
技术路线逐渐确定,头部效应也启动出现,这时候,分散就会成为资源分配上的负担。
QoderWork 运行在用户电脑上,擅长读取和处理本地文件;悟空试图进入钉钉的企业账号、权限和应用体系;MuleRun 从一开始就运行在云端,可以长时间执行任务,也更早进入海外市场,截至今年 5 月,它已经服务了 43 个国家和地区的企业和用户,其中单月付费超过 200 美元的用户占比达到 34%。
但这些主要是个人上下文。 个人上下文的叠加不等于企业上下文。企业内所有人的效率相加,也不等于企业效率。 给每位员工配置一个更聪明的个人助手,可以提高局部产出,却未必能够改善整体信息流转、任务协同,以及个人结果转化为组织行动与结果的效率。
也就是说,是 Agent 着手吸收 IM 与云,把它们变成底层的 infra。
我在自建的钉钉组织群里模拟了一段三人选题讨论,让千问办公总结讨论要点并提取待办事项。它不仅从对话中识别出了五条待办,每条都正确分配了负责人,还给紧急的那条标了「较高」优先级和「即将截止」,并直接写入了钉钉的待办系统。
于是,我们看到,推出千问办公的同日,阿里低调放出在编程(Coding)和专业办公(Cowork)方面能力大幅提升的 Qwen3.8。
这是企业级 Agent 与个人办公 Agent 最根本的区别。也是相似的整合背景下,中美大厂行为逻辑产生明显区别的一个认知基础。
这背后的逻辑在于, 在生产环境中,Agent 可以为模型提供一种比聊天记录更有价值的反馈,模型又能一劳永逸的解决 Agent 中的底层情况。
10 天后的 7 月 30 日, 字节跳动宣布飞书产品团队整体并入豆包,飞书负责人谢欣向豆包负责人赵祺汇报 。
因此,我们可以看到 OpenAI 推出 Codex 时,没有只是给通用模型接入代码编辑器,而是训练了面向软件工程任务的 codex-1。它使用真实编程任务进行强化学习,能够读取和修改文件、运行测试,并根据测试成效继续调整,直到得到通过的结果。它的出现,一举改善了开发者们在编程任务中的大量议题,也成为 OpenAI 在编程领域逆袭的关键。
编辑| 靖宇
企业 Agent 的分水岭
如果再将眼光进一步收敛到国内的一梯队玩家,不难发现,阿里在这场竞争中还有一项少见的条件。它同时拥有一线大模型、企业协作平台和云计算基础设施。
最终,Agent 为模型提供真实任务反馈,模型为 Agent 提供更强的判断能力。模型+ Agent 构成的,正是一套持续运行进化的飞轮系统。
当然,对一个外部的第三方 Agent 来说, 通过连接器读取群消息,再生成一份摘要,或者完成投研、网页制作或者表格处理并不困难。真正难的是写回:创建待办、调整日程、发送邮件、提交审批,或者把任务分配给正确的人。
不同的组织结构、不同的产品积累和优势行情,三家中国最顶级的互联网企业却在相近时间作出相似整合选择。这不太像巧合。
紧随其后,7 月 20 日,腾讯开启业务整合,QClaw 的相关业务和团队被并入 WorkBuddy 体系。
先是 6 月,阿里率先开启内部 Agent 的产品线与能力大整合,到 8 月 3 日,官宣在编程(Coding)和专业办公(Cowork)能力大幅提升的 Qwen3.8 模型的同时,正式将内部孵化的三款 Agent 产品 QoderWork、悟空、MuleRun 合并为统一的 Agent 产品「千问办公」。
易观分析发布的二季度报告显示,2026 年 6 月,17 款主流桌面端 AI 办公智能体的合计访问量已经超过 6000 万次。腾讯系、字节系和阿里系产品相加约为 5622 万,留给其他玩家的市场不到 500 万。
传统办公软件按照功能划分世界:邮件负责沟通,文档负责写作,表格负责数据……但真实世界中,用户想完成一个目标,需要的是对中工具能力的组合,Agent 也是同理。
对 OpenAI 和千问系列模型来说,Agent 留下的完整行动轨迹,可以告诉模型它如何理解目标,制定了什么计划,调用了哪些工具,在哪一步偏离要求,用户修改了什么,以及最终产物是否真的被使用。尤其在代码任务中,在代码任务中,能不能运行、测试有没有通过、文件是否正确修改,通常可以被机器验证。而这种真实企业任务中的失败轨迹又能反馈给模型,成为模型迭代的动力。
大厂为什么同时收敛路径
工程层也是同理。过去,模型每升级一次,三支团队都要针对务规划、上下文管理、工具调用、失败重试、权限控制做一次重新适配,这本质上是一种不必要的重复劳动 。
用户在自发的用脚投票,市场也已经没有给大厂留下太多继续分散试验的时间。
「千问办公」就是在这个分秒必争背景下出现的产物。
而于千问办公的此次动作来说,它同样也是阿里三场实验验证过的能力重新组合:桌面端继承本地文件和电脑操作能力,云端承接长任务、资源调度与多模态生成,企业端则继续进入组织身份、权限和业务系统。 把原来分散的产品能力和反馈数据,集中到一个入口、一套工程体系和一个迭代闭环中。
更合理的判断是,这种整合,是在 AI 行业走过摸索期,进入入口争夺阶段背景下的必然选择:过去,大厂需要用多个团队验证桌面操作、云端执行和企业协作等不同路线;现在,主要产品形态已经逐渐清晰, 竞争也开始从能不能做出 Agent,转向谁能成为用户和企业的统一入口。
也是因此,过去十多年,整合了沟通、员工身份、组织关系、协作网络、文件、会议、审批、权限和各种企业应用连接的钉钉式 IM,作为功能最多,也包含完整组织上下文的软件,必定会成为 Agent 时代最底层的能力支撑。
读取只需要接口,而写回需要更高的信任。企业必须确定 Agent 能看到什么、可以替谁操作、哪些步骤需要审批,以及发生错误后如何追溯和撤销。从这一方面来看, 过去十多年里,钉钉为 Agent 的积累不仅是工具,更是信任与企业级上下文的护城河。
但模型和应用都在自己手里并不会自动转化成优势。只有模型和 Agent 能够相互提供反馈时,这种组合才真正有价值。
千问办公实测,可以快速根据需求产出专业报告之外,还能直接打通钉钉发送到聊天界面
作为阿里阶段性的能力重组,它将此前分散在模型、桌面端、云端和企业协作场景中的积累,装进了一款新的独立产品。
企业并不是个个人账号的简单集合。所有员工的文件、对话和任务相加,也不会自动变成企业的运行方式。同样一份文件,在个人 Agent 看来可能只是一份需要总结的材料;在企业 Agent 看来,它还涉及谁可以阅读、谁需要确认、结论应该同步给哪些部门,以及后续任务必须经过谁批准。
OpenAI 和 Anthropic 主要在合并聊天、编程和桌面执行入口。 中国大厂的整合范围,则包括了钉钉、飞书这样的企业协作软件,同时也让云成为了 Agent 底层能力的一部分。
而千问办公作为这轮收束中最新落地的产品,也是最适合观察观察行业变化的样本。
结尾
目前市场上大多数通用办公 Agent,首先解决的仍然是个人生产力状况。它们可以读取用户电脑里的文件,分析个人文档,理解历史对话,整理个人日程,再根据用户本人拥有的权限调用有限的外部工具。
同时,它身上也集中体现了企业 Agent 竞争中最关键的几个问题:内部赛马为什么此时结束,企业 IM 与云为什么成为 Agent 的底层资产,以及模型、产品和真实任务如何形成共同进化的闭环。
*头图来源:千问办公
Anthropic 发现,许多非技术员工会绕过普通聊天界面,直接使用 Claude Code 整理文件、处理表格和完成多步骤知识做事。于是,Cowork 在随后被做了出来:它保留 Claude Code 的任务执行能力,但换成更适合普通知识工作者的交互方式。
在行业动向尚未定型时,三个团队分别测试本地执行、企业协作和云端运行,可以帮助阿里更快地找到方向。
比如,很多 Agent 产品中很多看似发生在应用层的事项,根源其实在模型层。过去,模型选错工具,产品团队可以上升一条调用规则解决;模型在长任务中忘记最初要求,团队也可以在外面再套一层工作流;这些应用上的修补客观上可以降低错误率,却不能改善模型本身的判断与认知能力。
大厂为什么几乎同一时间开始整合 Agent 产品?
拿阿里来说,在今年年初,同时保留 QoderWork、悟空和 MuleRun,是合理的。
本文为极客公园原创文章,转载请联系极客君微信 geekparkGO