近一年窗口(2025 年 8 月 — 2026 年 8 月):全球与中国 AI Agent 市场全景、三类玩家(通用 Agent 助手 / 智能体开发平台 / 开发框架与编排层)的多维对比、MCP 与 A2A 协议标准化进展、近一年关键动态时间线,以及面向企业的落地路径建议
过去 12 个月,AI Agent 完成了从「聊天机器人补充」到「企业数字劳动力」的品类确立:Gartner 预测 2026 年底全球 40% 的企业应用将内置任务型 Agent(2025 年不足 5%)〔23〕;IDC 口径下 2026 年全球 AI Agent 市场规模约 109 亿美元、2025→2030 复合增速 45.8%〔23〕;中国市场企业级 AI 智能体市场 2025 年 212 亿元、2026E 449 亿元〔23〕〔24〕。
但「采用爆发 × 价值兑现缺口」并存:79% 的企业已启动 Agent 部署,却有约 40% 以上的 Agent 项目面临 2027 年前被取消的风险〔23〕;88% 的企业仍停留在「单 Agent Demo」阶段〔23〕。Agent 不缺能力,缺的是可靠性、集成深度、治理与 ROI 度量——这既是市场最大的裂缝,也是「Agent 生产化」服务商与咨询方的战略机会。
2025—2026 年被行业普遍称为「智能体之年」:2025 是聊天机器人之年,2026 则是「你给它一个目标,它自己拆解、调工具、跨应用把活干完」的 Agent 之年〔8〕。机构口径趋同但数字各异,核心方向一致——Agent 是当前 AI 商业化变现最快的品类:
市场上的「Agent」不是一个产品,而是一整个品类〔8〕。为便于对比,本报告把供给方划分为三类——通用 Agent 助手(面向终端用户直接干活)、智能体开发平台(面向业务/开发者搭建 Agent)、Agent 开发框架与编排层(面向技术团队自建 Agent 系统的工程底座)。三者能力边界在快速互相渗透(平台开始内置框架、助手开始开放 API),但定位、客群与商业模式仍泾渭分明:
| 玩家类型 | 代表产品 / 厂商 | 核心供给形态 | 2026 关键词 |
|---|---|---|---|
| 通用 Agent 助手 | 海外:Manus、OpenAI Operator / Deep Research / Codex / Atlas、Anthropic Claude Code / Computer Use / Cowork、Google Gemini Agent / Deep Research Max;国内:智谱 AutoGLM、腾讯 WorkBuddy、字节豆包、Kimi、美团 CatPaw〔1〕〔4〕〔6〕〔8〕〔9〕〔10〕 | 「交付结果」的终端产品:写代码、做研究、操作浏览器/桌面、办公自动化;多为订阅制或按量计费 | 商业化爆发(Claude Code ARR 破 25 亿美元〔6〕〔7〕);从单任务走向工作流接管(Manus 连续更新 Skills / PlanMode / 云电脑〔1〕〔2〕〔3〕) |
| 智能体开发平台 | 字节扣子 Coze(+火山 HiAgent)、百度文心智能体 / 千帆 AppBuilder、阿里云百炼、腾讯元器(+腾讯云 ADP)、讯飞星辰、华为盘古智能体、蚂蚁数科 Agentar;海外参照 Salesforce Agentforce、Microsoft Copilot Studio〔8〕〔13〕〔14〕〔25〕 | 低代码/零代码搭建 + 分发 + 治理:知识库、工作流、插件市场、多渠道发布、私有化/SSO/审计 | 平台大版本迭代(扣子 3.0〔13〕);企业版提价 + 治理能力升级;头部平台向「数字员工」演进〔8〕〔14〕 |
| 开发框架 / 编排层 | LangGraph / LangChain、CrewAI、AutoGen / AG2、Microsoft Agent Framework、Google ADK、OpenAI Agents SDK、Claude Agent SDK、Dify、Coze Studio、AgentScope 等〔16〕〔17〕〔18〕 | 工程底座:状态编排、多 Agent 协作、记忆/工具管理、可观测性;Dify 等同时是平台型开源产品 | 框架 1.0 化(LangGraph/LangChain 1.0〔16〕、微软 MAF 1.0〔16〕〔18〕);厂商官方 SDK 齐发,终结 LangChain 垄断〔18〕 |
注:三类边界正在互相渗透——扣子开源 Coze Studio 切入框架层〔16〕,Anthropic/OpenAI 推出官方 Agent SDK〔18〕,Claude Code 亦被企业当作「开发工具」采购。本报告按「用户主要接触的界面」归类。
本报告采用六个维度评估三类玩家。维度定义如下,后续各章均以该框架展开:
| 维度 | 评估内容 | 观察信号(近一年) |
|---|---|---|
| ① 任务自动化能力 | 多步规划、工具调用、自主执行、跨应用闭环;能否独立完成「从目标到交付」 | SWE-bench / Terminal-Bench / DeepSearchQA / HLE 等基准跃迁(如 GLM-5.3 Terminal-Bench 3.0 从 4.6→28.3〔12〕);Operator/Computer Use 的真实完成率仍仅约 19%(人类 80.8%)〔9〕 |
| ② 企业落地成熟度 | 生产可用性、私有化部署、SSO/权限/审计、SLA、团队版/席位模式 | Claude Code 企业版「基础席位 + 按用量」〔6〕;扣子企业版新增 SSO/VPC/KMS〔13〕;Salesforce Agentforce 按动作计费 0.10 美元〔8〕 |
| ③ 成本 | Token 消耗、平台订阅费、席位费、按动作/成果计费;「完成一次真实任务」的单位成本 | 大模型降价潮(2026 年 7—8 月,百万 Token 低至约 0.025 元人民币量级,估计值);GLM-5.3 称前沿旗舰中单任务成本最低〔12〕;企业开始按「修一个 Bug / 交付一个 PR」算账〔7〕 |
| ④ 生态与扩展 | MCP/插件/工具链支持、开发者生态、模型兼容性、社区与可观测工具 | MCP 成事实标准、官方注册服务器近万〔19〕〔21〕;Dify 插件市场国产模型安装量数十万至百万级〔15〕;LangGraph PyPI 月下载量千万级〔16〕 |
| ⑤ 中文与本地化支持 | 中文指令与输出质量、国产模型底座、国内生态(企微/飞书/微信)、信创适配 | 国内产品原生中文;OpenAI/Google 旗舰 Agent 多为英文优先且部分仅美国区(如 Gemini Agent、Operator 早期〔9〕〔11〕);国内企业倾向国产底座(混元/GLM/DeepSeek/Qwen)〔14〕〔30〕 |
| ⑥ 安全合规 | 中国《智能体规范应用与创新发展实施意见》〔26〕〔27〕备案与分级监管、权限分级(用户决策/授权决策/自主决策)、数据不出域、审计追溯 | 2026.05 三部门《实施意见》确立分类分级监管与统一登记备案平台〔26〕〔27〕〔28〕;《人工智能拟人化互动服务管理暂行办法》2026.07.15 施行〔29〕;OpenClaw 暴露「指令诱导发起网络攻击」等风险〔26〕 |
下表选取近一年最具代表性、信息密度最高的 8 类通用 Agent 产品。定价、用户数与市场数据为 2026 年 8 月检索时点数据,部分为估计值(已标注)。
| 产品 / 厂商 | 类型与定位 | 核心能力与近一年关键进展 | 成本与商业模式 | 生态 / 中文 / 企业成熟度 |
|---|---|---|---|---|
| Manus 通用任务 Agent |
「给一个目标,几天后拿成品」的异步云端通用 Agent〔8〕 | 2025.03 首发「全球首款通用 AI Agent」;2025.12 被 Meta 以约 20 亿美元收购官宣→2026.04 被叫停→2026.08 恢复独立运营〔1〕〔2〕〔3〕。年化收入由约 1 亿美元升至 4—5 亿美元(估计值)〔2〕。2026 年连续迭代 Skills、My Computer、Cloud Computer、Branch、Auto-Publish、智能 PPT、PlanMode〔1〕〔2〕 | 订阅制(免费额度 + 付费档,估计值/以官网为准)〔1〕〔3〕 | 与阿里通义千问战略合作,接入 DeepSeek/硅基流动等国产模型〔1〕;中文团队原生中文;偏个人/团队生产力,尚未见企业级治理底座(估计值/待核实)〔3〕 |
| OpenAI Operator / Deep Research / Codex / Atlas 浏览器操作 + 研究 + 代码 |
生态最大的通用 Agent 家族:Operator 真开浏览器订餐填表;Deep Research 多源调研;Codex 云端编码;Atlas 为 Agent 内嵌的浏览器〔4〕〔8〕 | Deep Research 基于 o3,HLE 得分 26.6%(此前顶级模型约 9%)〔5〕;2026.02 起可连接任意 MCP 或应用并限制可信站点〔4〕;以 API-first 进入 Azure AI Foundry,可链入企业知识库〔5〕;Codex 周活用户超 500 万并向分析/运营/金融扩散〔7〕 | Pro 200 美元/月(Operator 早期仅美区)〔8〕;Deep Research:Pro 250 次/月、Plus 25 次/月〔4〕;企业版经 Azure 计费〔5〕 | MCP 原生支持〔4〕;中文:企业版经 Azure 可达,产品本体英文优先〔5〕;企业成熟度:中高(3M+ 企业客户,平均每用户日省 40—60 分钟〔5〕,估计值) |
| Anthropic Claude Code / Computer Use / Cowork / Dispatch 代码 Agent 标杆 |
终端里的软件工程 Agent:读代码库、改文件、跑命令、管 git;通过 MCP 连 300+ 外部工具〔8〕 | 2025.05 公开后 6 个月 ARR 破 10 亿美元,2026.02 官方披露超 25 亿美元〔6〕〔7〕;周活翻倍、企业客户贡献超一半收入〔6〕。SWE-bench 头部 70%+〔8〕;Computer Use(macOS)为 research preview,真实完成率约 19%(vs 人类 80.8%)〔9〕;Dispatch 支持手机远程指派任务〔9〕 | 企业版 20 美元/席/月 + 实际模型用量〔6〕;个人 Max 100—200 美元/月〔6〕;「卖工程师时间而非 Token」〔7〕 | MCP 发明者,原生一等公民〔19〕〔21〕;CLI 中文可用但资料英文优先;企业成熟度:高(500+ 客户年消费超 100 万美元〔6〕) |
| Google Gemini Agent / Deep Research Max / Chrome Auto Browse 工作区 + 浏览器 Agent |
把 Agent 内嵌进 Workspace/Search/Chrome:邮件、日历、文档、浏览器自动操作〔9〕〔10〕 | 2026.05.04 关停独立 Mariner,技术并入 Gemini Agent(最多 10 个并行任务、持久云会话)〔9〕〔10〕;2026.01.29 推出 Chrome Auto Browse〔9〕;Deep Research Max 基于 Gemini 3.1 Pro:DeepSearchQA 93.3%(2025.12 为 66.1%)、HLE 54.6%〔9〕 | AI Ultra 249.99 美元/月;Gemini Agent 仅美国区英语可用〔9〕〔11〕 | MCP + Workspace 深度集成;中文:未开放中文区(估计值/待核实);企业成熟度:中(Mariner 时代缺团队席与审计导出,Gemini Agent 面向消费与 Workspace〔11〕) |
| 智谱 AutoGLM / GLM-5.3 手机/浏览器操作 Agent |
端侧与浏览器操作 Agent(AutoGLM 系),配合 GLM 系列基座〔8〕〔12〕 | GLM-5.3(2026.08.19)AA 综合智能指数 60 分,与闭源旗舰同级、并列开源第一;Terminal-Bench 3.0 从 4.6→28.3,DeepSWE v1.1 达 66.9,CyberGym 网络安全 84.5%;以「前沿旗舰中最低单任务成本」主推〔12〕 | API 定价与 GLM-5.2 持平,权重下周五开源〔12〕 | 接入 ZCode / GLM CodingPlan〔12〕;原生中文 + 信创适配;企业成熟度:中高(政务/金融/研报场景为主〔25〕,估计值) |
| 腾讯 WorkBuddy 办公 Agent |
「一句话让 AI 替你上班」的桌面办公智能体,感知→规划→执行→交付闭环〔8〕 | 2026.03.09 上线;2026.06 PC 端月访问量超 2000 万、居国内办公智能体第一(估计值)〔8〕;2026.06 发布企业版 Agent Suite〔8〕;接入企微/微信/腾讯文档/QQ/钉钉/飞书〔8〕 | 基础免费 + 企业按量(估计值)〔8〕 | 混元 Hy3 底座(自选模型用户 60%+ 选 Hy3)〔8〕;原生中文;企业成熟度:中高(国内办公场景领先,治理随企业版迭代〔8〕) |
| 字节豆包 / 扣子(C 端)+美团 CatPaw C 端入口与全场景平台 |
豆包为国内最大 C 端 Agent 入口;CatPaw(2026.07.27 上线)为全场景 Agent 平台(个人工作台 + 企业托管)〔8〕 | 豆包 2026.04 月活 3.36 亿,国内第一(估计值)〔8〕;CatPaw 底层 LongCat 2.0(1.6 万亿参数 MoE),支持文件/浏览器/终端操作、多 Agent 协同;内部已覆盖 9 万员工、搭建 3 万+ Agent〔8〕 | 豆包免费+订阅;CatPaw 个人免费/企业托管按量(估计值/待核实)〔8〕 | 深度绑定字节生态(飞书/抖音);原生中文;企业成熟度:中(CatPaw 支持私有化部署〔8〕) |
| Salesforce Agentforce(企业级参照) CRM 企业 Agent |
CRM 原生企业 Agent,在工单/营销/客服流程内端到端执行〔8〕 | 上线半年签下 2.9 万单、ARR 约 8 亿美元;用 Data Cloud 降低幻觉,按动作计费约 0.10 美元〔8〕 | 按动作计费(约 0.10 美元/动作)〔8〕 | 中文:国内需结合本地 CRM 改造(估计值);企业成熟度:高(权限/审计/人工兜底底座成熟〔8〕) |
近一年基准数据的跃迁集中在代码与深度研究两条线:头部代码 Agent 在 SWE-bench Verified 上稳定 70%+(2024 年还是个位数)〔8〕;Deep Research Max 在 HLE 上从 46.4% 升至 54.6%〔9〕。而浏览器/桌面操作类 Agent 仍是短板——牛津/MIT 等 2026 年研究显示最强 Computer Use 系统真实任务完成率仅约 19%,人类为 80.8%,且任务越复杂表现断崖式下滑〔8〕〔9〕。结论:「会写代码」「会读资料」已生产可用,「会替人操作任意软件」尚属早期。
Claude Code 是过去一年企业变现速度最快的样本:发布约一年 ARR 破 25 亿美元,企业客户贡献超半壁收入,定价从「席位」转向「席位费 + 按模型用量」〔6〕〔7〕。微软针对数万名工程师的研究显示,采用命令行 Coding Agent 的工程师合并 PR 数量平均提高约 24%〔6〕。反观通用任务 Agent(Manus、Operator 等),多为个人订阅、缺少团队席/审计/SLA,尚难作为企业系统采购(估计值/待核实)〔1〕〔9〕〔11〕。
2026 年 7—8 月全球模型集中降价(OpenAI GPT-5.6 Luna 降价 80%,国产模型百万 Token 低至约 0.025 元人民币量级,估计值)〔1〕〔12〕;GLM-5.3 以「前沿旗舰中最低单任务成本」定价〔12〕。更重要的是商业模式迁移:Agentforce 按动作计费(0.10 美元/动作)〔8〕、Claude Code 按席位+用量〔6〕、企业开始核算「修一个 Bug 多少钱」〔7〕——「完成一次真实交付的成本」正在取代「每百万 Token 价格」成为采购指标。
MCP 已成为 Agent 连接企业系统的默认插座〔19〕〔20〕〔21〕:Claude Code 原生支持、Deep Research 2026.02 起可连任意 MCP〔4〕、Dify 原生内置 MCP Client〔15〕。当前竞争焦点已从「谁的模型强」转向「谁的工具链能插进客户已有的系统」——这也是 MCP Tunnels(直连内网、无需公网端点)这类「面向受监管企业」的能力被行业视为关键信号的原因〔19〕。
中文场景下,智谱 AutoGLM/GLM、腾讯 WorkBuddy、豆包、Kimi、美团 CatPaw 均为原生中文并深度绑定国内协作生态(企微/飞书/微信/钉钉)〔8〕〔12〕〔30〕;海外旗舰的 Agent 功能多数仅美国区英文可用(Gemini Agent、Operator 早期版本〔9〕〔11〕),中国企业直接采购海外通用 Agent 的可用性仍受限制(估计值/待核实)。
2026.05.08 国家网信办、发改委、工信部联合印发《智能体规范应用与创新发展实施意见》——国内首个国家级智能体专项政策:确立分类分级监管、建立统一登记备案平台、区分「用户决策 / 授权决策 / 自主决策」三种权限模式并保证用户知情权与最终决策权〔26〕〔27〕〔28〕;2026.07.15《人工智能拟人化互动服务管理暂行办法》施行,情感互动类 Agent 纳入专项监管〔29〕。对企业而言,Agent 采购已不只是技术选型,而是合规工程——私有化、数据不出域、行为围栏、审计追溯成为刚需(详见第七章)。
国内平台是「企业 Agent 落地」的主战场:零代码搭建、渠道分发、模型网关与私有化能力一体交付。下表覆盖 2026 年市场认知度最高的平台;定价为公开渠道口径,存在版本差异,请以官网为准。
| 平台(厂商 / 底座) | 核心能力 | 典型场景 | 定价与成本(估计值) | 私有化与安全合规 |
|---|---|---|---|---|
| 扣子 Coze(字节 / 豆包、DeepSeek 等多模型)〔13〕〔30〕 | 国内生态最完善的低代码 Agent 平台:拖拽工作流、插件市场、知识库、多 Agent 协作;扣子 3.0 支持云端 Agent/职业模板、云手机/云电脑、本地 Agent 接入〔13〕 | 客服 Bot、内容创作、办公自动化、多渠道分发(飞书/抖音/微信/网页)〔13〕〔30〕 | 企业标准版 ¥980/月(2026.07.14 起,原 ¥498)、旗舰版 ¥8,980/月;席位 ¥29/个/月〔13〕 | 企业版支持 SSO、VPC 私网连接、KMS 密钥(旗舰版);个人/团队版不含〔13〕 |
| 百度千帆 / 文心智能体(百度 / 文心 ERNIE 4.5/X1)〔14〕〔25〕 | Agent-first 重构千帆:聚合 150+ SOTA 模型;AppBuilder 低代码;跨智能体记忆共享;搜索 + 知识图谱增强〔14〕〔30〕 | 政务、法律、医疗等知识密集型场景;企业知识助手〔14〕〔30〕 | AppBuilder 约 ¥0.05—0.09/千 Token、¥198/人/月(估计值);私有化约 ¥50 万/年起(估计值)〔25〕 | 面向央国企采购流程顺畅;支持私有化与多模态 RAG〔14〕〔25〕 |
| 阿里云百炼(阿里 / Qwen 系列)〔8〕〔14〕〔25〕 | 「AI 模型超市」:160+ 模型统一接入;预置 Agent 模板(电商导购/文档审核);多模型路由与效果评测;与钉钉/阿里云深度集成〔8〕〔30〕 | 电商导购、企业知识库、复杂任务编排、研发(Qoder 编码智能体)〔25〕〔30〕 | 百炼约 ¥0.06—0.10/千 Token、¥298/人/月(估计值);新用户约 7000 万 Token/90 天免费额度〔25〕〔30〕 | 支持私有化(Qoder 私有化约 ¥80 万/年起,估计值);阿里云合规体系〔25〕 |
| 腾讯元器(腾讯 / 混元 Hy3)〔8〕〔14〕〔25〕 | 微信生态原生 Agent 平台:零代码搭建,公众号/小程序/企业微信一键接入;腾讯云 ADP 覆盖构建到管控全环节〔14〕〔30〕 | 私域运营、社群自动化、客户全生命周期管理、微信客服〔14〕〔30〕 | 元器基础版约 ¥9,800/月、高级版约 ¥29,800/月,定制化约 ¥50 万起(估计值)〔25〕;ADP ¥88/188/4880 元〔30〕 | 深度绑定微信生态;B 端 ADP 含管控与审计能力〔14〕〔25〕 |
| 讯飞星辰(科大讯飞 / 星火 X1.5)〔14〕〔25〕〔30〕 | 语音能力见长:方言识别、多轮语音交互;面向教育/医疗/政务提供垂直模板;Astron Agent 已开源〔14〕〔25〕 | 课堂助教、医院导诊、政务语音助手〔14〕〔30〕 | 免费 + 增值订阅(估计值)〔30〕 | 全国产算力路线,信创友好〔14〕〔25〕 |
| 火山引擎 HiAgent(字节 / 豆包 Seed 系)〔14〕〔25〕 | 企业级智能体中台:「数字员工」+ 研发智能体 Trae;飞书/ERP 集成;权限审计、私有化部署〔14〕〔25〕 | 数字员工、研发提效、中大型企业流程自动化〔14〕〔25〕 | 公有云约 ¥0.08—0.12/千 Token;Trae 企业版约 ¥399/人/月;私有化百万级起步(均为估计值)〔25〕 | 私有化 + 权限审计能力完整〔14〕〔25〕 |
| 华为盘古智能体(华为 / 盘古 5.x)〔14〕〔25〕 | 工业/政企底座:智慧城市、产线优化、能源调度;ModelArts Studio 全链路;昇腾芯片亲和〔14〕〔25〕 | 制造、能源、政务、城市治理〔14〕〔25〕 | 公有云约 ¥0.05—0.08/千 Token(估计值)〔25〕 | 全链路昇腾自主可控 + Cloud Stack 私有化;信创首选〔14〕〔25〕 |
| 蚂蚁数科 Agentar(蚂蚁 / 多模型)〔14〕〔25〕 | 全栈高合规型:信通院最高 5 级认证、私有化部署、全链路审计〔14〕〔25〕 | 金融、政务、大型集团〔14〕〔25〕 | 估计值/待核实〔14〕〔25〕 | 信通院 5 级认证 + 全链路审计,合规标杆〔14〕〔25〕 |
| Dify(开源 / 多模型)〔15〕〔16〕〔18〕 | 开源 Agent 中台:可视化工作流 + 生产级 RAG + 插件市场 + 模型网关;GitHub 约 15 万 Star、800+ 贡献者;2026.07 1.16.0 推出多人协作与 Agent App〔15〕〔16〕 | 央国企/金融私有化落地(东吴证券、广州金控等案例)、技术团队自建 AI 中台〔15〕〔16〕 | 社区版免费(Apache 2.0 + 附加条款);企业版付费(估计值/待核实)〔15〕 | 完全私有化部署、数据自主可控;但协议禁止基于源码运营多租户 SaaS〔15〕〔16〕 |
注:海外企业级平台参照——Salesforce Agentforce 按动作计费约 0.10 美元〔8〕;Microsoft Copilot Studio 已有 16 万组织、40 万+ 自定义 Agent 在跑〔8〕。国内平台定价与案例细节多为媒体/社区转述,标注估计值。
2026 年框架层的标志性事件是厂商官方 SDK 全面入场(OpenAI Agents SDK、Claude Agent SDK、Google ADK、Microsoft Agent Framework),终结了 2023—2024 年 LangChain 的「准垄断」〔18〕。选型本质是在「工程可控性」「生态成熟度」「厂商绑定」之间取舍。
| 框架 | 心智模型与状态管理 | 生产成熟度与代表案例 | 生态(MCP / A2A / 可观测) | 适用团队 / 权衡 |
|---|---|---|---|---|
| LangGraph / LangChain〔16〕〔17〕〔18〕 | 有状态 StateGraph:节点+条件边,Checkpoint 持久化、时间旅行调试、HITL 节点级审批〔17〕〔18〕 | 生产级默认选择;PyPI 月下载量千万级;Klarna 客服助手(月 230 万对话 ≈ 700 名全职客服)基于 LangGraph〔16〕 | MCP 社区集成;LangSmith/Langfuse 可观测;模型无关〔17〕〔18〕 | 复杂多步工作流、审计与合规场景;代价:学习曲线陡、API 多次断裂、2025-2026 披露多个高危 CVE〔16〕 |
| CrewAI〔16〕〔17〕〔18〕 | 「团队」心智:Role/Goal/Backstory/Tools→Crew;顺序/层级/共识流程抽象〔18〕 | 多 Agent 业务协作增长最快;PwC 内部代码生成 Agent 可用比例从个位数提升至约 70%(估计值)〔16〕 | MCP 生态;A2A 支持逐步完善;可观测性持续改进〔17〕〔18〕 | 业务映射清晰的「Agent 团队」快速搭建;代价:复杂控制流弱于 LangGraph〔17〕 |
| AutoGen / AG2〔16〕〔17〕〔18〕 | 会话式多 Agent(对话流为原语);v0.4/0.5 后官方移交社区,AG2 为 Apache-2.0 分叉〔16〕〔18〕 | 研究与人机协同场景首选;生产基座偏小〔17〕〔18〕 | 模型无关〔17〕;生产项目不建议新起 AutoGen〔16〕 | 学术研究、对话式多 Agent 实验;企业新项目优先微软 MAF〔16〕〔18〕 |
| Microsoft Agent Framework(AutoGen+Semantic Kernel 合并)〔16〕〔18〕 | SK 企业机制(观测/SLA/合规)+ AutoGen 图编排 + A2A/MCP 协议;三语言 API 一致(.NET/Python/Java)〔16〕〔18〕 | 2026.04.02 1.0 GA;Azure 生态企业标准;企业治理与合规最强〔16〕〔18〕 | 原生支持 MCP/A2A;Azure AI Foundry 深度集成〔16〕〔18〕 | Azure/.NET 栈企业;代价:Python 生态成熟度弱于 LangGraph〔16〕〔18〕 |
| Google ADK(Agent Development Kit)〔18〕 | 面向 Gemini 生态;Python/Java 双语言;A2A 协议一等公民;Vertex AI 深度集成〔18〕 | 2025 年中发布;适合已上 GCP/Vertex AI 的团队;Java 支持利于传统企业〔18〕 | A2A 原生 + Vertex Model Garden 多模型〔18〕 | GCP/Java 栈团队;代价:Gemini 生态绑定〔18〕 |
| OpenAI Agents SDK〔16〕〔17〕〔18〕 | Agent/Handoff/Guardrail/Runner 最少原语;内置追踪与护栏〔17〕〔18〕 | OpenAI 生态最快上手;切换 Claude/Gemini 需重写〔17〕〔18〕 | 原生 MCP;追踪深度集成 OpenAI 平台〔17〕〔18〕 | 深度使用 OpenAI 模型的团队;代价:跨模型支持差〔17〕〔18〕 |
| Claude Agent SDK〔18〕 | Sub-agent 任务分解;Claude 长上下文/工具使用深度优化;MCP 一等公民(Claude Code 即构建其上)〔18〕 | 以 Claude 为核心的 Agent 应用首选〔18〕 | MCP 原生〔18〕〔19〕 | Claude 深度用户;代价:Anthropic 依赖〔18〕 |
| Dify / Coze Studio(平台型开源)〔13〕〔15〕〔16〕 | 可视化 DAG 工作流 + DSL(可被 Git 管理);Dify 1.16 支持多人协同编辑与 Agent App〔15〕 | 企业私有化 AI 中台;案例:东吴证券数据治理、广州金控多模型池〔15〕〔16〕 | 原生 MCP Client/Server;插件市场国产模型安装量数十万至百万级〔15〕〔16〕 | 「不写代码也能上线 + 私有化」的团队;代价:非纯框架,企业版能力与协议边界需评估〔15〕 |
基于第三至第六章的对比结论,对「先上什么场景、用哪个产品/框架、组织怎么配合」给出 5 条可执行建议。原则:先用成熟品类拿确定性 ROI,再向核心流程扩展;先搭治理框架,再放自主权限。
已跑通商业闭环的场景依次是编码 Agent(Claude Code/Codex,企业已按结果付费〔6〕〔7〕)、CRM/客服 Agent(Agentforce 按动作计费〔8〕)、知识密集型 Agent(Deep Research 系,HLE 54.6%〔9〕)。建议以「客服(降低成本)+ 营销(拉动收入)+ 研发(交付效率)」三线切入,每个场景上线前定义可量化基线(如首次响应时间、PR 合并数、人效),6 个月不达标即下架——把「40%+ 项目被取消」的风险前置化解〔16〕〔23〕。
给三类角色的默认答案:技术团队自建核心流程 → LangGraph/微软 MAF/Dify(生产成熟度最高、可审计〔16〕〔17〕〔18〕);业务团队快速搭建 → 扣子/百炼/元器(零代码 + 渠道分发,按生态归属选择〔13〕〔14〕〔30〕);员工个人提效 → WorkBuddy/豆包/Claude Code 等〔8〕。切忌「一个平台包打天下」——平台与框架应共存,平台做边缘场景的快速交付,框架承载核心生产链路。
对标 2026.05 政策要求:区分「仅限用户本人决策 / 用户授权决策 / 智能体自主决策」三种模式,明确用户知情权与最终决策权〔26〕〔27〕。建议设跨部门治理委员会(IT + 安全 + 法务 + 业务),对每个 Agent 做「风险等级评估(低/中/高)→ 权限设定 → 上线前评审」,高风险场景(支付、合同、对外发布)强制人工审批节点。组织上同步配置「Agent 运营者」岗位——未来每 10—20 个生产 Agent 需要 1 名运营者负责持续调优与异常处置。
三件套:① MCP 治理——建立企业批准的 MCP 服务器清单与权限授予流程,MCP 服务器权限过大是 2026 年头号安全风险〔21〕;② 数据边界——敏感数据优先私有化部署(Dify/盘古/HiAgent 私有化方案)或「本地模型 + 云端调用」双轨〔15〕〔16〕〔25〕,严格数据不出域;③ 审计追溯——所有 Agent 执行留日志、可回放、可追溯,对应「行为围栏」与防投毒要求〔26〕〔29〕。OpenClaw 事件表明:自主权限越大,监管与审计成本越高——放权速度应慢于信任建立速度〔26〕。
Agent 时代采购单位正在从「每人每月的席位」迁移到「每完成一个任务的成本」〔6〕〔7〕〔8〕。建议:① 预算上把「Agent 消耗」从 IT 预算单列,按业务部门「任务量」归集成本,让 ROI 可核算;② 采购时优先选择支持按动作/按成果计费或「基础席位 + 用量」的产品(Agentforce、Claude Code 模式〔6〕〔8〕);③ 与供应商约定「失败共担」条款(试点未达标不续费)——把目前行业最高的信任缺口(40%+ 项目被取消〔16〕)转化为自己的议价筹码。
| 门槛 | 现状证据 | 跨越路径 |
|---|---|---|
| ① 可靠性 | 最强 Computer Use 完成率约 19%(人类 80.8%)〔9〕;88% 企业停在单 Agent Demo〔23〕;Gartner 预警 2027 前超 40% 项目被取消〔16〕 | 限定任务边界、引入人工审批节点(HITL)、用框架级 Checkpoint/状态恢复兜底〔16〕〔17〕;对「任务越复杂成功率断崖」保持现实预期〔9〕 |
| ② 集成 | 企业最大的障碍不是模型性能而是集成复杂度〔21〕;MCP Tunnels 等内网连接能力仍是新特性〔19〕 | 以 MCP 为标准做工具接入(一处接入、全 Agent 复用)〔20〕〔21〕;从「连接 API」升级为「连接老系统/无 API 系统」〔14〕 |
| ③ 治理 | OpenClaw 指令诱导攻击事件〔26〕;政策要求备案、分级、权限三分〔26〕〔27〕;MCP 权限过大是 2026 头号风险〔21〕 | 把合规从「上线前补课」变成「开发内嵌」:行为围栏、最小权限、全链路审计〔26〕〔29〕 |
| ④ ROI 度量 | 企业开始按「修一个 Bug / 交付一个 PR / 完成一个动作」算账〔6〕〔7〕〔8〕;成功的 Agent 部署平均 ROI 约 171%(美国 192%,估计值)〔23〕 | 部署前定基线、上线后按月度量、按任务归集成本;用「成果计费」类产品把供应商与自身利益对齐〔6〕〔8〕 |
以下数字或来自单一媒体转述、或为预测口径、或为厂商非审计披露,本报告保留并标注「估计值/待核实」,引用时请谨慎: