AICOR 咨询部 · 研究报告
国内外主流大模型对比报告
覆盖 2025 年 8 月—2026 年 8 月近一年窗口:全球竞争格局、主流模型总览对比表、六维能力雷达、价格—能力象限,及面向企业落地的选型建议与 2026 年展望
出品 |AICOR(AI核)咨询部·研究分析师
主体 |重庆科悦睿博网络科技有限公司
周期 |2025 年 8 月 — 2026 年 8 月
完成 |2026 年 8 月 19 日
编制人 |研究分析师(AICOR)
版本 |V1.0
核心摘要
近一年,全球大模型完成了「能力代际加速 × 价格体系雪崩 × 竞争主线迁移」 三重变化:OpenAI 从 GPT-5 迭代至 GPT-5.6,Anthropic 发布 Claude Opus 5,Google Gemini 更新至 3.6 系列,Meta 开源 Llama 5;国内 DeepSeek V4-Pro、Qwen3.8-Max、Kimi K3、GLM-5.3 密集发布并大规模开源,中国模型在中文能力、性价比与开源生态三项上形成反超 ,OpenRouter 日调用量前十中已占 6 席。
对企业的核心含义:「1M token 长上下文」成为主流配置,「Agent 原生」成为新分水岭,推理价格半年再降约一个数量级 ——模型本身正在从「稀缺能力」变成「水电式基础设施」,真正的差异化转向选型组合与组织落地 ,这正是 AICOR「企业 AI 重构 + 人机协同组织」服务的主战场。
10+ 家
头部厂商近一年完成 3–5 次代际迭代,节奏空前
6/10
OpenRouter 日调用量前十为中国模型
1M
token 长上下文成为主流配置(DeepSeek/Kimi/Gemini 等)
$0.20/M
轻量档输出单价新低(GPT-5.6 Luna,2026-07-30)
2.8T
Kimi K3 总参数量,权重开源进入全球第一梯队
3 梯队
全球竞争格局:「旗舰—中美一线—特色垂直」
报告范围与方法说明。 本报告覆盖 2025 年 8 月—2026 年 8 月,聚焦国内外主流通用大模型的迭代、能力、价格、开源与生态对比。数据来源于 2026 年 8 月 19 日的多轮网络检索(共 10 轮关键词组合),引用各厂商官方发布、定价公告、技术文档及 OpenRouter、LMArena、AA Intelligence Index 等公开第三方数据。所有关键数字均在正文标注来源序号(见附录) ;海外以美元/百万 token、国内以人民币/百万 token 计价,换算汇率 1 USD≈7.2 CNY 为估计值;对口径存疑或单一来源的数据,以「估计值/待核实」明示,未作虚构填充。
目录
一、竞争全景:三梯队格局与一年主线
二、总览对比:主流模型一览大表
三、能力对比:六维雷达与分维度解读
四、价格与性价比:降价曲线与「能力—价格」象限
五、开源 vs 闭源:格局、趋势与选择逻辑
六、生态与企业落地适配
七、近一年关键迭代时间线(2025.08—2026.08)
八、企业选型建议(AICOR 视角,6 条)
九、结论与 2026 年判断
附录:数据来源清单与估计值声明
一
竞争全景 Landscape — 三梯队格局与一年主线
1.1 一年主线:三个关键词
过去 12 个月(2025.08—2026.08),全球大模型产业的变化可以用三个关键词概括:
能力代际加速 :GPT-5→5.6、Claude Opus 4.6→5、Gemini 3→3.6、DeepSeek V3.1→V4-Pro、Qwen3.x→3.8-Max、Kimi K2.x→K3,一年内头部厂商普遍完成 3–5 次版本迭代,迭代周期从「季度」压缩到「月度」〔1〕〔3〕〔7〕〔8〕〔9〕。
价格体系雪崩 :旗舰输出价从 2025 年中的 60 美元级下探至 12–30 美元级,轻量档低至 0.2–1.5 美元;国内低端主力已降到每百万 token 0.8–2 元人民币,旗舰级为 20–100 元〔1〕〔3〕〔8〕〔14〕。
竞争主线迁移 :从「拼参数、拼榜单」转向「拼推理深度、拼 Agent 原生、拼长上下文」——1M token 上下文成为主流配置,深度推理模式(Gemini Deep Think、GPT-5.6 深度研究)与「能干活」的 Agent 能力成为新分水岭〔1〕〔3〕〔10〕〔15〕。
1.2 三梯队格局(2026-08)
第一梯队
全球旗舰 :OpenAI GPT-5.6、Anthropic Claude Opus 5、Google Gemini 3.x、Meta Llama 5(开源侧)。代表全球能力上限;AA Intelligence Index 前三为 Claude Opus 5(63)、GPT-5.6 Sol(61)、Kimi K3(60)〔17〕。
来源〔1〕〔2〕〔3〕〔4〕〔17〕
第二梯队
中美一线 :DeepSeek V4-Pro、Qwen3.8-Max、Kimi K3、GLM-5.3、豆包 Seed 2.1、xAI Grok 4.6、MiniMax M3 等。单点能力逼近第一梯队,中文与性价比实现反超〔7〕〔8〕〔9〕〔10〕〔11〕〔12〕。
来源〔7〕—〔12〕〔16〕
第三梯队
特色/垂直 :文心 5.1(搜索)、腾讯混元 Hy3(可靠性)、阶跃 Step 3.7(Agent OS)、Mistral Large 3(欧洲合规)等。以场景化、合规化、行业私有化差异化定位〔13〕〔14〕〔15〕〔6〕。
来源〔6〕〔13〕〔14〕〔15〕
图 1|OpenRouter 日调用量前十模型归属(2026 年多次采样)
口径:公开调用榜单逐日采样后取稳定值;十席中 6 席为中国模型,含 DeepSeek V4-Flash-0731、混元 Hy3、GLM-5.2、Mimo-V2.5、DeepSeek V4-Pro 等
调用量份额以中国模型为绝对主体〔16〕
注:榜单为逐日波动数据,本图取 2026 年 8 月多次采样的稳定排序,具体位次以当日实时榜单为准〔16〕。
1.3 海外阵营盘点
厂商
近一年版本线
核心亮点
关键定价/约束
OpenAI 美国
GPT-5(25.08)→5.1(25.11)→5.2(25.12)→5.3/5.4(26.03)→5.6 Sol/Terra/Luna(26.07)〔1〕
Agent 与代码能力标杆;Codex 支持 100 万 token 上下文;Sol UltraFast 档位约 750 tok/s(2026-08)〔1〕〔19〕
Sol $5/$30、Terra $2/$12、Luna $0.20/$1.20(2026-07-30 起)〔1〕
Anthropic 美国
Claude Opus 4.6(26.02/04)→Opus 5(26-07-24)→Fable 5〔2〕
编程与长程任务可靠性口碑第一;安全对齐严格;2026-06 曾受美国出口管制影响暂停部分供应(范围待核实)〔2〕
Opus 5 $5/$25;Fable 5 $10/$50〔2〕
Google 美国
Gemini 3 Pro/Flash(25.11)→3.1 Pro/Deep Think(26.02)→3.5 Flash(26.05)→3.6 Flash/3.5 Flash-Lite(26-07-21)〔3〕
原生多模态最强;全档位 1M 上下文;Deep Think 深度推理模式为差异化亮点;3.5 Flash 约 289 tok/s〔3〕〔19〕
3.1 Pro $2/$12(超 200K 档 $4/$18);3.5 Flash $1.50/$9;3 Flash $0.50/$3;Flash-Lite $0.25/$1.50〔3〕
Meta 美国
Llama 4 Scout/Maverick → Llama 5(26-04-08)〔4〕
开源旗舰;约 600B 参数(估计值);500 万 token 上下文;采用 Recursive Self-Improvement 训练路线;另发布首个闭源模型 Muse Spark,开启「开源+闭源」双轨〔4〕
Llama 5 权重免费;Muse Spark 闭源 API〔4〕
xAI 美国
Grok 4.5(26-07-08)→Grok 4.6(26-08-12)〔5〕
长上下文与推理能力快速追赶;与 X 生态深度绑定,实时数据优势〔5〕
Grok 4.6 $2/$6,500K 上下文〔5〕
Mistral 法国
Mistral Large 3、Small 3.2、Voxtral TTS〔6〕
欧洲市场与 GDPR 合规标签;多语种表现突出;获约 €600M / 企业估值约 €6.5B 级融资(口径待核实)〔6〕
部分权重开源;API 中档定价〔6〕
1.4 国内阵营盘点
厂商
近一年版本线
核心亮点
关键定价/约束
DeepSeek 幻方
V3.1(25.08)→V3.2(25.12)→V4 预览(26.04)→V4-Pro/V4-Flash GA(26.07/08)〔7〕
国产开源标杆;V4-Pro 约 1.6T 总/49B 激活(估计值);V4-Flash 约 284B 总/13B 激活(估计值);100 万 token 上下文;MIT 许可全面开源;Harness 框架开发者预览〔7〕〔19〕
V4-Pro 峰谷定价:峰值 $1.32/$3.96,非峰 $0.66/$1.98(2026-08-17 起);人民币口径 ¥1.5–27(待核实)〔7〕
阿里 Qwen
Qwen3.5/3.6/3.7-Max → Qwen3.8-Max(26-08-03)〔8〕
Qwen3.8-Max 约 2.4T 总/95B 激活(估计值);2026-08-14 开源 Qwen3.8-27B(Apache 2.0),被部分评测称为「家用 Opus」;百炼平台生态完善〔8〕
Qwen3.6-Plus ¥2/¥12;Qwen3.8-Max 输入约 ¥12(口径待核实)〔8〕
月之暗面 Kimi
Kimi K2.5 → K2.6 → K2.7 Code → K3(26-07-16 发布、07-27 权重开源)〔9〕
K3 约 2.8T 总/104B 激活(估计值);1M 上下文;原生视觉;发布后 OpenRouter 日处理量一度达 64B token〔9〕
K3 输出约 ¥100/百万 token(约 $14,待核实)〔9〕
智谱 GLM
GLM-5.1(26.04)→GLM-5.2(26.06,743B)→GLM-5.3(26-08-14)〔10〕
GLM-5.1 为全球首个 8 小时持续工作开源模型(API 约 400 tok/s);GLM-5.3 以「后训练 Scaling」实现编程能力提升约 50%,CyberGym 安全评测 84.5%〔10〕
GLM API 约 $1.40/$4.40(2026 年中调价后)〔10〕
字节跳动 豆包
Seed 2.1 Pro/Turbo/Evolving(26-06-23);Seedance 2.5 / Seedream 5.0 / SeedRealtime(26-08-05)〔11〕
多模态全家桶(图/视频/实时语音);豆包生态日 Token 消耗约 180 万亿;规划 10T 参数模型(预训练阶段,估计值)〔11〕
低价策略,低端档约 ¥2/百万 token 量级(估计值)〔11〕
MiniMax
M2.x → M3(26-05-31)〔12〕
国内首个同时具备顶尖编程 + 1M 上下文 + 原生多模态的模型;Mavis、MiniMax Code 2.0 等应用层协同〔12〕
API 中档定价(待核实)〔12〕
百度 文心
文心 4.x → 5.0 → 5.1(26-05-09)〔13〕
LMArena 搜索榜国内第一、全球第四(1223 分);搜索+知识增强是差异化点〔13〕〔18〕
旗舰档约 ¥30/百万 token 量级(估计值)〔13〕
腾讯 混元
Hy 系列 → Hy3-preview(295B 参数)〔14〕
最高优先级任务成功率 99.99%;随中国大模型周调用量连续多周全球第一的供给生态(TokenHub 平台化迁移)〔14〕
低价策略,低端档约 ¥0.8/百万 token 量级(估计值)〔14〕
阶跃星辰
Step 3.x → Step 3.7 Flash(26.05)〔15〕
Agent OS、StepAudio 语音全栈;Pre-IPO 融资约 25 亿美元〔15〕
轻量档约 ¥2/百万 token 量级(估计值)〔15〕
二
总览对比 Master Comparison — 主流模型一览大表
下表为核心交付成果:截至 2026 年 8 月,覆盖国内外 19 款主流模型的版本线、上下文、能力标签、价格、开源情况与落地要点 。价格单位统一为美元/百万 token(输入/输出),开源模型标注许可证。
厂商/模型
版本线(近 1 年)
上下文
能力标签
价格 USD/百万token(输入/输出)
开源
企业落地要点
OpenAIGPT-5.6 Sol
GPT-5→5.1→5.2→5.3/5.4→5.6〔1〕
1M(Codex)
推理 Agent 代码
$5 / $30
闭源
Agent/代码天花板;ChatGPT Enterprise 生态成熟;注意数据出境与内容合规
OpenAIGPT-5.6 Luna
同 5.6 家族〔1〕
200K+
速度 成本
$0.20 / $1.20
闭源
高吞吐批处理与轻量对话;UltraFast 档约 750 tok/s
AnthropicClaude Opus 5
Opus 4.6→Opus 5〔2〕
200K+
代码 Agent 安全对齐
$5 / $25
闭源
工程代码与复杂任务标杆;2026-06 出口管制事件需关注供应链风险(待核实)
AnthropicClaude Fable 5
5 系创作旗舰〔2〕
200K+
创作 前沿
$10 / $50
闭源
品牌内容、创意生成等高端场景
GoogleGemini 3.6 Flash
3→3.1→3.5 Flash→3.6〔3〕
1M 全档位
多模态 长上下文
$1.50 / $9
闭源
1M 上下文下多模态处理成本最低档;Deep Think 模式适合深度分析
GoogleGemini 3.5 Flash-Lite
3 系轻量档〔3〕
1M
轻量 多模态
$0.25 / $1.50
闭源
超低成本多模态批处理;与 Workspace/Vertex 深度集成
MetaLlama 5
Llama 4→Llama 5(26-04-08)〔4〕
5M
开源旗舰 超长上下文
权重免费(算力另计)
开源(约 600B,估计值)
私有化部署与超长文档处理首选之一;RSI 训练路线后续版本值得跟踪
xAIGrok 4.6
Grok 4.5→4.6(26-08-12)〔5〕
500K
推理 长上下文
$2 / $6
闭源
X 生态实时数据场景;定价在海外旗舰中处于中低档
DeepSeekV4-Pro
V3.1→V3.2→V4 预览→GA〔7〕
1M
推理 中文 性价比
峰值 $1.32/$3.96;非峰 $0.66/$1.98
MIT 开源
国产私有化与高性价比首选;峰谷动态定价适合可调度负载;1.6T/49B(估计值)
DeepSeekV4-Flash
同 V4 家族〔7〕
1M
轻量高速 中文
约 $0.2/$0.8(待核实)
MIT 开源
高并发批量与实时场景;OpenRouter 日调用量长期位居全球前列〔16〕;284B/13B(估计值)
阿里Qwen3.8-Max
3.5/3.6/3.7-Max→3.8〔8〕
长文档
中文 多模态 代码
输入约 ¥12(约 $1.7,待核实)
闭源 API
国产 API 旗舰;百炼平台/千问办公生态完善;2.4T/95B(估计值)
阿里Qwen3.8-27B
26-08-14 开源〔8〕
128K+
轻量开源 中文
权重免费
Apache 2.0
「家用 Opus」口碑;中小企业私有化首选之一,可与 V4-Pro 搭配部署
月之暗面Kimi K3
K2.5→K2.6→K2.7 Code→K3〔9〕
1M
推理 原生视觉 长上下文
输出约 ¥100(约 $14,待核实)
权重开源(26-07-27)
长文档+图像理解一体;开源后社区部署活跃;2.8T/104B 激活(估计值)
智谱GLM-5.3
5.1→5.2(743B)→5.3〔10〕
200K+
代码 安全审计 Agent
约 $1.40 / $4.40
权重开源(5.1/5.2)
政务/安全合规场景;编程能力追平头部(+50%);CyberGym 84.5%〔10〕
字节Seed 2.1 Pro
Seed 2.1(26-06-23)〔11〕
长文档
多模态 视频/实时
约 ¥2(估计值)
闭源
豆包生态+火山引擎一体;内容创作、视频/实时对话场景;全生态日 Token 180 万亿〔11〕
MiniMaxM3
M2.x→M3(26-05-31)〔12〕
1M
代码 多模态 长上下文
待核实
闭源
国内首个「编程+1M+原生多模态」齐备模型;Agent 应用侧(Mavis 等)协同
百度文心 5.1
4.x→5.0→5.1(26-05-09)〔13〕
长文档
搜索 中文
约 ¥30(估计值)
闭源
搜索增强与知识检索场景;LMArena 搜索榜国内第一/全球第四(1223)〔13〕〔18〕
腾讯混元 Hy3-preview
Hy 系列→3-preview〔14〕
长文档
可靠性 低成本
约 ¥0.8(估计值)
闭源
企微/腾讯生态集成;高并发可靠性(最高优先级 99.99%);TokenHub 平台迁移〔14〕
阶跃Step 3.7 Flash
Step 3.x→3.7(26.05)〔15〕
长文档
Agent OS 语音
约 ¥2(估计值)
闭源
Agent 原生操作系统与语音交互(StepAudio);融资充沛,增长激进〔15〕
MistralLarge 3
Large 2→Large 3〔6〕
128K+
多语 欧洲合规
中档(待核实)
部分开源
欧洲/出海 GDPR 合规场景;多语种本地化需求〔6〕
注:价格口径不一,美元为厂商官方定价,人民币为国内公开渠道报价并按 1 USD≈7.2 CNY 折算(估计值);「估计值/待核实」数据详见附录声明。
读表要点: ① 上下文「1M」已在国产开源与 Gemini 全档位普及,成为企业长文档处理的门槛配置;② 价格带清晰分三层——海外旗舰($25–50 输出)、中美主力($2–12 输出)、轻量长尾($0.2–1.5 输出);③ 开源从「追赶者」变为「主力军」:DeepSeek V4 系(MIT)、Qwen3.8-27B(Apache 2.0)、Kimi K3、GLM-5.x、Llama 5 构成可私有化的完整梯队〔4〕〔7〕〔8〕〔9〕〔10〕。
三
能力对比 Capability — 六维雷达与分维度解读
3.1 六维能力雷达:四大代表模型
选取四个有代表性的模型(海外闭源×2、国产开源×2)做六维对比:推理、多模态、代码、长上下文、Agent 原生、中文/本土化 。雷达图分数为分析师基于 AA Intelligence Index、LMArena 与各厂商官方基准的定性合成(估计值,0–100) ,用于相对位置示意,不作绝对精度断言。
图 2|主流模型六维能力雷达(2026-08,估计值)
分数口径:推理/代码参考 AA Intelligence Index 与 LMArena;多模态参考官方多模态基准与社区实测;长上下文参考厂商声明上下文窗口;Agent 原生参考 agentic benchmark 与工具调用生态成熟度;中文/本土化参考中文基准与开源社区中文活跃度。均为分析师合成估计值
推理
多模态
代码
长上下文
Agent 原生
中文/本土化
GPT-5.6 Sol(海外闭源)
Claude Opus 5(海外闭源)
DeepSeek V4-Pro(国产开源)
Qwen3.8-Max(国产 API)
3.2 推理能力:闭源旗舰仍是天花板,国产开源逼近
AA Intelligence Index 等第三方综合评测显示,Claude Opus 5(63)、GPT-5.6 Sol(61)、Kimi K3(60)、Qwen3.8-Max(58) 位居第一集团〔17〕。Claude 与 GPT-5.6 在数学/科学/长程推理上保持领先,Kimi K3 与 DeepSeek V4-Pro 则证明「开源权重同样可以进入推理第一梯队」〔7〕〔9〕〔17〕。企业侧的实测差异主要集中在复杂多步任务的稳定性 ,而非单题正确率。
3.3 代码能力:从「补全」到「工程级 Agent」
代码已从「自动补全」演进为「仓库级工程任务」。Claude 系仍是工程代码口碑标杆〔2〕;OpenAI 通过 Codex 将 GPT-5.6 与 100 万 token 上下文结合,主攻大规模代码库重构〔1〕;国产侧 GLM-5.3 以「后训练 Scaling」实现编程能力提升约 50%,被社区认为已追平头部〔10〕;MiniMax M3 与 Kimi K2.7 Code 亦以代码能力切入〔9〕〔12〕。值得注意的是 Qwen3.8-27B 这类 30B 级小模型「以小博大」的破圈效应〔8〕——编程场景正从「堆参数」转向「工程化微调 + 长上下文」 。
3.4 多模态与长上下文:1M 成为标配,实时化是下一程
多模态端,Google Gemini 3.x 凭借原生全模态优势领先〔3〕;Kimi K3 将原生视觉融入 1M 上下文〔9〕;字节 Seed 生态(Seedream 5.0 图像、Seedance 2.5 视频、SeedRealtime 实时语音,2026-08-05 更新)代表「多模态全家桶」路线〔11〕。长上下文端,1M token 已是主流配置 ——DeepSeek V4 系、Kimi K3、Gemini 全档位均支持〔3〕〔7〕〔9〕;Llama 5 更将窗口拉到 500 万 token〔4〕。判断:单模态长文之争基本结束,下一分水岭是实时音视频多模态 〔11〕〔15〕。
3.5 Agent 原生:从「会聊天」到「能干活」
这是 2026 年最重要的能力迁移。海外以 OpenAI(深度研究、Codex Agent)与 Anthropic(长程自主任务)为标杆〔1〕〔2〕;国内以 GLM-5.1 的「8 小时持续工作」开源模型、阶跃的 Agent OS 为代表〔10〕〔15〕。企业选型时,「工具调用成功率、多步任务完成率、可观测性」已取代单项 benchmark 成为核心指标 ;GLM-5.3 的 CyberGym 84.5% 与腾讯混元 99.99% 高优先级成功率,均为 Agent 可靠性竞争的直接体现〔10〕〔14〕。
分析师判断: 能力维度上,国产与海外的差距已从「12–18 个月」收敛到「6 个月左右」,且仅在极少数前沿任务(超长程自主 Agent、前沿数学)仍落后约半代〔7〕〔8〕〔9〕〔17〕;而在中文理解、本土知识、开源生态 三项上,国产模型已实现明确反超〔16〕〔17〕。对企业而言,「能力够不够用」的问题基本解决,「哪家更便宜、更好落地、更好合规」成为新的决策轴 。
四
价格与性价比 Pricing & Value — 降价曲线与「能力—价格」象限
4.1 一年降价曲线:每百万 token 输出价的下探轨迹
近一年价格变化的量级可以用三条线概括:海外旗舰输出价 从约 $60 级降至 $12–30 级〔1〕〔2〕;轻量档 低至 $0.2–1.5(GPT-5.6 Luna、Gemini Flash-Lite)〔1〕〔3〕;国内低端主力 已降到每百万 token 0.8–2 元人民币,旗舰级为 20–100 元〔8〕〔9〕〔14〕。换算后,头部模型的单位智能成本一年内下降约一个数量级〔1〕〔7〕〔8〕〔20〕。
图 3|能力—价格象限(2026-08)
X 轴为综合能力指数(评测合成,估计值);Y 轴为输出价格(美元/百万 token,对数刻度)。开源模型按「权重免费、算力另计」置于底部。价格为公开渠道报价,口径分歧见附录
高价低能 · 谨慎评估
旗舰级 · 能力天花板(海外闭源)
轻量 / 批量任务区
性价比主场 · 国产模型集中
$60
$10
$1
$0.1
综合能力指数(估计值)→
输出价格(USD/百万token,对数)
45 50 55 60 65
GPT-5.6 Sol
$30
Opus 5 $25
Fable 5 $50
Gemini 3.6 $9
Gemini 3 $3
Flash-Lite $1.5
Grok 4.6 $6
Llama 5 开源
DeepSeek V4-Pro
$0.66–1.32/$1.98–3.96
V4-Flash $0.4
Qwen3.8-Max
约 $1.7
Qwen3.8-27B 开源
Kimi K3
约 $14
GLM-5.3 $4.4
Seed 2.1 约$0.3
MiniMax M3
文心5.1 约$4
混元 Hy3 约$0.11
Mistral L3
海外闭源/API
国内闭源/API
开源权重(可私有化)
4.2 三个定价结构性变化
峰谷动态定价出现 :DeepSeek 自 2026-08-17 起按「峰值/非峰值」分时计价(V4-Pro 峰值 $1.32/$3.96,非峰值 $0.66/$1.98),首次把「电网峰谷」逻辑引入推理市场,为可调度负载企业提供明确的省钱空间〔7〕。
「旗舰-通用-轻量」三层价格阶梯成为行业标准 :OpenAI 的 Sol/Terra/Luna 结构($5/$30、$2/$12、$0.20/$1.20)与 Google 的 Pro/Flash/Flash-Lite 结构,把「按任务复杂度选档位」变成企业预算常态〔1〕〔3〕。
开源把边际调用成本打到接近零 :MIT/Apache 权重免费 + 私有化部署,长期边际成本仅剩算力;对数据敏感、调用量大的企业,开源+自部署的 TCO 显著低于按量付费〔7〕〔8〕〔10〕。
价格口径提醒: 国内厂商以人民币/百万 token 计价,海外以美元计价,本报告统一按 1 USD≈7.2 CNY 折算(估计值,2026-08)。部分来源间存在明显分歧——例如 DeepSeek 峰谷定价的人民币换算(¥1.5–27 区间)与 Gemini 3.1 Pro 定价($2/$12 预览价 vs 个别来源 $1.25/$10),已按来源分别标注「待核实」,引用时请回到官方定价页复核〔3〕〔7〕〔20〕。
五
开源 vs 闭源 Open vs Closed — 格局、趋势与选择逻辑
5.1 阵营盘点
阵营
代表模型
核心特征
典型适用场景
开源权重
DeepSeek V4-Pro/V4-Flash(MIT)、Qwen3.8-27B(Apache 2.0)、GLM-5.1/5.2/5.3(权重开源)、Kimi K3(权重开源)、Llama 5〔4〕〔7〕〔8〕〔9〕〔10〕
权重免费、可私有化、社区生态活跃;中文友好;边际调用成本≈算力成本〔7〕〔8〕
数据敏感场景(金融/政务/医疗)、高并发自部署、二次微调基座、成本敏感长跑负载〔7〕〔10〕
闭源/托管 API
OpenAI GPT-5.6 系、Anthropic Claude Opus 5、Google Gemini 3.x、xAI Grok 4.6、豆包 Seed 2.1、文心 5.1、混元 Hy3、MiniMax M3、阶跃 Step 3.7〔1〕〔2〕〔3〕〔5〕〔11〕〔12〕〔13〕〔14〕〔15〕
能力上限高、产品/Agent 生态完整、托管免运维;价格按量付费、弹性好〔1〕〔3〕
追求能力天花板、快速上线验证、无强数据出境约束、依赖厂商生态(Office/云/办公套件)〔1〕〔2〕〔3〕
5.2 趋势判断
双轨并行成为定局 :Meta 从纯开源转向「开源 Llama + 闭源 Muse Spark」双轨〔4〕;月之暗面 K3 权重开源但托管 API 商业化〔9〕;DeepSeek 全开源但提供托管服务〔7〕——「开源打生态、闭源做收入」是共同剧本。
国产开源已进入全球第一梯队 :DeepSeek V4-Pro 与 Kimi K3 的权重质量,配合 OpenRouter 上中国模型的主导调用量,证明开源不再只是「追赶者」〔7〕〔9〕〔16〕。
许可证分层细化 :MIT/Apache 2.0(可商用可闭源衍生)成为主流,但「开放权重 ≠ 完全开放训练数据」,企业做合规审查时需逐项核对衍生条款〔7〕〔8〕。
对企业的选择逻辑: 私域数据敏感 → 开源私有化优先(DeepSeek V4 / Qwen3.8-27B / GLM-5.x);追求能力天花板且数据可出境 → 闭源 API 旗舰(GPT-5.6 / Opus 5 / Gemini);多数企业的最优解是「开源底座 + 闭源增强」的混合架构 ,并在中间层抽象模型接口、避免厂商锁定。
六
生态与企业落地适配 Ecosystem & Adoption — 平台生态与行业适配
6.1 六大平台生态
OpenAI
ChatGPT / ChatGPT Enterprise / API 生态最完整,Agent 工具链(Codex、深度研究)最成熟〔1〕
Microsoft/Azure
Azure OpenAI + Copilot + 365 全家桶,是微软体系企业的默认路径〔1〕
Google
Workspace / Vertex AI / Gemini 深度集成,1M 上下文多模态性价比突出〔3〕
阿里云百炼
Qwen 系列 + 千问办公,国产 API 基础设施最完善之一,行业模型广场丰富〔8〕
字节火山引擎
Seed 生态 + 豆包 + 飞书,内容与实时多模态场景供给最强〔11〕
腾讯/百度
混元+TokenHub、文心+千帆,分别绑定企微生态与搜索/知识图谱能力〔13〕〔14〕
6.2 行业落地适配速览
行业/场景
推荐模型组合
理由与要点
金融 / 政务
GLM-5.3、文心 5.1、混元 Hy3(私有化/备案生态)〔10〕〔13〕〔14〕
数据不出域优先;GLM 安全审计(CyberGym 84.5%)与国产备案生态匹配强监管;混元 99.99% 高优先级成功率适合交易类高可靠场景〔10〕〔14〕
制造 / 能源
DeepSeek V4-Pro、Qwen3.8-27B(私有化)〔7〕〔8〕
知识库问答、工艺文档、质检多模态需私有化;开源权重 + 本地算力 TCO 最优;中文工程术语表现国产领先〔7〕〔8〕
出海业务
GPT-5.6、Claude Opus 5、Gemini 3.x、Mistral Large 3〔1〕〔2〕〔3〕〔6〕
目标市场语言与合规(如欧盟 GDPR → Mistral/欧洲节点)优先;海外闭源旗舰英文与本地化质量最高〔6〕
内容 / 营销 / 消费
豆包 Seed 2.1、阶跃 Step 3.7、Gemini 3.5 Flash〔3〕〔11〕〔15〕
视频/图像/实时语音多模态供给最强;按量弹性成本低;Agent OS 支持营销自动化流水线〔11〕〔15〕
软件研发 / 代码工程
Claude Opus 5、GPT-5.6+Codex、GLM-5.3、MiniMax M3〔1〕〔2〕〔10〕〔12〕
仓库级重构与复杂任务选 Claude/GPT-5.6;工程化微调与成本敏感选 GLM-5.3/M3;1M 上下文利于大仓库分析〔1〕〔2〕〔10〕〔12〕
分析师判断: 生态竞争的终局不是「谁的模型最强」,而是「谁的模型 + 平台 + 行业方案离业务最近」 。对企业而言,模型选型必须放在「数据合规、私有化需求、现有技术栈、Agent 工作流、锁定风险」五个约束下决策——这也是 AICOR 在选型咨询与落地交付中的方法论抓手。
七
近一年关键迭代时间线 Timeline — 2025.08 — 2026.08
7.1 海外主线
2025 年 8 月 7 日
OpenAI 发布 GPT-5
新一代旗舰,被视为本轮能力代际加速的起点〔1〕。
来源〔1〕
2025 年 11 月
Google 发布 Gemini 3 Pro / Flash;OpenAI 发布 GPT-5.1
Gemini 3 确立原生多模态路线;OpenAI 进入月度快速迭代节奏〔1〕〔3〕。
来源〔1〕〔3〕
2025 年 12 月
OpenAI 发布 GPT-5.2
推理与工具调用继续增强〔1〕。
来源〔1〕
2026 年 2 月
Google 发布 Gemini 3.1 Pro 与 Deep Think 模式;Anthropic 迭代 Claude Opus 4.6
深度推理成为差异化竞争点〔2〕〔3〕。
来源〔2〕〔3〕
2026 年 3 月
OpenAI 发布 GPT-5.3 / 5.4
多模态与 Agent 能力持续增强〔1〕。
来源〔1〕
2026 年 4 月 8 日
Meta 开源 Llama 5(约 600B,5M 上下文,RSI 训练);并发布首个闭源模型 Muse Spark
开源侧最大事件之一;Meta 开启「开源+闭源」双轨〔4〕。
来源〔4〕
2026 年 5 月
Google 发布 Gemini 3.5 Flash(约 289 tok/s)
速度与成本并重的 Flash 档位持续下探〔3〕。
来源〔3〕
2026 年 6 月
Anthropic 因美国出口管制暂时中止向部分市场供应(范围待核实);Claude Fable 5 发布
供应链风险首次成为企业选型考量项〔2〕。
来源〔2〕
2026 年 7 月 8 日
xAI 发布 Grok 4.5
长上下文与推理能力快速追赶〔5〕。
来源〔5〕
2026 年 7 月 24 日
Anthropic 发布 Claude Opus 5($5/$25)
编程与 Agent 可靠性标杆的新一代〔2〕。
来源〔2〕
2026 年 7 月 30 日
OpenAI 发布 GPT-5.6 Sol / Terra / Luna($5/$30、$2/$12、$0.20/$1.20)
三层价格结构成为行业标准;Luna 将轻量档输出价打到 $1.2〔1〕。
来源〔1〕
2026 年 8 月 12 日
xAI 发布 Grok 4.6($2/$6,500K 上下文)
海外一线模型 500K 级上下文成为常见配置〔5〕。
来源〔5〕
7.2 国内主线
2025 年 8 月
DeepSeek 发布 V3.1
国产开源模型进入高频迭代通道〔7〕。
来源〔7〕
2025 年 12 月
DeepSeek 发布 V3.2
推理能力与长上下文持续增强〔7〕。
来源〔7〕
2026 年 4 月
DeepSeek V4 预览;智谱发布 GLM-5.1(首个 8 小时持续工作开源模型)
国产模型在 Agent 长程任务上率先发力〔7〕〔10〕。
来源〔7〕〔10〕
2026 年 5 月 9 日
百度发布文心 5.1
LMArena 搜索榜国内第一、全球第四(1223)〔13〕〔18〕。
来源〔13〕〔18〕
2026 年 5 月 31 日
MiniMax 发布 M3
国内首个同时具备顶尖编程 + 1M 上下文 + 原生多模态的模型〔12〕。
来源〔12〕
2026 年 6 月 23 日
字节发布 Seed 2.1 Pro / Turbo / Evolving
豆包生态进入多模型矩阵时代〔11〕。
来源〔11〕
2026 年 6 月
智谱发布 GLM-5.2(743B)
国产开源模型规模再上台阶〔10〕。
来源〔10〕
2026 年 7 月 16 日 / 7 月 27 日
月之暗面发布 Kimi K3(2.8T/104B 激活,1M,原生视觉),7 月 27 日权重开源
国产开源进入全球第一梯队的标志性事件;OpenRouter 日处理量一度达 64B token〔9〕。
来源〔9〕〔16〕
2026 年 7—8 月
DeepSeek V4-Pro / V4-Flash 正式发布并全面开源(MIT,1M 上下文)
国产开源旗舰的完整交付;Harness 框架同步提供开发者预览〔7〕。
来源〔7〕
2026 年 8 月 3 日
阿里发布 Qwen3.8-Max(2.4T/95B 激活,估计值)
国产 API 旗舰的迭代顶点〔8〕。
来源〔8〕
2026 年 8 月 12—14 日
智谱发布 GLM-5.3;阿里开源 Qwen3.8-27B(Apache 2.0)
GLM-5.3 后训练 Scaling 令编程能力提升约 50%;Qwen3.8-27B 被称为「家用 Opus」〔8〕〔10〕。
来源〔8〕〔10〕
2026 年 8 月 17 日
DeepSeek 启动峰谷动态定价
推理市场首次出现「电网式」分时计价,为可调度负载提供省钱路径〔7〕。
来源〔7〕
八
企业选型建议 Selection Guide — AICOR 视角(能力—成本—合规—生态)
以下 6 条建议按 AICOR 的「能力—成本—合规—生态」四轴选型框架给出,覆盖不同企业画像;没有「最好的模型」,只有「最合适的组合」 。
1
数据敏感 / 强合规场景:开源私有化优先(金融、政务、医疗、央国企)
首选 DeepSeek V4-Pro(MIT,1M 上下文)与 Qwen3.8-27B(Apache 2.0,轻量可微调),辅以 GLM-5.3(安全审计 CyberGym 84.5%)做高安全要求子场景〔7〕〔8〕〔10〕。数据不出域、可审计、无按量成本累积;注意私有化算力预算与运维人力是一次性投入〔7〕。
2
追求能力天花板且数据可出境:闭源旗舰双选(OpenAI + Anthropic)
Agent 与代码工程选 Claude Opus 5,深度研究与复杂推理选 GPT-5.6 Sol;两者能力互有长短,建议双供应商运行并对结果做交叉校验〔1〕〔2〕。必须评估 Anthropic 出口管制等供应链风险与内容合规边界〔2〕。
3
成本敏感 / 高并发 / 峰值弹性:善用峰谷定价与轻量档
批量任务、离线清洗、非峰推理切到 DeepSeek V4 非峰值时段(省约 50%)〔7〕;轻量对话与高吞吐批处理用 GPT-5.6 Luna($0.20/$1.20)或 Gemini 3.5 Flash-Lite($0.25/$1.50)〔1〕〔3〕;国内低价长尾可用豆包/混元档位(约 ¥0.8–2/百万 token,估计值)〔11〕〔14〕。
4
长文档 / 多模态 / 实时交互:按形态分档选型
长文本与多模态一体的文档处理选 Gemini 3.x(全档 1M)或 Kimi K3(原生视觉 + 1M)〔3〕〔9〕;超长语料(百万级 token 以上)考虑 Llama 5(5M 窗口)的私有化方案〔4〕;视频/实时语音场景用豆包 Seed 生态与阶跃 Step 3.7(Agent OS + StepAudio)〔11〕〔15〕。
5
避免供应商锁定:模型层抽象为可替换接口
把推理接入层统一为「路由 + 缓存 + 兜底」架构:主模型挂一个,备选与降级模型挂一个,按成本/质量/可用性动态路由。开源权重做基座(DeepSeek/Qwen/Llama),闭源 API 做增强(GPT-5.6/Opus 5/Gemini),迁移成本几乎为零——这是应对「模型季度换代 + 价格波动」最有效的工程手段〔1〕〔7〕〔8〕。
6
把选型放进「组织落地」闭环:先定场景与度量,再定模型
近一年数据反复证明,选错场景比选错模型更致命。建议以「任务级验收」(工具调用成功率、多步任务完成率、ROI 回收期)而非单项 benchmark 选型〔10〕〔14〕〔17〕;由懂业务的交付方(如 AICOR FDE 团队)完成「场景盘点 → 模型组合设计 → 试点度量 → 规模化」闭环,避免「模型天花板很高、业务价值很低」的错配〔1〕〔2〕〔7〕。
选型决策速查(AICOR 四轴): ① 能力轴——按任务类型对照雷达图六维;② 成本轴——按负载可调度性选峰谷/轻量档;③ 合规轴——按数据出境与备案要求选私有化/国产;④ 生态轴——按现有技术栈(云、办公、协作)选平台。四轴同时打分,取组合而非单点最优。
九
结论与 2026 年判断 Conclusions & Outlook
9.1 五点结论
三梯队收敛,能力差压缩至 6 个月左右 :国产一线与海外旗舰的单点能力差距明显收窄,仅在超长程自主 Agent、前沿数学等极少数任务上落后约半代〔7〕〔8〕〔9〕〔17〕。
价格战已从营销手段变成市场出清机制 :一年内单位智能成本下降约一个数量级,峰谷定价、三层价格阶梯把「按任务复杂度与时间调度负载」变成预算常态〔1〕〔3〕〔7〕。
开源与闭源双轨并行,且开源已进入第一梯队 :DeepSeek V4 系(MIT)、Kimi K3、Qwen3.8-27B(Apache 2.0)、Llama 5 构成可私有化的完整梯队;Meta 的「开源+闭源」双轨成为行业模板〔4〕〔7〕〔8〕〔9〕。
1M 长上下文 + Agent 原生成为新护城河 :上下文窗口是「能处理什么」,Agent 原生是「能完成什么」;企业评估体系正在从 benchmark 转向任务成功率〔3〕〔7〕〔9〕〔10〕。
中国模型在中文、性价比、开源生态三项领先 :OpenRouter 日调用量前十中 6 席为中国模型,中国大模型周调用量连续多周全球第一〔14〕〔16〕。
9.2 2026 下半年与 2027 展望
推理需求爆发与「Token 计量」精细化 :动态定价、缓存命中定价、批处理折扣将普及,企业成本结构从「按模型」转向「按任务形态」〔7〕。
Agent 评估体系建立 :行业将围绕「任务成功率、可观测性、人机边界」形成新评测标准,GLM 8 小时持续工作、混元 99.99% 可靠性等指标会越来越多出现在采购要求中〔10〕〔14〕。
多模态实时化进入生产 :实时音视频(SeedRealtime、StepAudio 等)从演示走向客服、会议、内容生产等真实业务〔11〕〔15〕。
开源继续下探、旗舰继续上探 :10–30B 级轻量开源模型将覆盖端侧与私有化长尾;旗舰闭源则在「超长程自主任务」(数小时级 Agent)上竞争〔1〕〔2〕〔8〕。
「选型→落地」缺口扩大,服务成为新增长极 :模型同质化后,企业缺的不是模型而是「场景适配 + 组织变革 + 度量体系」——这直接放大了 AICOR「企业 AI 重构 + 人机协同组织」的战略空位〔10〕〔14〕。
一句话总结: 模型已成为「水电」,但把水电变成产值靠的是工程与组织。2026 下半年的竞争主战场,将从「模型厂商之间的榜单竞赛」,切换到「企业一侧的选型组合与落地效率」 ——这正是 AICOR 以「能力—成本—合规—生态」四轴选型框架 + “FDE”交付体系切入的确定性窗口。
附
数据来源清单与估计值声明 Appendix — Sources & Estimates
数据来源清单(检索时间:2026 年 8 月 19 日,共 10 轮关键词检索)
OpenAI 官方发布与定价公告、开发者文档(GPT-5 至 GPT-5.6 Sol/Terra/Luna 定价、Codex 100 万 token 上下文、UltraFast 档位)
Anthropic 官方发布及 The Information、Reuters 等编译报道(Claude Opus 4.6 / Opus 5 / Fable 5 定价、2026-06 出口管制暂停)
Google DeepMind 官方发布与定价页(Gemini 3 / 3.1 Pro+Deep Think / 3.5 Flash / 3.6 Flash / Flash-Lite 定价、1M 上下文、约 289 tok/s)
Meta 官方发布及编译报道(Llama 5 约 600B、5M 上下文、RSI 训练、Muse Spark 闭源化)
xAI 官方发布(Grok 4.5 / 4.6 定价、500K 上下文)
Mistral 官方发布及 TechCrunch、EU-Startups 等报道(Large 3、Small 3.2、Voxtral TTS、欧盟融资规模)
DeepSeek 官方发布、GitHub/HuggingFace 仓库与 API 定价页(V3.1/V3.2/V4 预览/V4-Pro/V4-Flash、MIT 开源、1M 上下文、峰谷定价 2026-08-17、Harness 框架)
阿里云 Qwen 官方与通义千问百炼(Qwen3.8-Max、Qwen3.8-27B Apache 2.0 开源、Qwen3.6-Plus 定价、「家用 Opus」社区评价)
月之暗面官方发布及编译报道(Kimi K2.5→K3、权重开源、1M、原生视觉、OpenRouter 日 64B token)
智谱 AI 官方发布(GLM-5.1 8 小时持续工作 / 5.2 / 5.3、编程能力 +50%、CyberGym 84.5%、API 定价)
字节跳动火山引擎/豆包官方发布(Seed 2.1 系列、日 Token 消耗 180 万亿、Seedream 5.0/Seedance 2.5/SeedRealtime、10T 参数规划)
MiniMax 官方发布(M3 编程+1M+原生多模态)
百度官方发布与 LMArena 榜单(文心 5.1、搜索榜 1223 分、国内第一/全球第四)
腾讯官方发布与行业周报(混元 Hy3-preview 295B、99.99% 成功率、TokenHub 迁移、中国大模型周调用量连续多周全球第一)
阶跃星辰官方发布及投资媒体报道(Step 3.7 Flash、Agent OS、StepAudio、Pre-IPO 约 25 亿美元融资)
OpenRouter 公开调用数据与每日榜单(前十国别分布、Kimi K3 日处理量)
AA Intelligence Index 第三方综合评测(Claude Opus 5 63、GPT-5.6 Sol 61、Kimi K3 60、Qwen3.8-Max 58)
LMArena 官方 Elo 榜单(文心 5.1 搜索榜位次等)
各厂商技术文档与博客(Codex 上下文、Sol UltraFast 速度、Gemini Deep Think、DeepSeek Harness 等)
行业编译报道(价格战综述、国产替代与全球格局、汇率口径说明)
估计值 / 待核实数据声明
以下数字或来自单一来源转述、或官方未完整披露、或不同口径换算存在分歧,本报告保留但明确标注,引用时请谨慎:
各模型参数量(DeepSeek V4-Pro 1.6T/49B、V4-Flash 284B/13B、Qwen3.8-Max 2.4T/95B、Kimi K3 2.8T/104B、Llama 5 约 600B)为厂商或社区披露口径,未逐一独立核实
DeepSeek 峰谷定价人民币换算(¥1.5–27 区间)与美元报价($0.66–3.96)存在口径分歧,以官方定价页为准
Gemini 3.1 Pro 定价($2/$12 预览价 vs 个别来源 $1.25/$10)存在分歧,以官方定价页为准
豆包 Seed 2.1、混元 Hy3、文心 5.1、阶跃 Step 3.7 的国内人民币报价为渠道转述估计值(约 ¥0.8–30 量级)
Kimi K3 输出 ¥100/百万 token、Qwen3.8-Max 输入约 ¥12、MiniMax M3 与 Mistral Large 3 定价待官方确认
Anthropic 2026-06 出口管制暂停的具体市场范围与持续时间未获官方完整披露
AA Intelligence Index 六维雷达分数与图 3 能力指数为分析师基于公开评测的合成估计值,非单一权威数据
字节 10T 参数模型规划处于预训练阶段,规模与时间表均为估计值
汇率 1 USD≈7.2 CNY 为 2026-08 市场参考价(估计值),实际结算以银行牌价为准
← 返回咨询报告列表