数据截至 2026 年 8 月,来源为各厂商官方定价页及 Epoch AI、a16z、Silicon Data、Jefferies、摩根士丹利、高盛等公开研究,并参考腾讯新闻、人民网、证券日报、21世纪经济报道等媒体报道。文中价格均为公开刊例价,不含限时优惠与新用户免费额度。
引言:一场发生在三年内的"通货紧缩"
AI 在过去三年便宜了 1000 倍。但就在 2026 年,市场却出现了最反常识的一幕:带头降价的那家"价格屠夫",反而率先涨价了。
如果用一个词概括过去三年 AI 大模型最戏剧性的变化,不是"智能变强了",而是"变便宜了"。
GPT-4 在 2023 年 3 月发布时,输入价格为每百万 token 30 美元、输出 60 美元。三年后的 2026 年,同等甚至更强能力的模型,输入价格已降至 1 至 2 美元区间。Epoch AI 的追踪数据显示,同等能力水平的 AI 推理成本自 2023 年初以来以大约每年 10 倍的速度下降——这个速度超过了历史上摩尔定律的轨迹。
更直观的数字来自 a16z 的"LLMflation"研究:以"能稳定完成某项固定任务的最低成本"为锚,AI 在 2021 至 2026 年间大约变便宜了 1000 倍。换句话说,2021 年花 8000 美元/月才能跑起来的功能(按当时 GPT-3 级别 $60/百万 token 计算),今天只需要 8 美元。
但价格战的故事远没有"越来越便宜"这么简单。2026 年,市场出现了两个反常的信号:
一边是 DeepSeek 等中国厂商集体涨价——8 月 17 日 DeepSeek 引入峰谷定价,部分接口涨幅最高达 1100%;
另一边是 OpenAI、Anthropic、谷歌集体降价——OpenAI 把轻量模型砍了 80%,谷歌把 Gemini 3.7 Flash 直接打五折。
一涨一跌,构成了 2026 年 AI 市场最耐人寻味的一幕。这篇文章要回答三个问题:价格为什么降?为什么又涨?这场价格战最终会走向哪里?
一、三年价格崩塌:一组必须记住的数字
价格的变化不是线性的,而是分阶段、加速度式的。
1.1 前沿模型:三年内 12 倍降幅
三年间,前沿模型的输入价格从 30 美元降到 2 至 4 美元区间,降幅约 12 倍。关键在于:能力在变强的同时,价格还在降。
1.2 预算层级:三年 99% 降幅,已跌破 1 美元
预算层级的降幅更加惊人。Google 的 Gemini 1.5 Flash 在 2024 年中首次跌破 1 美元大关,而到了 2026 年,Gemini Flash-Lite 已降至 0.25 美元,中国厂商的 GLM-4.7 甚至低至 0.11 美元。
1.3 中国市场:一个反常的"V型"
中国市场的价格走势最为复杂,呈现出一个明显的 V 型:
2025 年:暴跌。 某头部平台率先将百万 token 价格从行业均价 50 元压降至 0.3 元,全行业价格平均下降约 87%。2025 年一季度,中国主流大模型 API 平均输入价约 3.3 元/百万 token,输出价约 12.2 元。
2026 年:回升。 摩根士丹利数据显示,2026 年二季度,中国主流大模型平均输入价升至 4.9 元(涨幅 48%),输出价升至 21.9 元(涨幅 80%)。
也就是说,中国市场的价格底部出现在 2025 年,2026 年已经明确抬头。这为后文"K型分化"的讨论埋下了伏笔。
二、为什么价格会降:四大结构性驱动
降价不是厂商的"善心",而是成本结构真的变了。拆开看,有四重引擎在把成本砸下来——硬件、架构、规模、开源,四股力量叠加、互相加速。
2.1 引擎一:硬件性能的指数增长
英伟达 GPU 每代产品的推理性能提升 2—4 倍,而价格涨幅远小于性能增幅。以 H200 到 B200 为例:推理性能提升约 3 倍,单卡价格却只从约 3.5 万美元涨到约 4.2 万美元(涨 20%)。折算下来,单 Token 推理的硬件成本一年内下降约 60%。
更关键的是,Blackwell 的"每瓦吞吐"相比 Hopper 提升了约 50 倍——这意味着在同样的电力约束下,可以跑出 50 倍更多的 token。而电力,恰恰是 2026 年数据中心最紧的约束。NVIDIA 的 B200 在 GPT-OSS-120B 上的单位 token 成本,从发布时的 $0.11 降至 2026 年 4 月的 $0.02,其中相当一部分纯粹来自软件优化,无需更换硬件。
2.2 引擎二:架构与推理优化的"技术红利"
这是国产厂商逆势降价的真正杀手锏,也是本轮降价的第二重引擎。几项关键技术:
MoE(混合专家)架构:DeepSeek V4-Flash 总参数 2840 亿,但单 Token 仅激活约 130 亿参数——"养了一群专家,每次只让最相关的会诊",把每次推理的实际计算量压到极致。传统稠密模型每次推理要激活全部参数,MoE 改变了这一逻辑:模型把庞大的参数拆成多个"专家"子网络,通过一个"门控网络"为每个 token 动态选择最相关的 1—2 个专家,其余 90% 以上参数保持静默。模型可以更大,但每个 token 的推理成本不跟着涨。据英伟达统计,2026 年开源模型发布中超过 60% 采用 MoE 设计。
多级缓存调度:小米自研 HiCache 方案,把 KV 缓存在 GPU 显存、CPU 内存、固态硬盘三级存储间的数据迁移量压缩到原来的 1/7,可长效缓存的 Token 容量提升 5 倍。
缓存命中折扣:DeepSeek 提供约 98% 的缓存命中折扣——命中缓存的 Token 仅按标价 2% 计费,远超业内普遍的 90% 折扣水平。这是"百万 Token 输入仅 0.0028 美元、近乎免费"的直接来源。
稀疏注意力 + KV 缓存压缩:DeepSeek V4 处理十万级至百万级超长上下文时,算力资源消耗仅为上一代的 27%,KV 缓存显存占用压缩 90%。
量化与推测解码:FP16→INT4/INT8 量化、投机解码、批处理优化等技术,再把推理成本压低 50%—80%。
小米官方披露:正是依托三级存储缓存方案压缩数据迁移成本,MiMo 才能实现"部分场景降价 99%"。算法优化与工程效率,已经取代"堆硬件"成为新的成本壁垒。
2.3 引擎三:规模效应的摊薄
当 API 调用量从百万级增长到万亿级,研发、运维、基础设施等固定成本被巨大流量摊薄。OpenAI 2026 年 Q1 API 调用量同比增长 340%;DeepSeek V4-Flash 发布后迅速放量,据第三方聚合平台 OpenRouter 数据,2026 年 8 月 3—7 日当周其新旧版本调用量合计达 11.31 万亿 Token。调用量越大,单位成本越低,降价空间越大——这是一个自我强化的飞轮。
同时,两项优化技术进一步压低了"有效成本":提示缓存(Anthropic 对缓存输入收 90% 折扣,OpenAI 收 50% 折扣)与批量处理(三家巨头对异步批量推理都提供 50% 折扣)。对于每天调用数千次、系统 prompt 超过 2 万 token 的应用,仅缓存一项就能把有效输入成本降低 60—75%;两者叠加,有效推理成本可降至刊例价的 10—20%。
2.4 引擎四:开源模型形成的"价格天花板"
这是最容易被忽视、却可能是最根本的一重力量。DeepSeek、阿里(Qwen)、月之暗面(Kimi)都发布了开放权重模型,任何人都可以自行托管、免费商用。
开放权重直接限制了任何闭源 API 的定价上限——即使是最顶级的美国模型,也必须与一个"免费或近乎免费"的外部选项竞争。 这正是杰富瑞分析师所说的:OpenAI 和 Anthropic 的降价,本质上是"开放权重模型形成价格天花板"的市场结果,而非厂商的主动选择。
这一力量也解释了竞争的白热化。2023 年初,OpenAI 几乎独享前沿市场;到 2024 年底,至少有六家供应商拥有前沿级模型:OpenAI、Anthropic、Google、DeepSeek、Mistral、Meta。当一家厂商以 1/100 的价格提供相近质量,其他厂商的利润就会蒸发。这不是循环性波动,而是结构性坍塌——正如 FAQ.com.tw 的分析所言,"the collapse is structural, not cyclical"。
三、2026 年的反常:从"越来越便宜"到 K 型分化
四大引擎把价格一路砸到底——如果故事到此为止,结论就是"AI 只会越来越便宜"。但 2026 年出现了两个反常信号,让这条单向曲线的叙事被彻底打破。
3.1 中国厂商集体涨价
2026 年,中国大模型市场出现了一轮集体涨价:
DeepSeek 的涨价尤为引人注目——它一直扮演"价格屠夫"的角色,2024 年 5 月以 1 元/百万 token 引爆价格战,现在 V4-Pro 高峰输出价到了 27 元,用户自然产生反差。
但涨价背后有清晰的逻辑:
能力追平,定价权回归。 DeepSeek V4 Flash 在 Artificial Analysis 智能指数上拿到 50 分,仅比 GPT-5.6 Luna 的 51 分低 1 分。当能力不再显著落后,厂商就有底气为能力定价。
需求爆发,算力刚性。 DeepSeek V4-Flash 在 OpenCode 平台单日 token 消耗从 3 万亿暴涨至 18 万亿,仅一个渠道就占用约 7000 张 H100 GPU。低价模式难以为继。
商业模式转型。 从"烧钱换规模"转向"商业可持续"。智谱 CEO 张鹏曾表示,2026 年一季度 API 调用定价提升 83%,市场依然供不应求,调用量增长 400%。
3.2 美国厂商集体降价
几乎同一时间,美国厂商走向了相反的方向:
OpenAI:7 月 30 日对 GPT-5.6 系列结构性调价——轻量级 Luna 价格猛砍 80%(输入从 1 美元降至 0.2 美元),中端 Terra 降价 20%;8 月 21 日再将旗舰 Sol 基准价下调逾 20%,输入降至 4 美元、输出降至 20 美元。
Anthropic:取消了 Claude Sonnet 5 原定 9 月生效的 50% 涨价计划。
谷歌:8 月 13 日发布 Gemini 3.7 Flash,输入仅 0.75 美元、输出 3.75 美元,约为上一版本的一半,限时优惠价持续数月。
3.3 为什么一涨一跌?——定价权正在东移
中美厂商的反向操作,折射出全球 AI 产业权力结构的重写。
OpenAI 的降价是防守。 CNBC 调查显示,以 DeepSeek、Kimi 为代表的中国模型已拿下 OpenRouter 平台美国企业 token 用量的 46%,部分时段甚至反超美国模型;Qwen 过去六个月全球下载量突破 30 亿次,超过 Meta 和谷歌成为全球第一;Ramp 的账单数据显示,DeepSeek 在 2026 年 6 月登顶美国企业软件趋势榜。
当"能力接近、价格悬殊"成为常态,全球开发者会用脚投票。OpenAI 已秘密提交 IPO,一份漂亮的业绩报表比任何时候都重要——但降价要换的,是守住 API 流量与开发者入口。
中国的涨价是进攻。 DeepSeek 即便涨价,V4-Pro 高峰输出价 27 元/百万 token,按最新汇率折算仍约为 OpenAI 旗舰模型(GPT-5.6 Sol,输出价 $20/百万 token,约合 144 元)的五分之一。Artificial Analysis 的测试显示,DeepSeek V4 Flash 的平均测试成本仅为 0.03 美元,而 GPT-5.6 Sol 为 1.86 美元、Claude Fable 5 高达 3.15 美元——相差数十倍。
所以,涨价不等于失去竞争力。中国厂商是在扩大规模后,对商业模式的一次重新平衡。
3.4 峰谷定价:把算力当电网来经营
8 月 17 日,DeepSeek 引入峰谷定价,这是国内商用大模型领域首个常态化峰谷差异化计费方案:
高峰时段(9:00—12:00、14:00—18:00):执行高价;
空闲时段(其余时间):价格为高峰的一半。
8 月 23 日,DeepSeek 进一步宣布:周末(周六、周日)全天不再区分峰谷,统一按低谷价计费,变相降价 50%。
这一机制的核心逻辑是:AI 算力像电力一样,具有极强的供需潮汐特征。日间企业办公时段,模型调用需求集中爆发,GPU 集群负载拉满,边际成本大幅抬升;夜间及周末,大量算力闲置空转。用价格信号"削峰填谷",引导非实时任务分流到闲时执行,是算力精细化运营的标志。
四、价格战的底层逻辑:从"Token 战"到"结果战"
理解 2026 年的价格变化,需要理解一个更深层的范式转移。
4.1 价格战没有结束,只是换了战场
2024 年的价格战,核心竞争点是每百万 token 成本。目标降低开发者接入门槛,激活市场。
2026 年,竞争焦点正在转向单位结果成本:
单位结果成本 =(模型调用费用 + 失败重试成本 + 人工检查成本 + 等待与集成成本)÷ 有效完成任务数
一个模型每次调用只花两毛钱,但经常答错,需要用户反复补充要求、重试三次,最后还要人工修改;另一个模型每次花两元,却能一次完成任务。后者的 API 价格更贵,真实成本反而可能更低。
衡量一个模型,不能只看评测分数和 token 价格,还要看四件事:任务成功率有多高,需要重试多少次,需要多少人工接管,以及从提出要求到拿到结果需要多长时间。
4.2 分层定价:一个市场裂成两个
2026 年的价格市场已经裂成两个:
低价层(规模层):Qwen-Plus、混元-TurboS、文心 5.0 等主力模型,输入价约 0.8 元/百万 token,输出 2—3.2 元。对于摘要、翻译、客服、内容生成和普通文档处理,这个成本已低到不再是主要门槛。
高价层(能力层):Kimi K3 输出价 100 元/百万 token,DeepSeek V4-Pro 高峰输出 27 元,GLM-5.3 输出 28 元。同样的国产模型,混元-TurboS 输出 2 元,Kimi K3 是 100 元,相差 50 倍。
这意味着:国产模型正在放弃"一款模型、一个低价、覆盖所有任务"的思路,转而建立更清晰的产品分层。基础模型继续负责规模,高端模型开始为能力、速度、上下文和任务价值收费。
4.3 谁来受益?
受益者:
开发者与创业公司:过去因 token 成本无法立项的功能,现在可以重新评估。
中小企业:一个更便宜的经济级模型处理常规工单,预算可以留给仍需人工的环节。
最终消费者:更多 AI 功能"几乎免费"地出现在日常生活中。
承压者:
前沿模型使用者:价格仍然高,因为最好的模型是一个不断移动的靶子。
依赖 AI 成本优势构建护城河的公司:当推理成本降到大宗商品水平,这一护城河正在消失。
五、未来展望:三条可观察的轨迹
5.1 前沿模型:持续变便宜,但速度放缓
GPT-4 到 GPT-5.4 的 12 倍降幅发生在三年内。前沿模型不会在短期内变得便宜——厂商需要利润来资助数亿美元的训练运行。但方向是确定的:每年 10 倍的速度还在继续。
5.2 "够用"层级:持续加速降本
这是 200—300 倍降幅发生的地方。去年前沿的模型,变成今年的预算选项。如果你的应用可以容忍落后一代,成本可以降一个数量级。
5.3 定价纪律:从"白菜价"到"合理价"
2026 年最确定的趋势是:价格不会再单边下降。
高盛在研报中指出,中国 AI 模型需求持续旺盛,算力资源趋紧,行业竞争正从激进的价格战逐步回归更理性的定价框架。摩根士丹利则以"告别价格战,打响智力战"为题,将 DeepSeek 的涨价解读为行业定价纪律改善的积极信号。
峰谷定价、分层定价、分成模式(如 Kimi 的"最高 30% 收入分成")正在成为行业常态。AI 基础设施的投资逻辑从"抢用户"转向"算账本",从"烧钱换规模"转向"价值定价"。
结语:价格不是终点,结果才是
回到开篇的三个问题,答案已经清晰:价格为什么降? 硬件、架构、规模、开源四重引擎让单位成本结构性下探,降价是成本兑现,不是善心;为什么又涨? 因为需求爆发撞上算力刚性,低价内卷不可持续,厂商从"抢规模"转向"算账本";这场价格战走向哪里? 走向分层定价与结果竞争——便宜的模型足够好,贵的模型证明自己为什么贵。
2026 年的大模型市场,正在经历一场深刻的范式转移:
价格战没有结束,但它不再是唯一战场。 竞争焦点从"每百万 token 多少钱"转向"每单位结果成本"。
便宜不等于永远便宜。 当需求爆发、算力刚性、商业模式转型,涨价也是理性选择。
定价权正在东移。 当 DeepSeek 敢于涨价、OpenAI 被迫降价,"东升西落"不再只是口号,而是正在发生的产业现实。
最终决定胜负的,不是一百万 token 多少钱。当一个模型开始写代码、做分析、操作软件、推进工作流时,token 只是过程,结果才是商品。
谁能少返工、少重试,真正把事情做完,帮助用户拿到结果,谁才值得付费。
这才是大模型价格战的下一阶段。
附录:2026 年 8 月主流大模型 API 价格快照(每百万 token,元)
注:不同模型在上下文长度、缓存命中、峰谷时段及输入输出长度上存在不同计价规则,横向价格只能反映特定口径下的成本,不能单独代表模型能力或实际业务总成本。