
一个从不融资的公司,突然估值翻倍;一个追求极致效率的团队,把模型跑到了国产芯片上。4月24日这天,AI圈同时发生的好几件事,彼此之间藏着一条暗线。

◎ 同一天,两个世界
2026年4月24日,AI圈迎来了一个罕见的“双黄蛋”。
大洋彼岸,OpenAI发布GPT-5.5,号称“迯今最智能、最直觉易用的模型”,主打Agentic Coding和多步骤自主任务。闭源,高价,企业订阅。

同一时刻,北京,DeepSeek上线了V4——1.6万亿参数MoE架构,Apache 2.0协议全开源,1M上下文标配,API定价是GPT-5.5的约1/8.6。

这不是巧合。据我们了解到,DeepSeek原定2月发布V4,但为了适配华为昇腾芯片,推迟了两个月——最终选择和OpenAI同一天亮相。
一个闭源加价,一个开源降价。两条路线的正面硬刚,就这样被写进了同一天的产品发布表里。
但如果你只看跑分,你会错过真正的故事。
◎ 1.6万亿参数,27%的计算量
先说最重要的数字。
V4-Pro总参数量1.6T(万亿),但每个token只激活49B参数——这是MoE(混合专家)

架构的核心逻辑:用稀疏激活换取推理效率。
真正让同行注意的,不是参数量,而是DeepSeek把计算量压到了什么程度。
根据技术报告,V4单token推理FLOPs只有上一代V3.2的27%,KV缓存缩小到V3.2的10%。这意味着,同样处理100万字的长文本,V4的计算开销不到前代的三分之一。
怎么做到的?DeepSeek在架构上动了三层手术:
第一层:压缩注意力。传统Transformer的注意力机制计算量是O(n²),文本越长越慢。V4设计了两种压缩注意力——CSA(压缩稀疏注意力,每4个token的KV缓存压缩为1个条目)和HCA(高度压缩注意力,压缩率m'=128),两者交错堆叠,让百万级上下文的计算量不再指数级增长。
第二层:查算分离。这是DeepSeek创始人梁文锋署名论文的核心概念——Engram条件记忆模块。传统模型让注意力同时负责“检索知识”和“推理组合”,导致资源浪费。Engram把固定的、需要记忆的模式存入查找表,O(1)复杂度调用,释放注意力资源专注推理。集成27亿参数Engram的模型,在同等参数和FLOPs条件下性能超过纯MoE模型。
第三层:流形约束超连接。mHC(Manifold-Constrained Hyper-Connections)将连接矩阵约束在双随机矩阵流形上,让信号在极深网络中保持稳定增益(约1.6倍),计算利用率从行业平均约60%提升到85%以上。
三套组合拳的效果:DeepSeek用1.6万亿参数的模型,跑出了比前代更少的计算量、更小的显存占用、更长的上下文窗口。
但真正让V4成为行业事件的,不是这些数字本身——而是数字背后的算力含义。
◎ 华为昇腾跑通了
4月24日当天,华为同步官宣:昇腾超节点全系列产品支持DeepSeek V4系列。

这句话的分量,需要放在一个更大的背景里理解。
过去两年,中国AI行业被一个结构性矛盾所困:最好的模型跑在英伟达GPU上,而英伟达GPU对中国客户实施了多轮出口管制。模型越强大,对高端算力的依赖越深——这是一条越走越窄的路。
V4改变了这件事的方向。
根据技术报告,V4的细粒度专家并行方案同时在NVIDIA GPU和华为Ascend NPU上完成验证,昇腾NPU上实现1.5-1.73倍加速,RL rollout等高敏感场景可达1.96倍加速。
“V4适配华为昇腾芯片,验证了国产芯片技术可行,且与国际芯片相比可能具备成本竞争力。昇腾950超节点2026年下半年批量上市后,V4 Pro推理成本将进一步下降。” ——摩根大通研究报告
摩根大通认为,市场对DeepSeek发布V4后的恐慌性抛售(智谱和MiniMax当天均跌9%)是过度反应。V4释放的最大信号不是“竞争加剧”,而是“算力瓶颈松动”——当国产芯片能跑通前沿模型,整个中国LLM行业的成本曲线都在往下压。
“模型运行时开始从单一硬件依赖中解耦”这件事本身,比任何benchmark都有战略意义。
但也要看到现实的灰度。目前开源层面释放的MegaMoE和DeepGEMM仍然深度绑定NVIDIA工具链,昇腾适配更多是方向性验证而非全面就绪。DeepSeek官方也承认,V4 Pro“受限于高端算力,服务吞吐仍有限”,预计下半年昇腾950超节点批量上市后价格才会大幅下调。
方向是对的。路还没走完。
◎ 开源之后,谁在买单?
V4发布前三天,一则融资消息让整个中国AI圈炸了锅。
4月22日,多家媒体报道,腾讯与阿里巴巴正在洽谈投资DeepSeek,预计共计投资18亿美元。DeepSeek本轮融资估值约200亿美元。
这个数字什么概念?一周前,市场还传出DeepSeek寻求以不低于100亿美元估值融资3亿美元的消息。短短几天,估值翻了一倍。
多个信息源告诉晚点,腾讯和阿里这对缠斗多年的老对手,罕见地携手出现在同一家公司的股东名单上。截至目前,交易方案还未完全敲定,确定的投资方仅有腾讯、阿里两家。
DeepSeek此前的叙事是“不融资、不烧钱、靠母公司幻方量化的盈利养活自己”。这个叙事帮助它获得了市场的信任——一家不靠外部输血也能持续迭代的公司,说明它的效率已经跑通了。
但现在,DeepSeek选择了拥抱资本市场。据我们了解到,为适配华为昇腾芯片所做的工程投入,是V4推迟发布的重要原因之一。做国产算力适配不便宜,但这件事的回报可能是整个行业的成本曲线下移。
利益结构很清晰:DeepSeek要算力适配的钱和生态渠道,腾讯和阿里要一个不受制于OpenAI的国产基座模型。三方各取所需,但博弈才刚开始。
◎ 跑分之外:V4到底强在哪?
先看数据。根据公开技术报告和LMArena实测:

V4-Pro-Max强项:
Codeforces Elo 3206分,超过GPT-5.4的3168分
Chinese-SimpleQA 84.4%,在该中文知识基准上领先
LiveCodeBench 93.5%,领先Claude Opus 4.6的88.8%
SWE-Verified 80.6%,接近Opus 4.6的80.8%
V4-Pro-Max弱项:
LMArena Code排名仅第14位(Elo 1456),远落后于GLM-5.1(1534)和Kimi K2.6(1529)
长上下文召回MRCR 1M得分83.5%,远低于Opus 4.6的92.9%
GDPval-AA(Elo 1554),落后于GPT-5.4的1674
HLE不带工具仅37.7%,Gemini 3.1 Pro达44.4%
多位开发者向晚点反馈,V4在代码生成和中文理解上确实有长足进步,但在复杂Agent工作流和多步骤推理上,与OpenAI和Anthropic的最新闭源模型仍有差距。
但如果你只看跑分排名来评估V4的价值,就像用百米速度来评价一辆越野车——参数不是这个模型的核心叙事。
◎ “大宗商品化”的自我否定
V4发布后,最耐人寻味的不是跑分,而是定价。
版本
输入价格(/百万token)
输出价格(/百万token)
V4 Pro
$1.74
$3.48
V4 Flash
$0.14
$0.28
GPT-5.5
$5.00
$30.00
Flash版的输出价格是GPT-5.5的不到1/100。Pro版的输出价格是GPT-5.5的约1/8.6。
但重点在Pro和Flash之间的价差——12倍。
DeepSeek自己用定价结构否定了“AI模型终将大宗商品化”的叙事。Pro版处理复杂推理任务,Flash版处理简单高频调用。这是基于任务复杂度的分级定价体系,和SaaS行业的订阅分层逻辑一样。
智谱GLM-5.1的输出定价为$3.50/百万token,与V4 Pro的$3.48几乎持平。所谓“DeepSeek定价碾压一切”的论调,与实际数据并不吻合。
摩根大通把这称为“定价纪律”——V4的技术创新(token压缩、DSA架构)属于开源发布,不是护城河。V3时期的MoE路由机制在4-6个月内就被千问、GLM、Kimi吸收。技术创新最终成为行业通用配置,整体成本曲线下移,对所有玩家均有利。
◎ 谁在受益,谁在买单?
V4发布当天,智谱和MiniMax股价各跌9%,恒生指数当天涨0.2%。算力租赁概念股浙数文化、超讯通信双双跌停。
市场的逻辑很简单:DeepSeek出更强模型 → 竞争加剧 → 纯LLM公司生存空间被压缩。
但摩根大通认为,这只是看到了第一层。
把利益相关方地图画出来:
受益方:
应用层公司(字节、腾讯旗下产品)——模型成本下降,token吃得更多,产品利润率提升
华为和昇腾生态——V4验证了国产芯片跑前沿模型的技术可行性
开发者社区——Apache 2.0全开源,1M上下文,本地部署成本大幅下降
承压方:
纯模型公司(智谱、MiniMax、月之暗面)——V4 Flash版的极度低价挤压了中间层公司的定价空间
算力租赁中间商——模型效率提升意味着单位token的算力需求下降
英伟达——国产芯片适配跑通,长期削弱了对英伟达高端GPU的依赖
在中间的人:
DeepSeek自己——拿了腾讯阿里的钱,就要承受被平台公司“双重绑定”的代价
阿里云/腾讯云——投资DeepSeek的同时,仍然在卖智谱、Kimi等其他模型的API
这场比赛的终局,大概率不是谁吃掉谁,而是每个人的角色都在重新定义。
◎ 旧模型的高光时刻
V4发布中最有意思的一个细节,不在技术报告里,而在API页面的一行小字里。
官方写明:DeepSeek V3.2时代的deepseek-chat和deepseek-reasoner接口,将于2026年7月24日下线,目前所有请求已经自动路由到deepseek-v4-flash。

一个1.6万亿参数的新模型上线,旧的对话模型直接被替换。没有中间过渡期,没有兼容灰度。这种行为方式,和DeepSeek过往的风格一致:追求极致效率时,连自己人也不手软。
Flash版与Pro版在不同基准测试上的差距只有1-3分。这意味着对于大多数日常应用场景,Flash版的性价比远超Pro版——而Flash版的定价,和三年前一个7B参数模型差不多。

某种意义上,这才是V4对行业冲击最深远的地方:不是1.6万亿参数有多强,而是284B参数的Flash版已经足够好,好到大多数人不需要再为“更强”多付12倍的钱。
◎ 下半场还没开场
4月24日之后,竞争格局正在发生一个微妙的重心转移。
模型跑分的天梯榜还在每周更新,Kimi K2.6、GLM-5.1、DeepSeek V4在Code Arena上你追我赶。但从利益结构看,真正决定行业走向的力量,已经不是单个模型的参数量或Elo分数。
V4适配昇腾成功,意味着国产算力的可用性不再是理论假设,而是工程事实。下半年950超节点批量上市后,推理成本还有下降空间。
但昇腾生态的开发者体验、工具链成熟度、与CUDA的兼容性,仍然是一道看不见的墙。多位从业者反馈,“跑通”和“好用”之间还有很长一段路。
DeepSeek拿了腾讯阿里的18亿美元,但交易还没完全敲定。三方博弈的结果,将决定这家公司未来的产品走向和生态站位。
开源社区的贡献者们在Apache 2.0协议下拿到权重,但真正要部署1.6万亿参数的模型,需要的GPU集群规模和工程经验,不是每个团队都具备。
过去的两个半月里,DeepSeek用了15个月打磨V4,OpenAI在同一天亮出GPT-5.5,阿里千问3.6、Google Gemma 4、Meta Llama 4轮番登场——2026年4月,开源AI史上最卷的一个月。
在过去,大家比的是谁的模型更大、跑分更高。但从V4开始,这场比赛的胜负手,可能不再是跑分榜上的一个数字,而是谁先把算力从单一依赖中解绑,谁先让1M上下文变得像1000token一样便宜,谁先让开发者不再纠结选闭源还是开源。
在很多人只看到跑分的时候,V4真正改变的是跑分的成本结构。
而成本结构,才是一切叙事的底层逻辑。
翔云优配提示:文章来自网络,不代表本站观点。