Qwen3.8来了:美国卡住芯片之后,中国AI开始争夺“每一份算力”
创始人
2026-08-27 00:47:40
0

No.0368

Science Partner

Bring you to the side of

导 读

就在今天,阿里千问发布Qwen3.8-Flash。

这场发布里有很多适合做海报的数字:每百万Tokens输入1元、输出3元;125B主模型参数,每个token只激活6B;支持超长上下文;阿里公布的部分测试中,编程、智能体和多模态能力已经可以和美国最昂贵的一批闭源模型比较。

但如果只选一个数字, 会选一个最不适合写在广告牌上的: 九分之一。

Qwen团队当天公开的技术报告称,与上一代397B-A17B的Qwen3.7-Plus-Base基础模型相比,Qwen3.8-Flash-Next-Base在14项预训练基准中有8项得分更高,其余6项最多落后2.6分;与此同时,它每个token激活的参数只有前者约三分之一,训练token约为三分之一,训练所消耗的FLOPs最终只有大约九分之一。

FLOPs不是美元。

很多媒体开始说阿里把“训练成本打下来了89%”。咱们科学严谨的说,一家公司训练一个模型究竟花了多少钱,还取决于芯片、集群利用率、失败实验、数据、后训练、电力以及大量工程成本。Qwen没有公开这张完整账单。

但九分之一依然值得阿里乃至东大系的大模型公司引以为豪。因为2026年的人工智能竞争已经出现了一种很微妙的变化:过去,人们最关心谁拥有更多GPU。随着算力对电力、水、环境等等人类生存环境的不断侵占,另一个问题开始迅速追了上来:

同样一块GPU,究竟能够生产多少智能?

走,跟伙伴君来!

今日主笔|旻宏

美国卡住芯片之后,中国AI开始争夺“每一份算力”

01. 一场由“稀缺”重新定义的竞赛

美国对华先进芯片出口限制已经持续数年。

“卡住芯片”这个标题当然是一种压缩表达。现实没有这么简单:中国仍然拥有大量AI算力,国产加速器也在迅速发展,美国政策本身也不断变化。出口管制真正改变的,是中国公司获取最先进计算资源的数量、价格和确定性

但是,这种差别很重要。

在美国,最富有的科技公司可以把越来越庞大的资本直接转换成GPU集群、电力和数据中心。中国头部企业也在大规模投入,但能够调用的先进芯片条件并不相同。

Brookings今年研究中美AI竞争时,干脆把“效率”单独列成了中国的一条技术路线。其分析认为,先进芯片出口限制、国产芯片性能与供给差距,以及与美国巨头相比更有限的资本条件,使中国实验室更加集中地解决模型效率、部署成本和有限算力下的性能问题。

CSIS今年7月得出的观察也很接近:中国最近一批模型已经能够在许多现实任务上接近美国前沿模型,而成本、开放权重和工程效率越来越成为竞争变量。

这大概就是过去几年美国半导体政策一个容易被忽略的二阶效应。Brookings今年6月讨论出口管制时就指出,这些政策短期确实限制了中国实验室能够使用的计算规模,也增加了其按照美国头部实验室方式训练超大模型的难度。但与此同时,它们也在强化中国提高效率和建立自主半导体体系的动力。

假设两家公司都能让训练计算量下降30%。对于拥有近乎无限预算和稳定GPU供应的一方,这首先意味着利润率和产品速度;对于算力受到更强约束的一方,它还意味着原来做不了的实验现在可能做得了,原来昂贵的模型现在可能跑得起。

所以,限制算力,并不会取消算法创新,它真正改变的是算法创新的价格。Qwen3.8放在这个背景里来说就是,它在用实际行动告诉大家,“算力不是不重要”因为贵所以 不能浪费哪怕一丢丢。

02. 他们开始计算GPU到底在忙什么

Transformer有一个长期存在的问题:它很聪明,但有时候过于勤奋。

当上下文越来越长,传统全局Attention需要不断比较大量token之间的关系。几十页文档还好,到了几十万乃至100万token,这种“任何内容都可能和任何内容发生关系”的处理方式会迅速变得极其昂贵。

Qwen3.8在这里做了一件挺有代表性的事。它不再让所有网络层都用同一种方法处理历史信息。大多数层使用Gated DeltaNet,把已经读过的信息持续压进一个固定大小的状态,隔几层保留一次全局Attention,以便在真正需要的时候重新访问具体token。

伙伴你可以把它想成一个研究员读一摞材料。他不会在写每一句话之前,都从第一页重新翻到最后一页。大部分时候依靠工作记忆,遇到关键事实,再回头查原文。

Qwen又在全局Attention上加了一层筛选机制:Qwen Sparse Attention,简称QSA。它先把很长的文本压成一个个micro-block,让一个较轻量的索引器判断哪些区域更值得看,之后才把有限的计算资源放在这些区域上。技术报告把这一过程描述得很明确: QSA首先压缩序列,再在block级别估计重要性,最后选择相关上下文进入Attention。到了100万token上下文,Qwen报告的内核测试中,这套Attention在prefill阶段相对密集Attention最高快7.6倍,decode阶段快4.9倍。

此类的阳谋,这还只是其中一处。Qwen3.8额外加入了51B的N-gram Embedding参数,却把这部分巨大的表放在CPU一侧的Host Memory,需要时提前调取,而不是常驻宝贵的GPU显存。Residual Stream被扩成四条通道,以Gate动态决定哪些信息应该继续向后传。优化器也换成Muon,并重新拟合训练Scaling Law。Qwen团队甚至发现,过去大模型训练中常用的Batch Size Warmup没有带来最终收益,却额外增加18.8%的optimizer steps,于是把它删掉了。

这些技术分别来自不同研究脉络,其中不少也借鉴了Google DeepMind、DeepSeek以及其他研究团队的工作。但放在一起,却呈现出一种非常一致的工程审美:

这里能不能少算一点?

那里的数据是不是不必搬进GPU?

这个步骤是不是大家用了几年,其实可以不要?

参数一定要参加矩阵乘法,才算参数吗?

于是,我们看到一个模型的进步,开始越来越像大型工业系统的进步。早期汽车比发动机排量。后来真正决定成本和竞争力的,是燃烧效率、变速箱、空气动力学、供应链和制造良率。 AI正在离开“参数越大越厉害”那个相对单纯的年代。125B还是397B,已经越来越不足以告诉我们一台模型真正有多贵。

03. 然后,Agent把这笔账放大了

如果AI永远停留在聊天机器人时代,这件事可能还没有这么紧迫。问一个问题,得到一个答案,一次调用贵几分钱或者便宜几分钱,普通用户感觉并不强。

Agent不一样。

让一个智能体帮你分析一家上市公司,它可能先搜索几十个网页,再下载年报,调用代码工具处理数据,发现某个数字矛盾,再重新检索,最后让另一个模型检查结果。

这也是Qwen3.8“Flash”真正应该接受检验的地方。

阿里给出的API价格很低:每百万token输入1元、输出3元。但现在还不能据此宣布它成为了世界上“性价比最高”的模型。Qwen发布材料里大量与Claude等美国模型的比较主要来自厂商自己的测试,但不同模型使用的evaluation harness、工具配置和推理预算并不完全一致。排行榜尤其容易制造一种错觉:73.2分似乎天然比71.8分更科学。实际上,大模型benchmark已经越来越像汽车的双叉臂式、多连杆式、扭力梁式——有价值,但很难替你决定该买哪辆车。

对Agent而言,更重要的问题是稳定性、延迟、工具调用成功率、上下文成本以及失败后的人工处理。这也是为什么Qwen3.8的“九分之一”比一两个排行榜名次更值得注意。因为它至少展示了一种可能性: 模型公司可以把相当一部分竞争,从购买更多硬件,搬回架构本身

不过这里有一个道理容易被忽略: 效率提高未必意味着行业最终需要更少GPU。历史上这种事情经常发生。蒸汽机效率提高以后,英国并没有因此少烧煤。成本下降,反而让蒸汽动力进入更多场景。

AI也可能如此。

04. 有钱买芯片的人,也开始节省芯片

有外媒报道经常把中国的效率路线简单解释成“穷人的办法”。这可能是没看到全貌。就拿阿里来举例子,它一点也不像一家不愿意花钱买算力的公司。

2025年,公司宣布未来三年投入至少3800亿元用于AI和云基础设施。今年8月20日,路透社报道称,这一计划已经执行接近一半,仅最近一个季度资本支出就达到676.8亿元,同比增长75%。三天后,阿里又宣布在香港进行约102亿美元规模的股票增发,资金投向AI芯片、基础设施和模型研发。

一边投入数千亿元建设算力,一边让模型团队想办法少用算力。这其实才像一门成熟的生意。

航空公司不会因为买得起飞机,就不在乎油耗。同样,云厂商也不会因为有十万张GPU,就接受GPU有一半时间在搬运本来可以少搬的数据。

越是大规模投入,效率提高一个百分点,越值钱。这也是中美AI竞争正在发生的一个变化。效率不再是中国的特殊议题。当美国科技公司把越来越多现金流投入数据中心后,单位算力能产生多少收入,同样会变成华尔街追问的问题。而核心区别在于,两边走到这个问题面前的路径不同:美国首先拥有了令人咋舌的计算资源,然后越来越在意它们的回报;中国实验室较早面对了算力约束,因此更早把一些注意力放在如何节省和绕开瓶颈上。所以,最后两边还是会在同一个地方碰头。

算力本身是一种资源,而模型架构决定了这种资源的生产率。从这个意义上讲,DeepSeek去年给美国市场造成震动,并不是因为它证明了“GPU没用”。是它让资本市场第一次大规模意识到:计算资源和模型能力之间,并不存在一个永恒不变的兑换率。算法可以改变汇率。

Qwen3.8今天又做了一次类似的事情,只是没有DeepSeek当时那么惊世骇俗。它并没有宣布一种颠覆Transformer的新理论。甚至其中很多技术思想都能在其他实验室找到前身。它更像一次细密的工程重构。如第二部分所述,Attention少花一点,Embedding少占一点GPU,Residual更稳定一点,Optimizer再省一点训练步骤。每个地方都抠一点。加起来,就是九分之一。

05. 真正值得美国担心的,不是某张榜单

如果事情只到这里,Qwen3.8仍然只是一个很不错的工程新闻。

它还有另一半。

Qwen把Flash-Next的权重直接开放了,而且明确把它定义为未来Qwen4架构的先导版本:完整Qwen4家族尚未到来,社区已经可以提前测试这套架构、部署它、寻找问题,并围绕它做工具适配。

这件事放在2026年的美国政策讨论中,意味不一样。

CSET今年3月发布的报告已经把开放模型明确纳入中美AI“软实力”竞争。它认为,两国竞争正在从单纯争夺技术领先,延伸到谁能够影响全球AI生态;模型能否被其他国家、企业和开发者采用,本身就是实力的一部分。

美国政策圈对此的焦虑正在加深。

7月,Lawfare甚至用了一个很形象的标题:“Knives Are Out for Open-Weight AI Models”,文章梳理了美国政府官员针对中国模型蒸馏、实体清单和制裁可能性的公开表态。原因不难理解,封闭模型的竞争,很像几家公司经营自己的航空公司。开放权重模型则更像把飞机设计图的一部分交出去。别人可以改,可以部署,可以在本地运行,也可以建立一整套与你无关的商业系统。这会让原始模型公司失去一部分用户数据和商业控制。但它有另外一种优势: 扩散

现在Qwen已经开始展示这种力量。

Fortune援引数据称,截至8月中旬,Qwen开放模型过去半年累计下载超过30亿次,其生态已经出现30万多个衍生模型。报道援引Hugging Face的判断称,Qwen已经进入不少开发者决定微调和部署何种模型时的“默认工作流”。

下载量不是市场份额。衍生模型也不等于商业成功。但“默认”是技术产业里一个极其敏感的词。Windows、Android、CUDA真正形成壁垒的时候,人们已经不再每天讨论它们是不是全世界技术指标最高的产品。大量工具、人员、代码和习惯开始围绕它们存在,离开它们变得麻烦。

主权AI领域已经出现了很早期的类似信号。所谓“主权AI”,并不意味着一定要从零训练自己的大模型。对多数国家来说,那样做成本太高。更现实的办法,是选择一个国外开放权重模型作为底座,再用本国语言、数据和基础设施进行微调和部署,在借用现有技术的同时尽可能提高自主控制能力。CNAS 8月20日更新的数据库显示,目前已有67个国家推进184个政府支持的主权AI项目。在已披露基础模型的项目中,美国模型目前仍占明显优势,Meta的Llama仍是使用最多的底座。但一个新的变化已经出现:中国模型在2025年前几乎缺席,但就在2026年上半年突然成为了多个国家的选项,其中Qwen被用于埃及、新加坡、泰国、乌干达和阿联酋的相关项目。

这距离“全球AI底座易主”当然还远得很。美国依然控制着最先进的一批芯片,拥有规模最大的头部模型公司、全球云平台、资本市场以及成熟的软件生态。所以Qwen3.8没有证明美国的芯片政策失败。它揭示的是一个非常值得研究的问题: 如果竞争对手不能用和你完全一样的方法比赛,他会不会改变比赛的方法?

过去几年,美国最大的优势之一,是把资本、芯片和能源迅速堆成更大的计算集群。中国模型开发者正在试着把另一个变量做大:单位计算资源所能够承载的模型能力,以及模型离开原厂服务器后继续扩散的能力。两条路线最后并不会彼此取代。美国实验室也会追求效率,中国公司也在努力建设数据中心。真正的AI竞争正在变得更像工业竞争: 资本、芯片、算法、能源、软件生态和价格,一个也不能少。

也正因如此,Qwen3.8今天最重要的数字或许并不是它在哪张榜单上超过了Claude。而是那个看起来非常不起眼的分数:九分之一。先进芯片仍然是这个时代最珍贵的工业资源之一。只是从DeepSeek到Qwen,中国AI正在反复提出同一个问题:

既然每一块都这么贵,那这一块,能不能再多做一点事情?

我是旻宏,咱们下期见~

相关内容

热门资讯

股市必读:景旺电子(60322... 截至2026年8月26日收盘,景旺电子(603228)报收于90.15元,下跌0.97%,换手率3....
图解概伦电子中报:第二季度单季... 证券之星消息,概伦电子2026年中报显示,上半年度公司主营收入2.4亿元,同比上升10.05%;归母...
中航光电:2026年上半年净利... 以8月26日收盘价计算,中航光电目前市盈率(TTM)约为38.02倍,市净率(LF)约2.89倍,市...
股市必读:神工股份新发布《锦州... 截至2026年8月26日收盘,神工股份(688233)报收于107.19元,下跌0.48%,换手率3...
股市必读:甬矽电子中报 - 第... 截至2026年8月26日收盘,甬矽电子(688362)报收于61.35元,下跌0.42%,换手率3....
原创 小... 小米在平板上,以多版本发展为主,比如标准版、Pro版、Ultra版等,而且各有定位,所以版本之间配置...
Qwen3.8来了:美国卡住芯... No.0368 Science Partner Bring you to the side of ...
股市必读:中航光电新发布《20... 截至2026年8月26日收盘,中航光电(002179)报收于33.37元,上涨0.0%,换手率0.7...
股市必读:精测电子新发布《武汉... 截至2026年8月26日收盘,精测电子(300567)报收于210.6元,上涨2.09%,换手率3....
股票行情快报:科泰电源(300... 证券之星消息,截至2026年8月26日收盘,科泰电源(300153)报收于21.67元,上涨1.55...