美国封锁芯片想看国产 AI 笑话,Kimi K上线两天直接被需求挤爆

2026-07-23 16:14:00 作者:admin 阅读数:252673
  现在全世界的眼睛都盯着人工智能,大洋彼岸更是想尽一切办法在高端芯片上卡住我们的脖子,等着看中国大模型的笑话。就在这个节骨眼上,国内一家顶尖的AI公司突然宣布:立刻暂停新用户的付费订阅。

  但是在看到这样的消息的时候,我们其实应该开心,因为这说明需求真的爆发了。国外的网友现在都在议论纷纷,说美国花费了大量的金钱,集中了全部力量来训练的几个大模型,本来是想在全世界范围内疯狂收费。但是没想到,中国的这些开源大模型一个比一个厉害,每一个都在不断接近这些原本排在头部的美国的大模型。一个是美国原本要大量收费的闭源模型,另外一个是中国的开源模型,能让全世界各个国家的用户都用上,这就打破了美国在AI方面的大布局。

  最近,因为中国的又一次AI大模型的突破,美国甚至在讨论新的限制措施,比如不允许美国的用户使用中国的开源大模型。这只能说明他们真的着急了。

  这次我给大家详细讲讲这背后的故事。

  7月16日,月之暗面发布Kimi K3。两天以后,公司做了一个很反常的决定:暂停面向新用户的C端订阅,优先保障已经订阅的人。

  官方给出的理由是,发布后48小时内需求迅速上升,已经接近当前服务容量。很多人把这件事概括成「2.8万亿参数把算力挤爆了」,也有人顺着它猜某款芯片短缺。可把K3的公开资料摊开会发现,这里面其实混着四笔不同的账。

  第一笔是参数账,问的是模型有多大、每一步怎样运行;第二笔是任务账,问的是用户能把一次工作做多长、多复杂;第三笔是容量账,问的是在线系统当前能同时承接多少真实需求;第四笔是开放账,问的是在线可用、榜单成绩和完整权重分别走到哪个时间点。

  四笔账都属于同一次发布,却不能互相代替:总参数回答不了多少人能同时使用,任务上限不能当成平均成本,当前容量点不了某款芯片的名,在线可用也不等于完整权重已经开放。把四把尺子分开,最大的数字才不会自动变成最大的结论,官方没公开的部分也不会被情绪补齐。

  第一笔账里,最显眼的数字是2.8万亿。

  Kimi官方说得很清楚,这是总参数。K3采用MoE混合专家架构,一共有896个专家,每一步只激活其中16个。2.8万亿描述的是模型容纳了多大的专家集合,16/896描述的是处理眼前这一步时,有多少专家实际参与。

  可以把它想成一座有许多专业部门的大楼。部门越多,能覆盖的专业范围可能越广;办一件具体的事,却不需要把整栋楼的人都叫进会议室。MoE的价值就在这里:总容量可以很大,单步运行只挑一部分专家。

  参数账交代了架构。真实服务成本还缺两组数据:每条请求的实际消耗,和用户的使用分布,月之暗面都没有公布。只看总参数就断言服务器一定被压垮,或者只看激活专家数就断言服务本该毫无压力,都是拿一把尺子去量另一件事。

  第二笔是任务账。K3支持100万token上下文,支持原生视觉输入,还面向Agent智能体任务。

  100万token是能力上限,不是说每名用户每次都会用满。它真正告诉我们的是,这款模型允许用户放进很长的材料,在更大的信息范围里阅读、比较和生成。原生视觉意味着任务里还可以出现图片。公开资料没有披露用户平均用多少token,也没有披露图像请求的比例,所以不能拿上限直接乘用户数,算出一张看似精确的资源表。

  Agent又加了一层复杂度。普通问答一问一答,智能体任务却可能先理解目标,再调用工具,读取返回结果,继续决定下一步。用户只下达一次任务,后台却可能发生多轮模型工作。每一步仍然只激活部分专家,可一项任务要是连续走很多步,累计工作量就不能只看其中一步。

  这笔账回答的是「一项工作可能长成什么样」,不等于「所有用户实际都这样使用」。有人只问一句,有人上传长材料,有人让智能体连续执行。K3公开了能力形态,没有公开真实请求结构。能确认的是,长上下文、视觉和多步任务都要在线系统承接;不能确认的是它们各自贡献了多少压力。

  参数账和任务账放在一起,才看得出一个容易被大数字遮住的区别:前者说模型的一步如何选专家,后者说用户的一项工作可能包含多少信息、多少步骤。单步变得稀疏,不代表整项工作只剩一步。模型能做更复杂的事,也意味着服务方要接住更复杂的用法。

  那这次被挤到边缘的,到底是什么?第三笔账落到暂停新订阅本身。

  月之暗面称,发布后48小时需求快速上升,接近当前服务容量,于是先保障已有订阅者,并表示正在增加容量,计划以后分批恢复开放。这里能确认的是需求、当前容量和公司动作三件事,它们连成了最直接的事件链:来用的人迅速增加,现有服务空间接近边缘,公司暂时收紧新订阅入口。

  对一家大模型公司来说,会员不是卖出一个静止文件。用户付费以后,得到的是此后一次次调用模型的机会。每多一名订阅者,带来的不只是一笔收入,还可能是一串持续请求。入口开多快,要和在线服务扩多快一起算。月之暗面选择先保老用户,说明它在热度和交付之间先选了后者。

  不过,这笔容量账没有点名任何硬件。公司公告没有披露芯片型号、供应商、集群规模和每条请求成本,服务能力还可能与部署、调度、任务结构和需求预估有关。在内部构成公开之前,把暂停归结为「国产算力不行」或某款芯片断供,没有事实支撑。

  容量账真正量到的是产品交付,不是硬件侦探。它告诉我们,模型受欢迎以后,团队碰到了一道现实门槛:能力做出来,不等于能立刻稳定服务所有涌进来的人。它没有告诉我们,这道门槛究竟由哪一块机器、哪一种部署或哪一类请求造成。

  第四笔是开放账,也是这次传播里最容易被时间搞混的一笔。

  K3在发布后已经提供在线使用,并在LMArena的WebDev(网页开发和前端相关)细分榜上拿到领先位置。这能说明发布时点的产品可用性和细分任务评价,不能扩大成「所有代码能力全球第一」,也不能证明完整模型权重已经放出。

  截至7月21日,Kimi官方给出的完整权重开放计划是7月27日。在线产品已经能用、技术信息已经公布、完整权重尚在时间表上,三个状态可以同时成立。把7月16日写成完整权重已经可下载,是把计划中的一步提前成了已经发生。

  开放账之所以重要,是因为「发布」不是一个只有开和关的按钮。普通用户看到在线产品,开发者看到接口和工具,研究者关心完整权重。不同人说「模型已经开放」时,指的可能根本不是同一层。转述的人不带日期、不带对象,一句真话换个语境就成了误导。

  这笔账现在能确认的,只有7月27日的官方计划。计划是否按时落地、权重开放后会带来怎样的部署与使用,都要等日期到了再看。它和当前在线容量有关联,却不是同一个问题:一个说官方服务能接多少需求,一个说完整模型文件何时开放。

  把四笔账重新合在一起,K3暂停新订阅就不再是一句「参数太大」能解释的新闻。

  参数账说,2.8万亿是总参数,每步只激活16/896专家;任务账说,100万token、视觉和Agent让一次工作可能更长、更复杂;容量账说,48小时内需求逼近当前服务能力,公司先保已有订阅者;开放账说,在线服务已经发生,完整权重仍计划在7月27日开放。

  四笔账分别量能力范围、任务形态、服务承接和开放进度。它们共同描出一款大模型从技术发布走向真实使用的过程,却没有任何一项能单独推出「某款芯片短缺」「永久容量危机」或者「所有交付已经完成」。

  大模型行业最容易被传播的是一个最大的数字,真正决定用户感受的,却是这些数字怎样在产品里相遇。模型可以很大,单步可以稀疏,任务可以很长,需求也可以在两天里涌来。最后,公司仍要把每一次请求稳稳送到人手里。

  中国的几家大模型现在基本上每两三个月甚至一两个月就有一个新的突破,就有新的进展放出来,每一次都能够振奋人心。实际上,这不仅仅是中国的进展,也是全世界其他所有国家的希望。因为我们研发的是开源模型,我们可以让各个国家都有机会享受到AI的便利,享受到AI最新的进展。

  从AI的发展上面,真正能体现出来人类命运共同体的意义。

推荐阅读