华潮新闻网
科技

Kimi算力告急:K3火爆背后的“韬定律”实践与资源分配挑战

来源:华潮新闻网
Kimi算力告急:K3火爆背后的“韬定律”实践与资源分配挑战

K3迅速蹿红,Kimi却不得不按下暂停键。

7月19日深夜时分,月之暗面Kimi团队发布公告,称Kimi K3上线仅48小时,用户请求量大幅超出预估,由于算力资源紧张,暂停开放新用户订阅,将有限算力优先保障现有订阅用户体验。

会员体系随之拆分为Kimi主权益与Code权益,意图精准分配资源。稍后官方回应显示,Kimi并未调整会员体系,只是在有限算力下对用户体验做了重新平衡。

换言之,K3之火爆达成算力“熔断”,只能婉拒新访客,专心服务老用户。

Kimi的“韬定律”实践

目前,各大模型厂商都在拼命扩大用户规模,通过免费或降价吸引新用户。相较之下,Kimi的反向操作就特别。

但模型能力越强、上下文越长、用户调用越频繁,对推理算力的需求也越高。在“K3请求量快要触及现有算力集群极限”状况下,Kimi也遭遇了“豆包式”的烦恼:C端用户虽多,对收入贡献有限,但GPU已不堪重负。

作为月之暗面首款3万亿参数级MoE模型,K3总参数达2.8万亿。通常认知里,这个规模模型每次输出都需极大算力。但在其独特核心架构帮助下,达到华为芯片领域提出的“韬定律”效果。

这个架构被视为强大引擎,应用了三项关键技术:KDA(Kimi Delta Attention)混合线性注意力、注意力残差(Attention Residuals)和高稀疏度MoE,将每单位算力转化为模型效果的效率推向极致。

芯片行业长期遵循摩尔定律,靠缩小晶体管尺寸提升性能。但先进制程逼近物理极限、成本飙升,单纯堆叠硬件的增长模式已入瓶颈。

华为近期提出的“韬定律”,突破传统思路,转向“时间缩微”:通过逻辑折叠、三维堆叠、全链路架构优化,压缩信号传输时延、减少数据搬运,在成熟制程上实现能效跃升。

其核心方法是:在硬件受限或成本约束下,借助系统级架构创新达成性能提升。

在我看来,K3采用的KDA混合线性注意力机制,正是AI领域的“韬定律”实践。

要知道,Transformer架构在注意力机制上最耗算力。标准注意力随序列长度呈平方级增长,百万级上下文任务中,大部分算力消耗在维持长序列的注意力矩阵上。KDA机制将大部分注意力层的计算复杂度从平方级降至线性。

根据月之暗面先前发布的技术报告,在实验模型上采用KDA与MLA混合比例,KV缓存占用可削减最高75%,100万上下文长度下的解码吞吐量提升至六倍。配合注意力残差与高稀疏度MoE技术,训练效率提高约25%,额外成本不足2%。

这是对“模型生产效率”的重塑。如果说硅谷主流的Transformer路线是“大力出奇迹”的燃油车,KDA更像是追求“热效率极致”的混动引擎。

SemiAnalysis的报告显示,KDA将推理速度提升300%,同时在长上下文处理上保持接近Transformer的性能。这意味着同等算力投入下,K3能产出更多有效智能。

开发者社区的实测反映,K3在长流程Agent任务和代码生成方面表现优异,具备与国际头部模型竞争的实力。

从根本上说,K3依然遵循Scaling Law(缩放定律),但将刀锋对准了算法浪费。当硅谷AI企业还在不断囤卡、堆算力时,Kimi通过重构算法链路、精简计算冗余,在有限算力条件下,实现性能与效率的平衡,走出一条“每瓦特智能产出比”最大化的路径。

这让华尔街观察人士和投资者感到意外,他们如惊诧DeepSeek一般,再度质疑硅谷数千亿美元投资AI是否能得到相应回报、美国AI领先优势是否被削弱。

与此同时,企业用户和开发者也开始关注AI使用成本。部分开发者已用上“模型路由”(Model Routing)服务,根据不同任务自动选择最低成本、最高效率的AI模型,其中当然包括Kimi在内的中国模型。

杨植麟挑战

回过头看,Kimi算力被击穿是技术成功的副作用:模型效率提升降低单次使用成本,反而刺激了需求总量激增。

值得一提的是,7月11日,智谱创始人唐杰宣布“Touch High摸高计划”,直言“不登顶即失败”,并明确表示未来两年不追求短期变现,而是集中资源攻坚AGI的四大核心方向,并拟募集资金,计划投入百亿级资源突破机械可解释性技术。

若说智谱“摸高”是上市后背水一战。其希望通过冲击技术天花板,夯实“全球大模型第一股”叙事,并缓解现实焦虑。

也在杨植麟决策中,看到Kimi在三个维度的“摸高”:

一是算力摸高,从流量思维转为价值思维。公开资料显示,Kimi的API业务比重已超70%,与此前靠C端订阅模式截然不同。保老用户,拒新客,实则将有限算力向高价值场景倾注,避免泛C端流量挤占此已成为收入支柱的B端业务配额。

代价也是显而易见的。比如“优先保障存量用户”的标准不透明,哪些请求获优先响应、哪些被降级处理,一旦处理不当,都会消解用户信任。

长远看,Kimi要完成从技术明星向成熟AI头部企业的蜕变,就必须夯实弹性算力池、分级响应机制、动态调度能力等基础设施。

二是定价摸高,Kimi在实施从廉价自助餐到价值分层的压力测试。公告中提及的“拆分Kimi主权益与Code权益”,既是应对算力短缺的短期策略,也可能预示着其定价体系重构的开端。

以往,无论用户写代码、查资料还是闲聊,都支付相同费用、消耗相同算力。当高算力消耗的Code用户比重上升,这种模式必然导致结构性错配。

Kimi借此进行会员权益拆分,实则按使用场景重新定价:轻度用户享基础服务,重度用户为高价值能力付溢价。

这是通过价值用户分层,在尝试争夺模型产品的定价权。目前,K3收费标准已达每百万Token 2.3美元,虽低于海外顶尖模型,却创下国产模型新高。

或许,Kimi也想告别廉价模式,对外传递一个理念:高性能模型具备定价能力。接下来,大模型竞争也将从“拼参数”转向“拼基础设施”、“拼成本定价”。

这一步,比登顶榜单更难,也更贴近商业本质。

第三,地位摸高,Kimi从地缘变量到定价锚点的身份转变。

K3发布后迅速引发全球瞩目。在独立AI模型评测机构Artificial Analysis最新发布的“智能指数(Intelligence Index)”中,其综合得分达57分,位列全球第三,仅次于Claude Fable 5(60分)和GPT-5.6 Sol(59分),领先Claude Opus 4.8(56分)。

这一成绩也打破了“开源落后闭源半代”的行业论断。

同时,K3影响力已超出技术圈。美国科技投资机构视其为AI发展的拐点,认为高质量开源模型正加速能力扩散;加州大学伯克利分校计算机科学教授声称,K3将中国开源模型与美国先进模型的差距,缩小至2至3个月。

资本市场反应同样剧烈,K3发布首日,英伟达单日市值蒸发约1111亿美元;摩根大通策略师在报告中直接称其为“DeepSeek 2.0”。

这个加速度,才真正改变定价逻辑。

此外,月之暗面ARR到6月已近3亿美元,海外增速400%,涨价60%后收入反增,三组数据叠加,显示Kimi的“开源+效率”模式可规模化变现。

加上有消息称,月之暗面正计划最快六个月在香港上市,估值半年内从43亿美元飙升至315亿美元,涨幅超7倍。

这些是资本市场为一条非硅谷主流路径的“确权”。它们为“能跑通单位经济模型的SOTA”下注时,也证明Kimi拥有独立估值逻辑,无需对标OpenAI或Anthropic证明自身价值。

但K3距离AGI仍远。比如跑分,虽仅比Fable 5低3分,但背后仍存差距。

另外,Kimi在技术报告里承认了两个部署缺陷:一是K3训练中保留了完整思考历史(thinking history),若调用方未正确传递推理过程,或在会话中从其他模型切换到K3,输出质量会显著降低;二是K3在任务模糊时易“过度主动”,更倾向于替用户做决定。这种“自作主张”在需要精准执行的工程流程中,易引发连锁错误。

还有一个易被忽视却至关重要的问题:幻觉。Artificial Analysis测评特别指出,K3的幻觉率比上一代K2.6反而有所上升。

某种程度上,K3的亮眼与隐忧,是全行业算力供需失衡的缩影,也是中国AI产业在算力卡脖子、商业化未闭环、用户预期过高等压力下的集体阵痛。

这些AI厂商的每次过载、每次“熔断”,都是中国AI“摸高”需要跨越的障碍。可以确定的是,一个新的竞争周期已经来临,大模型将 从拼能力转向拼算力。

谁能在算法、算力储备等基建上建立优势,谁才能笑到最后,并定义下一代AI公司的生存标准。

参考资料:

字母榜,《K3发布48小时》

锦缎,《都怪Kimi》

我是唐辰同学,关注互联网科技及AI新经济。原创内容,未经许可,谢绝转载。

「唐辰同学」

钛媒体、36氪、老虎财经热榜

澎湃新闻2024年最澎湃创作者

老虎财经2024年度优秀专栏

河南日报·顶端新闻2024年度影响力作者

界面新闻优质榜单

老虎财经2024年度优秀专栏

腾讯新闻年度优质热问答主

2023搜狐新闻年度优质创作者

人人都是产品经理2023年度优秀作者

2023网易新闻年度内容合伙人

界面、36氪、钛媒体、澎湃、21财经、蓝鲸、老虎财经等平台专栏认证作者

文章配图-1

相关推荐