华潮新闻网
财经

DeepSeek融资内幕:梁文锋深度剖析大模型技术路商业哲学

来源:华潮新闻网
DeepSeek融资内幕:梁文锋深度剖析大模型技术路商业哲学

界面新闻记者 | 伍洋宇

界面新闻编辑 | 文姝琪

一个月之前,DeepSeek 圆满完成了第一轮外部融资,总共筹集了超过 500 亿元人民币(约合 74 亿美元),投后估值达到了 500 亿美元(约合 3380 亿元人民币)。

在这轮融资中,创始人梁文锋个人出资大约 200 亿元,是最大的单一投资方。此外,腾讯投入了约 100 亿元;宁德时代体系出资约 50 亿元,其中包含宁德时代和溥泉资本;网易、京东、Monolith 砺思资本、IDG 资本分别投入了约 30 亿元;正心谷投资和拾象科技均出资约 15 亿元。

这一事件迅速成为 AI 行业一级市场的热议焦点。许多业内人士都在关注,为何一家曾经与资本市场保持距离的头部模型制造商,最终选择了接受投资方的邀约。更引人入胜的是,除了长久以来的光环,梁文锋真实剖析的 DeepSeek,其技术路线和商业哲学究竟蕴含着怎样的分量?

近期,一份 DeepSeek 融资期间的核心会议实录被披露,详细记录了梁文锋对于这家公司、这项技术以及整个行业未来的完整思考维度,其中涵盖了大量关于组织文化、技术方向、商业策略和算力基础的核心观点,足以让人洞察这家公司过往那些看似反常却最终可能正确的谨慎决策。

以下是会议实录的摘录,由界面新闻整理编辑:

### 人才、组织与公司愿景

1. 最初创办这家公司时,我们并没有明确想着要赚多少钱,也没有计划进入资本市场。最初的几十名员工完全没有考虑过这些,如果他们这样想,就不会加入我们。

总的来说,我们是怀抱着对世界极大的善意来创办这家公司,认为这是对人类有益的事情,是超越金钱价值的事情。

2. 管理一家大公司,依靠的不是规章制度,而是愿景。愿景不是贴在墙上的标语,而是你实际行动的体现,而不是口头上的阐述,是你实际运营的方式。

因此,我们没有严格意义上的组织架构,完全依靠愿景驱动、由愿景自发形成的。我们并不是以“我要完成什么 KPI、如何考核”的方式来运作,我们只有愿景。

3. AGI 是一个更大的愿景,这个愿景能够吸引更多优秀的人才,它具有更强的凝聚力。所以在组织上我们具备优势,并利用这种优势……这就是一种降维打击。

但是,如果你是一家纯粹的商业公司,你的愿景如果只是服务好 C 端用户,那么你在产品、流量方面会有优势,但在技术上会缺乏优势。而现在最有利的形势是,模型技术才是最核心、最重要的。

4. 在很多方面我们都要保持非常克制的态度,但是我们的核心利益是什么?其实只有一点:我们最大的甚至可以说是唯一的核心利益,就是要保持团队的稳定性。

只要我能够保持团队的稳定性,就一定能做成,一定能实现 AGI。只不过时间早晚的问题,如果遇到挫折大家都不离开,我就可以继续做下去。

5. 我们一直非常克制,不愿意与任何一家互联网大厂或小厂成为竞争对手。我希望能够给大家赋能,或者协助大家做这个事情。在这个前提下,我们很乐意协助、帮助任何人,甚至包括我们的竞争对手,比如阿里、智谱、月之暗面,做得更好。

因为我们并没有因此失去任何东西,我们本来就是开源的,如果你无法复现,可以问我,我会告诉你如何复现。这本来就是开源的一部分,不会因为你是竞争对手就有所改变。

6. 我们公司的管理实际上是两条线:一条是自上而下,一条是自下而上。自下而上就是每个人都根据自己的意愿去探索,没有人管理,没有 KPI。自上而下就是正式的项目,需要集体协作完成,需要全公司配合,比如发布 V4 版本。

我们希望这部分正式的工作不要占用员工一半的时间,剩下的一半时间是自由的,他想探索什么就去做,公司只要算力能支持,他不需要来协调。

7. 我们通常也不加班。加班有两个原因:第一,做研究需要一个相对宽松的环境。如果你压力太大,大家就无法做研究。既然做研究要靠你自己的兴趣,平时自己去琢磨这些问题,就必须在一个宽松的环境中。第二,我们非常专注。

因为克制,所以很多事情我们选择不做。我要做的事情少了,每个人分到的工作就少了。你看到我们的产品很多都不完善,但我们也没有急着去弥补,这也是我们的一种文化。

8. 大家目前面临的问题可能是人才不够,但我认为这种短缺是阶段性的。在任何一个行业发展的初期都是这样。以前做网站、做互联网服务端,刚开始人都很缺乏,但这种人才短缺很快就会被解决,大概两三年,因为会培养出大量的人才。

9. 我们没有模仿的对象,每一步都是根据实际情况,实事求是地分析利弊后做决策,并不是去模仿谁。我觉得我们与贝尔实验室(Bell Labs)还不一样,因为贝尔实验室明确不需要商业化,而我们明确是要商业化的。

我们最终还是要能够生存下去,毕竟我们是一个公司,政府不会给我们一分钱。归根结底要考虑怎么生存。有很多公司做得非常伟大,是因为它有一种超越利润的追求,但那个追求最后并没有影响其商业化,反而让它的商业化做得更好。

### 大模型技术路径与 AGI

1. 从技术路线来看,AGI 的路线图是比较清晰的。AI 的发展,我们可以理解成一个阶梯。去年走的阶梯是 CoT(思维链),我们发现通过思维链的方式,可以让智能达到更高的水平,提升上限。

今年的阶梯就是 Agent,因为我们发现,用 Agent 的方式,AI 的能力范围会更大,智能上限会更高。为什么是阶梯?因为后面的每一步都是基于前面的基础之上的,Agent 要用到 CoT,CoT 也要用到前面的语言模型,没有一步是白走的。

国内目前的情况来看,我觉得最合理的做法应该是全力做通用的 Agent,其他的 Agent 优先级应该更低,包括金融、医疗等 Agent。要先做 Coding,因为 Coding Agent 能够做到很多。

2. 但是,在 Agent 之后,它仍然无法替代人类员工。因为 AI 还缺少一个地方,叫做持续学习。人可以持续学习,你招一个员工,他花两个月熟悉公司的环境和工作就能上手,你说“叫小王来”,他知道小王是谁。但如果 AI 没有这两个月的学习,你必须把小王是谁、什么职务、在哪等所有上下文都给他,这很不现实。

所以我们在 Agent 之后能看到的下一个瓶颈,也是必须解决的问题,就是如何让模型可以持续学习。

3. 持续学习之后,我们可能会来到一个奇点。这个奇点是:当这个模型能够持续学习之后,它已经能够做人类能做的所有事情了。

它可以自己开发自己的版本,自己进行研究去开发下一个更强的人工智能模型,实现自我迭代。这一步完成后,我觉得才是具身智能。到具身智能之后,它就走进现实世界,可以为你做家务,可以为你养老。这是我们的推测。

4. 多模态布局我们一直在做,对 C 端用户产品来说,它很重要。但是对智能的上限来说,它是一个组件,它不是主线本身。多模态我们肯定会做,后续版本也会支持原生的多模态,但我们不把它当作智能本身,它的主线跟搜索一样,搜索是一个组件,多模态也是一个组件。

5. AI 领域非常广泛,有很多东西我们觉得它不在智能的主线上。比如 3D、视频生成,我觉得跟智能的主线没有太大的关系,我们不会去做。像世界模型,我们觉得现在跟智能的上限提高也没有太大的关系,所以我们也不会去做。

像 Sora 出来之后所有大公司、小公司都做,但小公司后来都把它砍掉了。它在商业上是个好生意,但跟智能没有太大的关系,我们只会因为它是智能路线图上的东西才会去做。

6. 我们是信 Scaling 的,肯定是规模越大,效果越好,能够解锁更多的功能。阻止我们 Scaling 的其实就是算力,并不是我们不想 Scaling,是我们没有那么多的算力去做。

我们现在还没有触摸到这个上限在哪里。硅谷在说 Scaling 到头的时候,那是对硅谷来说;对中国人来讲,我们离那个还远得很,我们根本就没有 Scaling 到那个程度。所以我们也会不遗余力地去推进 Scaling 的上限。

7. 在标数据方面,这跟我们的资本投入有关。以我们这个资本投入的结构,支撑不起像美国那么高的高质量数据标注成本,因为太贵了,不管外包还是自己标。

所以我们现在基本上是两条腿走路,先标成本低的。但解决 AI 这个问题,在现在这个阶段,靠的就是标数据。你可以认为,现在我们公司有一半的核心研究员,最重要的人,有一半在标数据。我们就集中精力在标数据上。

8. 现在内部比较看重这样一个叙事:训练我们的下一版模型,希望它能够帮助我们自己的开发,提升 DeepSeek 的效率。

我们做的模型,第一目标不是大家用得好用,而是我们自己用得好用。如果先解决了持续学习这个问题,那么通用智能问题就不在话下了,有了 AI 持续学习的辅助,它能够非常大地提升我们自己研究的效率。

### 开源、商业化与低成本战略

1. 在开源这件事情上,我们一开始就考虑得非常清楚。第一是愿景,第二是我们认为要把 AI 在商业上做成,开源是有好处的。

AI 这个事情足够大,最终它可能占掉人类社会 GDP 的百分之十。这么大的数字,一个人是不可能独占的,你一定得跟别人分享,否则你肯定活不下来。这跟之前开源一个普通的软件是不一样的,因为那个市场没那么大。

如果说我们想独占这个利益,那么一定是要被历史抛弃的。这需要克制,你必须有一套机制确保自己获得的利益是有限的,才有可能做成。

2. 你越克制,你越有可能做成这件事。克制是一种战略,在于有时候你可以舍弃一些,来换取更多其他的东西。AI 这个事情太大了,利益太大了。只要能够做成,最后的利益都会非常大,你随便分一点,就已经很足够了。

所以我们之前说,我们只赚取一个合理的利润,只看你的意愿,而不是利润之大,这和普通的商业思维是不一样的。

3. 我们认为 API 定价一个合理的利润,大概是我们到市场上买一批设备回来,十个月收回成本,我觉得这就是合理的。

这个成本,十个月回本,我们自己能做到,其他家做不到。像阿里或者腾讯,由于他们没有我们这样的优化,他们的成本应该要比这个高好几倍,这里有非常多的优化工作。

4. 在这个价格区间,用户的需求是没有弹性的,就是价格再抬高一倍,token 的消耗量区别不大的,如果贵一倍,我们的总收入接近翻倍。但一开始我们担心需求太多,把模型价格定高了,团队里大家不是很高兴。后来我把价格降下来,降到四分之一,大家就很开心。

我觉得这个才是我们真实的想法。在赚到合理利润的情况下,让大家都用得起。我们降价的时候,公司群里很多人在欢呼,因为这是我们花了这么多精力把模型做好、能让大家充分去用的目的。

5. 去年春节我们用户突然很多,但我们并没有去追求留住这些用户,或者拿去变现,没有在用户上面去抢商业利益,但我们很努力把用户服务好。

我们没有想法说要做成下一个超级 App,然后去跟谁竞争,去做成下一个字节、下一个腾讯。我不跟你去争这个东西,因为后面还有西瓜,前面的可能都是一些小芝麻,不应该什么芝麻都抢。

6. 去年的 C 端、今年的 B 端,我觉得这事要做,要把它做好,但这不是我们的目标。我们公司大部分人不认为这是一个跟 AGI 同等重要的问题。

C 端和B端都是我们做 AGI 路线上的副产物,是一个中间产出。我并不是为了做 C 端或者为了做 B 端而去做它,而是我们为了做 AGI,刚好能产出这个东西,我就把它拿来做商业化了。

7. 开源对我们的商业模式没有任何影响。我也不担心别人部署我们的模型来跟我们竞争,一点都不担心。我只担心他部署不起来,有些细节没做对,效果变差了,或者他的成本会比较高。这里是没有冲突的。

8. 半年前大家讨论的商业化是什么?一定是我要去广告、去做电商,或者要在产品里面植入电商,然后跟本地生活搞在一起,肯定没用的,因为变化太快了。你这个产品,去花很多时间做商业化考虑、商业化路径,它的生命周期会很短。

我觉得还没有到这个时候。在过去三年,任何一个时候你跟我说商业化路径、产品线,都是浪费时间,因为你并不能够预测未来。在任何一个时候你聚焦在产品上都太早了,最大的还是技术的延伸。

### 算力、中美差距与底层基建

1. 我们跟美国的差距主要在资源上面,人上面差距是不大的。因为就是同一批人,可能是中国人,有一些留国内,有一些去国外,去国外的人也并没有说更聪明,它是比较随机的。

而且我们的基数大,每年有那么多人的补充。人才不是瓶颈,资源是最大的瓶颈。资源首先影响到人才培养,因为算力少,我们能做的实验机会比较少,所以我们的人才整体上比美国有差距。人才的差距,本质上也是因为算力的差距。

2. 国内现在做基模的东西太多了,美国可能就三家做,资源只集中在这三家,而中国资源分得很散,每一家拿到的资源就更少,我觉得这肯定是要收敛的,某种程度上也比较浪费。不需要那么多家,现在可能大家觉得做这个事情利润率高,所以一定要自己做。

但当他发现这个事情没有那么高利润的时候,可能就不做了。我不相信有暴利,因为这不符合客观规律。中国最后有个三四家竞争,价格绝对已经够打价格战了,可能就已经比较够了。

3. 大模型竞争,终局的差距应该体现在三方面:一方面成本,一方面时间,一方面用户体验。除此以外,可能是没有什么差距的。

成本肯定是一个差异,我觉得可能成本是排在第一位的区别。然后第二个就是时间,你什么时候能够做到,你早几个月、晚几个月,它就不一样了。第三个可能是体验,中间会有一些用户粘性,但它可能不本质。

4. 英伟达 CUDA 的护城河在快速地被瓦解,原因可能是有三方面。一方面是现在有了 AI,要建立起这个生态比以前容易很多了,因为 AI 可以写代码。

第二,有一些新的技术,比如我们出了一个技术叫 TileLang,是一种高级语言。用这个高级语言来写 CUDA 的算子,可以很快地把英伟达的整套生态全部都写一遍,再结合 AI,这看起来没有什么障碍。

还有就是,计算卡的市场已经比游戏卡大了,以后计算芯片都不再和 CUDA 耦合,都是专用芯片了。在这个背景下,原来英伟达生态的作用就大幅度减少了。

5. 国产 AI 芯片替代现在有一个历史性机会。我们认为,未来一年之内,国产芯片的生态完全没有问题这件事情能够被验证。之前认为是有问题的,认为用不起来、不好用,但是未来我觉得一年之内,我们能够用事实来扭转这些认知。

国产 AI 芯片的硬件和生态都没有问题,唯一有问题的是产能不够。国产卡适配这一点没有障碍,英伟达挡不住。在英伟达的卡买不到的情况下,所有人迫于无奈,都必须去做国产芯片。在这个背景下,国产卡的适配是没有任何障碍的,但还需要时间。

6. 华为给我们的大概是一万六千张卡的产能,互联网大厂可能是十几万张。一万六千卡的华为 950,只相当于四千卡的英伟达 B 系列。所以说这不是一个很大的量,意义不是很大,它只够训我们现在这一代模型,不够训下一代。

华为卡生命周期肯定是会短一点,因为它本来就已经比英伟达晚两年了。华为 950 今年能用还挺好的,明年用我觉得还可以,后面再用我觉得可能就真的太费电了。但我对国产算力是比较乐观的,英伟达是在掘自己的坟墓。

7. AGI 还需要多久?国内硬件在这个时间能追上吗?我觉得在 AI 这个事情上,应该国内一两年是能够做到跟国外差不多的,或者可能今年就能做到平替国外的模型。所以今年应该就能做到的,但它还不是 AGI。

华为的 950 超节点,在性能和价格上可以完全平替英伟达的 GB200、GB300。价格肯定要贵,但贵得有限,比如贵百分之一百,我觉得已经可以在价格上认为平替了,所有 GB300 能做的任务,华为超节点都能做。

8. 我们算力落后是一个事实。这个事实通过三方面来消解。第一方面是我们承受模型落后,我们只能够用比他们更小的模型。但这落后有一个好处,落后意味着你有更多的时间,你有一定的技术,你就可以用巧妙的方法。

所以我们跟美国的差距可能是落后 12 到 18 个月。简单说,就是落后美国两年,然后只用美国二十分之一的算力把这个事情做出来。那么未来我们要把这个叙事改写,就是我们用它几分之一的算力,但是把这个时间缩得更短,缩到 6 个月、 3 个月。

9. 关于公司重大战略、技术业务决定的流程和决策机制。我们公司整体上是建立在共识的基础上的。我并不是说我一个人决定所有事情,而是我要寻求共识。我在公司内的权威以及影响力,是建立在共识之上的。

比如我要做一个事情,我肯定是先看大家的共识是什么,大家想不想做。然后有可能我会进行一些引导或者倾向,但是这引导的作用是非常有限的,必须建立在共识的基础上,我才能够推得下去。

文章配图-1

相关推荐