老金出海AI · GO GLOBAL
创始人说深度文字访谈晚点 LatePost(程曼祺) · 2026年4月6日

V4 发布前的 DeepSeek:梁文锋的人才战、组织哲学与 AGI 执念

V4 发布前的 DeepSeek:梁文锋的人才战、组织哲学与 AGI 执念
阅读原文晚点 LatePost

中文导读

2026 年 4 月,DeepSeek V4 发布前夕,《晚点 LatePost》发布了一篇可能是迄今为止对 DeepSeek 内部最深入的报道。从三位核心研究员春节后离职谈起,揭示了这个「AI 界奇葩」面临的真实张力:人才被字节、小米、腾讯竞相挖角;梁文锋坚持「不加班」管理哲学在全球 AI 圈独一无二;国产算力转型的战略风险与决心;以及他对 AGI 不同于主流的独特理解——不是卷模型性能,而是「生态建设 + 探索少数派方向」。

访谈正文

人才之战

DeepSeek 正处在一个变化的关口。从 2025 年下半年至今,明确已离开的成员包括:王炳宣(DeepSeek LLM 核心作者,被腾讯姚顺雨挖走)、魏浩然(DeepSeek-OCR 系列核心作者)、郭达雅(DeepSeek-R1 核心作者)、以及进入退休状态后加入自动驾驶公司元戎启行的阮翀(Janus-Pro 多模态成果核心贡献者)。

DeepSeek 此前并未融资,没有明确的公司估值。当其它 AI 公司市值或估值高涨,梁文锋正在想办法回答团队成员的疑问:公司到底值多少钱?这关系着员工签的期权协议到底价值几何。

从 2025 年秋天起,梁文锋也开始更多提产品化和商业化。DeepSeek 已有小数十人的产品团队,但尚未涉足 AI 编程、通用 Agent 等热门应用方向,在 C 端仍只有典型的 Chatbot 产品。

梁文锋的新课题还有管理规模。DeepSeek 的人数已超过幻方,是他管过的最大的组织。笼罩以上多重变化的是——DeepSeek V4 仍未正式发布。

据了解,DeepSeek V4 有可能会在 4 月发布。有人离开,更多人选择留下。DeepSeek 在调整,但也有诸多不变的特质。

梁文锋其人:做少数事,做到极致

梁文锋的 AI 目标远早于 DeepSeek 成立的 2023 年。2016 年,AGI 的提出者、DeepMind 创始人哈萨比斯曾组建量化交易团队试图给 DeepMind 创收——结果没赚到钱。同一年,梁文锋做量化投资已经 8 年。

2015 年创立幻方,2016 年开始用 GPU 跑深度学习实盘交易,2017 年底实现"几乎所有交易策略 AI 化",2019 年建立幻方第一个算力集群"萤火 1 号"(1100 张 GPU)。

作为一个不到 30 岁就财富自由的人,梁文锋的生活简单而神秘。在周围人印象中,他会好多天穿同一件衣服,长期住酒店。他身材精瘦、有运动习惯,喜欢徒步等户外运动。

黄仁勋会邀请英伟达员工去家里做客、喝小酒、聊家常,开心地展示跑车。而梁文锋不参与季度团建活动,很少和成员聚餐,年底大团建也只在讲话时露面,不会参与全程。

2022 年,幻方一位员工"一只平凡的小猪"个人向慈善机构捐助 1.38 亿元。后来很多人猜这只小猪就是梁文锋。幻方工作人员的回复是:"员工捐款均是匿名,公司内部也不知道小猪的真实身份。"

在工作范畴里,梁文锋只做少数事。他不做多数初创公司 CEO 做的事,如融资。2023 年小范围见过一些投资人后,他提出了一个不常规的要求:类似 OpenAI 与微软的投资协议,希望投资方接受一个回报上限。这一轮见下来,没有机构投资 DeepSeek。之后两年,他甚至不再见投资人,拒绝了多数此类请求。

梁文锋几乎把所有时间投入到他认为应该聚焦的少数事上,做得细致、做到极致。他的风格不像 CEO,更像一个研究员——和人谈论最多的是具体技术问题。

有一个流传很广的小故事:绿洲资本创始合伙人张津剑分享过,他问自己投资的 MiniMax 创始人闫俊杰"有比你更专注的人吗?"闫俊杰说有一次约一位没见过的朋友吃饭,到早了,看到一位穿 T 恤的小哥,以为是助理。对方开始没有自我介绍,问了闫俊杰很多技术问题。过了半小时,闫俊杰说"梁总什么时候来?"对方说:"我就是梁文锋"。

不加班文化:全球独一无二

在全球 AI 圈都非常特异的一点是,DeepSeek 不加班。当 Google、OpenAI、xAI、字节跳动等中美公司的核心 AI 开发人员每周工作 70-80 小时时,平日里 DeepSeek 的多数员工会在下午 6 点-7 点左右离开公司,他们早上也不打卡。

梁文锋认为:一个人一天能高质量输出的时间很难超过 6-8 小时。加班疲劳下的昏庸判断反而会浪费宝贵的算力资源,得不偿失。

DeepSeek 没有明确的绩效考核和 DDL(截止时间)。这个精简而人才密度极高的组织依然延续"自然分工",研究员可自由组队或独自钻研一些新想法。DeepSeek 给员工免费提供下班后福利,如球类课程、运动场地报销等。

"除了主线之外,DeepSeek 也有人在做一些可能一年都不会有成效的长期研究。""DeepSeek 是一个真心想做研究的人,在国内,甚至全球能找到的最好的地方。"有接近 DeepSeek 的人士说。

当然,DeepSeek 还有一个特点:神秘。尤其 2025 年之后,除了公开发布技术报告外,从创始人梁文锋到团队成员集体"沉默",在 AI 从业者活跃的社交媒体或社区里很难听到他们的声音。

DeepSeek 组织:扁平、交叉分工

与梁文锋的风格相应,DeepSeek 的组织极其扁平、各环节交叉分工、谨慎扩张规模。

创立幻方时梁文锋有合伙人,而 DeepSeek 没有二把手。尤其在研究团队,只有梁文锋和其他研究员两个层级。梁文锋做重大决定,承担最多结果。这部分研究团队现在约有 100 多人,像一个大型实验室。研究员们习惯称 1985 年出生的梁文锋为"梁老板"——但这个老板更像导师:组织研发、协调资源,也做具体研究,在共同成果上署名为通讯作者。

梁文锋本人参与最多的是基模架构团队,会与团队深入讨论后确定每一代基模的架构定版。这个团队有小几十人,他们是预训练的主力。Infra 团队会在模型训练前的定版阶段就参与讨论、给出建议。这几个模块间的紧密合作——交叉分工——是最符合模型训练特点的协作形式。

梁文锋是串起这些不同模块的探测器和粘合剂,他会出席每一个团队各自的会议,了解全局进度和卡点。DeepSeek 大部分团队的周会也向其它团队的人开放,可跨组参会。

深入细节的一号位风格和自发形成的紧密协作都很难在大组织里实现。所以 DeepSeek 会很谨慎地扩大核心研发团队的规模。

在人员构成上,DeepSeek 此前几乎不社招,以应届生和实习生留任为主。2025 年初,在参与过 DeepSeek 三代模型的 172 名研究者中,超 7 成的人小于 30 岁。在 V3 和 R1 之前,DeepSeek 是以大厂约 1/10 的人数、约 1/2 的人均工作时间,以极高的专注和聚焦,跻身全球大模型第一梯队。

但随着触达顶尖 AI 能力需要探索的方向越来越多,继续保持这种组织规模、沟通方式和协作氛围已越来越难。

过去 15 个月:继续做自己,外部世界急剧变化

2025 年初 V3 和 R1 爆火后,DeepSeek 并没有乘胜追击放大招,而是沿着他们专注的方向继续研发。已公开的成果大致有三类:

一是效率优化:极致压榨 GPU 算力,提高单位算力能产出的智能。包括 DeepSeek 在 2025 年初开源周释放的一整套训练与推理 Infra,还有对"注意力机制"的持续改进(NSA、DSA),以及把底层算子库从 CUDA 和 Triton 换成了国产开源的 TileLang。

二是模型架构改进:如 mHC(流行约束超连接),旨在提升大规模训练中的稳定性;在模型之外构建长期记忆的 Engram。外界普遍认为,mHC 会被用到 V4 的训练中。

三是一些"非主流"探索:如 DeepSeek-OCR(把文本转成图片再输入模型)、持续学习、自主学习等。梁文锋还在 2025 年招募了一些神经科学和脑科学背景的顾问,想探索更接近人脑的学习机制。

同期,外部 AI 环境在 2025 年至今急剧变化,最受关注的竞争主线有两条:一是以 coding 能力为基础的 Agentic 模型和应用(Anthropic Claude Code vs OpenAI Codex);二是多模态生成(GPT-4o、NanoBanana、Seedance 2.0)。

DeepSeek 首先没怎么投入多模态生成——梁文锋认为多模态生成不是智能的主线。在 Agent 方向上,V3.2 做了强化,但整体迭代频次低于竞争对手。

DeepSeek 的目标不是最主流的,有人离开、有人留下

DeepSeek 的"特立独行",和梁文锋认同的 AGI 目标有关。除了追求大模型的智能上限外,他认为还有两个很重要的工作:

一是基于国产生态来做大模型。 DeepSeek 会投入对国产 GPU 的适配,以解决高性能 GPU 供给受限的现实。他们采用的 UE8M0 FP8 数据压缩格式"是针对下一代国产芯片设计";用国产开源的 TileLang 替代 Triton,在基础层更有主动权。梁文锋也曾提过这样的假设:"能不能用现存的一部分算力,就实现现在所有的智能?"

二是"原创式创新",做一些大厂或其它创业公司不会去试、不愿去试的方向。 比如 Janus 系列(统一多模态理解与生成)、Prover 系列(形式化证明)、OCR,以及内部在继续做的持续学习和仿生人脑的探索。

作为创始人,梁文锋最在意的,不仅是模型效果本身,也包括追求效果的路上那些更本质、原创的发现。

但这与外界现在对 DeepSeek 的部分期待并不匹配:一些人希望 DeepSeek 每次出手都像 R1 那样石破天惊,这有些强人所难,也不符合技术规律。

梁文锋可以不在意外部期待,但他必须面对和处理内部期待。对更多年轻的研究员来说,做更多前沿研究也需要承担更多不确定性。

DeepSeek 的绝对薪资不低,但外面给的更高。一些猎头告诉我们,竞争对手开出了"难以拒绝的数字","翻 2 到 3 倍问题不大","其他公司开出 8 位数总包"。MiniMax 和智谱上市、股价高涨,阶跃、Kimi 的 IPO 也提上日程,这也让一些 DeepSeek 成员对手中那份没有明确标价的期权产生更多疑问。

面对巨额邀约,更多人选择留下。他们认可梁文锋追求 AGI 的方式,愿意做并非竞争驱动的探索;也习惯了 DeepSeek 相对宽松、从容的研究氛围。

"留下的人多少还是有些理想的。"有接近 DeepSeek 的人士说,梁文锋觉得在提升模型效率和性能的主线外,需要做一些当下回报不明确的方向,因为"国外那些算力更多的公司,内部肯定在试各种方向"。

截至 2026 年 3 月中旬的最新招聘中,DeepSeek 第一次提及其它具体产品的名称,要招募 Agent 方向"模型策略产品经理"——要求"熟悉并深度使用过 Claude Code、OpenClaw、Manus 等知名 agent"。接下来肯定会看到 DeepSeek 在 Agent 产品上的更多动作。

改变世界,也被世界改变

对 AGI 目标的独特认知和拆解,是 DeepSeek 的可贵之处,也是它如今面临内部张力的原因。梁文锋看重的生态建设和原创探索,与业界普遍把"保持最强"视为第一优先级,是重合但并非完全一致的目标。

即将发布的 V4,大概率仍是开源最强模型,但很难是碾压级的强。因为现在不同场景的不同开发者和用户对"强"的标准和体感已越来越多元。

梁文锋意识到了要改变,近期他开始想办法给公司估值,给团队成员更多确定的预期。DeepSeek 也将更多投入产品。

2025 年初,DeepSeek 以慷慨的开源精神和以小博大的奇迹震撼了中国和世界。奇迹之所以是奇迹,就是因为它不常发生,是小概率事件。在中国这个崇尚竞争和结果说话的环境里,敢于追求独特目标的 DeepSeek 的存在本身,是一个令人惊喜的小概率事件。

2025 年 R1 爆火后,梁文锋显示了对追捧的淡然。而现在,他面临另一种情形的考验:在外部竞争加剧时,分辨噪音与信号,坚持该坚持的,改变要改变的。

"低头做事的人也许不一定能在浮躁的市场洪流里笑到最后,但是只有更多 DeepSeek 这样的公司出现,中国科技才有从'复刻'到领跑的可能。"

关键观点

  • 「一个人每天能高质量工作的时间很难超过 6-8 小时」——全球唯一不加班的核心 AI Lab,不是懒,是算力太贵。
  • 人才流失的底层矛盾:DeepSeek 的目标不是主流目标,薪酬也无法与大厂匹敌——梁文锋在赌「少数派」的价值。
  • V4 延迟的核心原因:国产算力转型——重写 40 万行算子、推理速度提升 35 倍,用时间换战略自主。
  • 梁文锋的 AGI 观:不只是模型智能上限,还有「生态建设」和「原创式创新」——做大厂不愿试的方向。
  • 「低头做事的人不一定笑到最后,但更多 DeepSeek 出现,中国科技才有从复刻到领跑的可能。」

访谈信息

讲者
晚点 LatePost(程曼祺)
来源
晚点 LatePost
场合
晚点 LatePost 深度报道 + LateTalk #158,2026 年 4 月
日期
2026年4月6日
阅读原文