节目

19.?行走的Google技术史Jeff Dean:传奇程序员的告别与远征

所属专辑: 跨域请求
主播: 跨域请求
最近更新: 4天前时长: 01:05:38
跨域请求
扫码下载蜻蜓app
听书/听小说/听故事
4.5亿用户的选择
节目简介

Sanjay Ghemawat | MapReduce | 谷歌技术史 | 三驾马车 | 大数据 | 分布式系统 | 比特翻转 | 神经网络 | TPU | Gemini | 谷歌搜索 | 谷歌广告 | 谷歌翻译 | ChatGPT | 聊天机器人 Meena

🎧 本期简介

2026 年 8 月的一天工作日下午,谷歌内部一个平时容纳 300 人的咖啡馆,涌进了 1500 位同事,来送别一个在谷歌写了 27 年代码的程序员。晚上,他照常去上瑜伽课、踢足球,回家后又一条条回复告别消息,直到凌晨两点半。

这位程序员叫 Jeff Dean。作为同行,我早就听过他的名字,也用过他参与开发的技术,但真要介绍他,却说不出个所以然。这次从他的离职消息往回查,我才发现,搜索、大数据、机器学习,这些年学过、用过的东西,竟然有这么多能追到他和同事们的工作里。

这期就顺着他的告别信,把时间倒回早年间的谷歌,来看看这位工程师帮助谷歌做大做强的。我们会认识他的长期编程搭档 Sanjay Ghemawat,看他们怎样在修故障、抠性能、反复重写系统的日常里,做出后来影响整个行业的工具。我们也终于能知道那些“编译器不警告 Jeff Dean,是他警告编译器”的段子是怎么来的了。

当然,工程师的成就之外,Jeff 还有管理者需要面对的争议:最为谷歌 AI 的领导人,聊天机器人为什么迟迟不发布,以至于让谷歌在 AI 竞争中错失良机,被 ChatGPT 抢先一步?研究人员的论文和公司的利益发生冲突时,该怎么办?我想借这一个多小时,聊聊这位“伟大的程序员”。

🎙️ 推荐播客

推荐我们的友台:《科技这碗饭》,主播是八十只耳朵,也就是节目里提到的耳朵老师。

我们两档节目会同时发布,一起从两条线聊谷歌:《跨域请求》沿着 Jeff Dean 的经历,聊他做过的技术、他的编程搭子,以及那些具体的工作现场,是如何成就了今天的谷歌;耳朵老师会在《科技这碗饭》的新一期里,顺着这次谷歌 AI 大洗牌(也就是谷歌 DeepMind 创始人哈萨比斯改任首席科学家而不再带领 DeepMind 团队,和 Google Brain 的联合创始人,Jeff Dean励志创业),聊聊谷歌 AI 的前世今生。如果这期还没听够,欢迎去《科技这碗饭》接着听,把这段故事拼得更完整一些。

🧩 概念解释

本期人物

  • Jeff Dean(杰夫·迪恩):本期主角,1999 年加入谷歌的软件工程师,谷歌的 30 号员工,参与开发搜索、大数据和机器学习系统,后来领导 Google AI,并担任过谷歌首席科学家。

  • Sanjay Ghemawat:Jeff 的长期编程搭档,参与开发 GFS、MapReduce、BigTable 等基础设施;节目里那个敲键盘、把新点子的细节逐一落地的人。

  • Larry Page(拉里·佩奇) / Sergey Brin(谢尔盖·布林):谷歌的两位联合创始人,本期作战室故事里,正在与雅虎谈搜索合作的就是他们。

  • Craig Silverstein:谷歌的第一位员工,节目里简称 Craig;早期搜索索引出故障时,他是最先参与排查的工程师之一。

  • Alan Eustace:曾负责谷歌工程与研究工作的高管,也是 Jeff 当时的上司;节目里认为 Jeff 转去研究神经网络是在“浪费人才”的那个人。

  • Noam Shazeer:谷歌早期工程师,Jeff 曾是他的导师;本期讲到他用网页数据改进拼写纠错,他也是 Transformer 奠基论文《Attention Is All You Need》的作者之一,节目里常简称 Shazeer。

  • 吴恩达(Andrew Ng):斯坦福大学教授、机器学习研究者和教育者,Google Brain 的发起人之一;2011 年 Jeff 开始与他一起研究神经网络。人物介绍

  • Oriol Vinyals:人工智能研究者,曾与 Jeff 共同担任 Gemini 的技术负责人;也是本期提到一起创办 Discovery Loop 的老同事之一。

  • Quoc Le:人工智能研究者,与 Jeff 长期共事,也是本期提到的 Discovery Loop 联合创始人之一。

  • Timnit Gebru:曾任谷歌伦理 AI 团队联合负责人,2020 年围绕大语言模型风险论文的内部审查,与公司发生冲突;节目里简称 Gebru。

  • Margaret Mitchell:曾与 Gebru 共同领导谷歌伦理 AI 团队,研究 AI 的公平性与风险;节目里提到她在 Gebru 离开几个月后也被解雇。

  • Sundar Pichai(桑达尔·皮柴):本期提到的谷歌 CEO;在研究团队争议、挽留 Jeff 等人以及支持新公司这几段故事里出现。

  • Heidi:Jeff 的妻子;她谈到 Jeff 与 Sanjay 的关系时,说过“他们互相想念对方”,她也见证了两位搭档在工作之外的长期友谊。

  • Chuck Norris(查克·诺里斯):美国动作演员;网上有一类把他夸张成无所不能的段子,Jeff Dean Facts 借用了这种玩梗形式。

  • Derrick Rose(德里克·罗斯):美国篮球运动员,也是主播喜欢的 NBA 球星;开头借他问儿子的“do you wanna be good or great”,引出对程序员职业的思考和对 Jeff 的评价。

  • 汪淼 / 秦始皇(《三体》中的例子):汪淼是小说第一部的主角之一;节目借他进入游戏后看到的“秦始皇人列计算机”,用士兵举错黑白旗来解释比特翻转。

公司、团队与机构

  • DEC(Digital Equipment Corporation,数字设备公司):一家老牌计算机公司;Jeff 和 Sanjay 在加入谷歌前,就在它的研究机构里认识并开始合作。

  • Alphabet:谷歌的母公司;节目后半段提到,它也投资了 Jeff 等人创办的新公司。

  • Google Brain / DeepMind:谷歌的两支重要 AI 研究团队,前者在节目里也叫“谷歌大脑”;两者在 2023 年合并为 Google DeepMind。

  • Gemini / Meena:Gemini 是谷歌的 AI 模型系列;Meena 是谷歌较早研究的对话模型,本期借它讨论“做出聊天机器人”和“决定公开发布”之间的差别。

  • ChatGPT / Claude:分别是 OpenAI 和 Anthropic 推出的 AI 助手;本期把 ChatGPT 作为谷歌聊天产品决策的对照,也提到了第一期对 Claude 模型内部特征的介绍。

  • Discovery Loop:Jeff、Sanjay、Quoc Le 和 Oriol 共同创办的公司;本期介绍的方向是用 AI 加快“提出想法—做实验—看结果—再尝试”的科学研究循环。

  • KDD:数据挖掘与知识发现领域的重要学术会议,Jeff 在会上展示了本期据以展开的离职日程表。

  • GoFundMe:在线筹款平台;告别视频会上,同事开玩笑说要给 Jeff 发起筹款,类似节目里说的“给他建个水滴筹”。

  • NASA / NSA:分别是美国国家航空航天局和美国国家安全局;前者出现在高可靠硬件的例子里,后者出现在 Hadoop 数据分析的例子里,两者不是同一个机构。

  • 《纽约客》 / WIRED / Nature:分别是美国综合性杂志、科技媒体《连线》和学术期刊《自然》;本期用到的人物报道、创业报道和芯片布局论文来自这几类不同的材料。

计算机、大数据与程序员用语

  • 搜索索引 / 爬虫:索引是搜索引擎提前整理好的网页“目录”;爬虫负责访问和收集网页,供系统建立、更新这份目录。

  • 分布式系统 / 计算机集群:把多台通过网络连接的计算机组织起来,共同存数据、做计算;“集群”指这群机器,“分布式系统”还包括让它们协作的软件与规则。

  • 并行计算 / 容错:前者让多个计算任务同时进行,后者让部分机器或任务出错时,整个系统仍能继续工作;两者贯穿了 Jeff 和 Sanjay 的优化故事。

  • 比特与二进制:比特是计算机存储信息的基本单位,可取 0 或 1;二进制用这两个数字来表示数值,程序和数据在机器中最终也以比特形式存储。

  • 比特翻转(Bit Flip):内存或寄存器等计算机元器件中发生的一种错误,使得原本存储的 0 变成 1,或 1 变成 0;这种错误下,即使程序逻辑没错,也可能让结果出问题。

  • 内存 / 寄存器 / 硬盘:都是存放数据的地方;寄存器供处理器直接使用,内存存放运行中的数据,硬盘用于较长期保存文件,它们的速度、容量和成本差别很大。

  • 谷歌三驾马车:GFS、MapReduce、BigTable,分别对应大规模数据的文件存储、分布式计算和结构化数据管理。

  • GFS(Google File System):把大文件切成块、分散存到多台机器,并保留副本的分布式文件系统,单台机器坏掉不必导致文件丢失。原论文

  • MapReduce:把大量数据的处理工作拆给多台机器,再汇总结果的编程模型;机器故障和任务调度等复杂工作由框架处理。

  • BigTable / Spanner:前者用于分布式管理大量结构化数据,后者是支持跨数据中心事务的分布式数据库;Spanner 在告别信的项目清单里出现,但不属于通常所说的早期“三驾马车”。BigTable 论文 / Spanner 论文

  • Hadoop / HDFS / HBase:Hadoop 是受谷歌相关论文启发发展起来的开源大数据生态,“开源”指按许可证公开代码,允许他人使用、研究或修改;HDFS 负责分布式文件存储,HBase 是受 BigTable 启发的分布式数据库。

  • 编译器 / debug:编译器把源代码转换成另一种可供后续执行的形式,并可能提示错误;debug 是定位和排除程序故障,不只是修改语法错字。

  • 代码审查 / LGTM:代码合并前,请其他工程师检查改动;LGTM 是“Looks Good To Me”的缩写,大意是“我看没问题”,不等于代码绝对没有错误。

  • IC(Individual Contributor) / L11:IC 是个人贡献者职业路线,与管理路线相对,主要通过专业工作作出贡献;L11 是节目讲到的谷歌高级技术职级,Jeff 和 Sanjay 获得的称号是 Senior Fellow。

  • Jeff Dean Facts:程序员圈里夸张吹捧 Jeff Dean 的段子合集,“优化光速”“圆周率最后四位”等等,都属于玩梗。

  • TurboTax / Turbot Ax:前者是报税软件,后者可拆成“比目鱼”和“斧头”;节目用这次荒唐的拼写纠错,说明谷歌早期购买的拼写纠错软件,只差一个词语切分,意思也可能完全变样。

  • Chromebook:运行 ChromeOS 的笔记本电脑;Jeff 交回公司的那台电脑,就是节目末尾聊到的 Chromebook。

机器学习与 AI

  • 神经网络 / 深度学习 / 神经元:神经网络由许多相互连接的计算单元组成,深度学习通常使用多层网络;其中的“神经元”是数学计算单元,节目里说它看到猫会“放电”,是在形容它对某类输入反应强烈。

  • 无监督学习 / 自监督学习:都可以减少对人工标注答案的依赖;自监督学习会从数据自身构造训练目标,无监督学习则更广泛地指从没有人工标签的数据里发现结构,两者并非完全同义。

  • 反向传播:从模型输出产生的误差往回计算各层参数的影响,帮助训练过程决定该怎样调整参数。

  • 语言模型 / Token:语言模型学习文本的统计规律,生成文本时常逐步预测下一个 token;token 是模型处理文字的单位,可能是一个字、词的一部分或标点,不一定等于一个完整单词。

  • Transformer:一种利用注意力机制处理序列信息的神经网络架构,是许多大语言模型的基础;《Attention Is All You Need》就是提出它的论文。原论文

  • 缩放定律(Scaling Laws):描述模型规模、训练数据量和计算量增加时,模型表现如何变化的一类经验规律,并不保证投入增加就能解决所有问题。

  • 幻觉:AI 生成了听起来像真的、却没有依据或与事实不符的内容;本期讨论谷歌为何迟疑发布聊天机器人时,提到了这类风险。

  • CPU / GPU(显卡的核心处理器):CPU 是处理各类任务的通用处理器,GPU 擅长并行执行大量相似计算,因此也适合神经网络中的许多运算。

  • TPU / TensorFlow:前者是谷歌的机器学习专用加速芯片,后者是开发和运行机器学习模型的软件框架。

  • AlphaChip / 可复现性:AlphaChip 用 AI 辅助安排芯片布局;可复现性是指其他研究者能否依据公开的方法、代码和数据验证研究结果,也是本期争议段落的关键。

上面几项 AI 基础术语也可对照 Google 机器学习术语表 查阅。

🔁 提到的往期节目

⏱️ 章节时间戳

00:05 开场与友台推荐:这次从一个人的故事聊谷歌

04:48 最后 48 小时:139 人视频会,和一封告别邮件

09:07 搜索停在五个月前:谷歌早年的作战室危机

13:51 比特翻转:宇宙射线和《三体》里举旗的士兵

19:49 谷歌三驾马车:海量数据怎么储存、计算算、查询?

24:22 硬核优化到硬盘外圈这种物理层面,再把一整个数据中心变成好用的工具

28:50 “极速报税”(TurboTax)变成“比目鱼斧头”(Turbot Ax):拼写纠错与广告生意

31:08 把核心王牌发表成论文共享给学术界:Hadoop 和开源社区接棒

32:41 从补全单词到预测下一个词:语言模型早就萌芽了

35:55 Jeff Dean Facts:关于 Jeff 的梗文化合集

38:36 程序员的职业天花板是一对长期搭档

40:20 43 岁转向神经网络:一次被认为是“浪费人才”的选择

44:05 从翻译提速到自造芯片:Jeff 的立项决定是通过 Latency numbers 计算出来的

48:38 聊天机器人早于 ChatGPT 做出来,为什么没有发布?

50:05 Timnit Gebru 事件:研究自由与公司的内部审查

52:35 AlphaChip 争议:AI 设计芯片,究竟该怎么比较?

54:40 Jeff 和 Sanjay 写代码的时间少了,因为想念彼此,形成了周五家庭聚会的习惯

57:04 Discovery Loop:和老搭子们一起创业

59:53 回到告别现场:1500 人、400 条消息和一台 Chromebook

01:04:00 只失业一秒钟:下一段故事,继续和老朋友一起

📚 参考资料

人物、访谈与告别现场

技术与研究争议

补充说明:节目谈到了 Nature 在 2023 年对芯片布局论文发布的编辑提示。后续在 2024 年 9 月 26 日,Nature 撤下了该提示,表示经发表后复审,相关性能疑问已得到令编辑满意的解决,并关闭调查。这是期刊对该次调查的处理结果,不宜把录音中提到的历史提示理解为调查至今仍未结束。见 Nature 论文更新记录

🖼️ 配图

图 1|挤满同事的咖啡馆:日程表记下了约 1500 位同事参加告别会,下面是现场照片,对应节目最后一段的告别故事。来源:量子位 / 36氪报道,截自原文,图片版权归原权利人。

图 2|交回去的工牌和电脑:笔记本上还能看到 Google Brain、BigTable、TensorFlow 等贴纸,和这期聊过的技术一一碰上。来源:量子位 / 36氪报道所引 Jeff Dean 照片,引自原文,图片版权归原权利人。

图 3|每个程序员都应该知道的数字:Jeff Dean 在 LADIS 2009 主题演讲中列出了读缓存、读内存、硬盘寻道和跨洲传输等操作的耗时,对应节目里那张让我“被程序员行业除名”的表。图中是 2009 年的历史数值,不能直接当作今天硬件的性能指标;ns 是纳秒,1 毫秒等于 100 万纳秒。来源:Jeff Dean,LADIS 2009 keynote,第 24 页,公开演讲材料截图,版权归原权利人。

图 4|把时间差画出来:Colin Scott 将这类延迟数字做成了可以切换年份的交互图,这张截图选择的是 2020 年档位。不同颜色使用不同的时间单位,阅读时要连同图例一起看;它帮助我们理解数量级差异,并不是本期对当前电脑做的实测。来源:Colin Scott:Numbers Every Programmer Should Know By Year,项目页面截图,署名 Colin Scott。

图 5|两位编程搭档站在同一层:这张自制职级图按《纽约客》2018 年报道整理,方便对照节目里从 IC 路线讲到 Senior Fellow 的部分。图中“仅有两位”、入职级别和人员占比等描述应放回当年的报道语境,不作为谷歌现行官方职级标准。来源:The Friendship That Made Google Huge,自制资料图;本次于 2026-09-07 核对所引原文的历史口径。

图 6|最后 48 小时的原始时间表:Jeff 在 KDD 2026 主题演讲中展示了告别会议、瑜伽、足球、深夜回消息,以及失业一秒钟后成为联合创始人的日程。这就是节目开头和结尾反复回到的那张表。来源:量子位 / 36氪:KDD 2026 主题演讲现场报道,引自报道中的会场照片,版权归原拍摄者及相关权利人。

图 7|和老同事一起开始下一段:这张材料包含 Jeff 的官宣帖、公司介绍和四位联合创始人的合影,对应节目里 Jeff、Sanjay、Oriol、Quoc 再次一起创业的故事。来源:Jeff Dean 官宣帖Discovery Loop 官网,截图整理引自量子位 / 36氪报道;官方物料与公开帖文截图,版权归原权利人。

图 8|让探索一轮轮继续:Discovery Loop 的标志把“Loop”里的两个字母 O 连成无限符号,下面写着“Continuous Exploration(持续探索)”。它呼应了节目里“提出想法—实验—反馈—再尝试”的循环。来源:Discovery Loop 官网,官网画面引自量子位 / 36氪报道,公司官方物料,版权归 Discovery Loop。

💬 一起同行
欢迎加入听友群~
加微信 "cliu21",备注“听友”。
群里会分享我自己和大家在用的 AI 工作流和资讯,希望能让AI 真正解决大家的问题。
也欢迎来聊天、吐槽、给节目提建议。


在小宇宙查看该单集文稿
评论
还没有评论哦
回到顶部
/
收听历史
清空列表