特斯拉 AI 日 2021
下一篇特斯拉 AI 日 2022- 场合: 特斯拉第一届 AI 日,2021-08-19 在帕洛阿尔托总部举行,是一场以招聘为主要目的的技术展示。马斯克开场,随后交给几场深入的工程报告:安德烈·卡帕西(视觉)、阿肖克·埃卢斯瓦米(规划)、米兰·科瓦奇(自动标注)和加内什·文卡塔拉马南(Dojo 超级计算机)。最后是出人意料的特斯拉机器人/擎天柱发布(台上是一个穿着机器人服装的人),以及一段很长的观众问答。
- 形式: 约 2 小时 44 分钟的直播;实质内容在 47:09–2:31:13(前 47 分钟是等候画面)。
- 日期: 2021-08-19(直播)。
- 可信度等级: lower-trust-full-transcript(三级来源),依据来源信任登记表。原始材料内嵌了一份粉丝整理的人工文字稿(
elonmuskinterviews.wordpress.com,分三部分转写),确实带有明确的发言人标注和视频时间戳;尽管如此,引语仍按三级来源对待,需要对照视频核实,措辞不确定的地方做了转述。 - 引语出处: 权威原件是特斯拉的直播视频,所以每段引语都锚定到 YouTube 上传视频(
https://www.youtube.com/watch?v=j0z4FweCy4M),并带上&t=<秒数>s时间戳,时间戳取自文字稿中保留的、位于引语处(或紧挨其前)的视频时间。不用#:~:text=(视频来源);原始文件路径和粉丝博客的网址都从不用作出处。 - ⚠️ 发言人归属提醒: 这是一场多位演讲者的活动,文字稿标出了每一位发言人。视觉、规划、自动标注和 Dojo 这几场工程深度报告,出自卡帕西、埃卢斯瓦米、科瓦奇、文卡塔拉马南和 AI 团队的其他成员,不是马斯克,不作为他的话引用。这里只把标为
Elon Musk:的内容做成引语块;问答环节只用马斯克本人的回答,从不引用观众的提问。
⚠️ 三级来源提醒。这份文字稿是粉丝整理的人工转写(质量很高,带发言人标注和时间戳,但不是特斯拉官方文字稿)。它使用弯引号排版(’ 撇号、“ ” 引号),这里原样照录,好让引用保持逐字节准确。特斯拉机器人的发布是一段约 4 分钟、只有一个时间戳的发言(2:06:49),所以那段独白里的几处引语共用 &t=7609s 这个锚点。大量繁重的工程内容(HydraNet、Transformer、向量空间、MCTS 规划、自动标注、D1 芯片与 Dojo 架构)是其他演讲者的工作,完全不收;只引用马斯克的思维材料。
概要
特斯拉 AI 日 2021 是 2021 年 8 月的数据点。它最有用的地方在于,这是擎天柱的首次公开发布,比本百科此前记录的最早的擎天柱材料,即 2021 年 12 月莱克斯·弗里德曼 #252 中的讨论,还早了几个月。整场活动几乎都是马斯克以外的人讲工程,不在本百科范围内。他本人贡献了四条思维线索。
第一,特斯拉是什么。他一开场就坚称特斯拉“远不只是一家电动车公司”,有着“深厚的 AI 业务”,而且“可以说是现实世界 AI 的领导者”。这就是把公司重新定位为 AI 和机器人公司,比 2025 年宏图计划把它写进制度早了好几年。第二,擎天柱的发布本身:既然汽车已经是“长着轮子的半有知觉的机器人”,那么“把它放到人形上也就说得通了”,用来“消除危险、重复和无聊的任务”。这台机器人被刻意设计成你“能跑得过它,而且很可能制服得了它”。他还用对待 AI 的同一套逻辑说,应该小心地造它,因为“我们不造,别人也会造”(人形机器人)。第三,他当场推出的劳动经济学结论:“经济是什么?……是劳动”,所以在一个不缺劳动力的世界里,“体力劳动将成为一种选择”,“将需要全民基本收入”,他还更进一步:“经济有没有任何真正的上限?也许没有”(可持续的富足)。第四,在问答中,他给出了一条简洁的自动驾驶原则:“最高指令是‘别撞上’”,哪怕是认不出来的物体(“一个 UFO”),也必须在不作分类的情况下避开。此外还有他把一贯的迭代速度论点用到 Dojo 上。
特斯拉“远不只是一家电动车公司”:重新定位为 AI 和机器人公司(特斯拉)
马斯克的开场是一段招聘宣讲,立足于一个关于公司本质的论断:特斯拉不是汽车制造商,而是一家碰巧卖车的 AI 公司:
“Tesla is much more than an electric car company, that we have deep AI activity in hardware” ↗
“特斯拉远不只是一家电动车公司,我们在硬件上有深厚的 AI 业务”
“I think arguably the leaders in real world AI as it applies to the real world” ↗
“我觉得,可以说我们是现实世界 AI 的领导者,也就是应用于现实世界的 AI”
“现实世界 AI”,即在物理空间里感知和行动的 AI,是把汽车、Dojo 和即将亮相的机器人串成一家公司的主线。这就是 2025 年宏图计划以公司名义表述的“把 AI 带进物理世界”论点,只不过这里是它 2021 年第一人称的招聘版本;2025 年那句“唯一重要的……是自动驾驶和擎天柱”,在这里也已初具雏形。
擎天柱发布:汽车即机器人的逻辑,以及“确保它是安全的”(人形机器人)
发布时的推理是一个连续性论证:特斯拉已经造出了一台现实世界 AI 机器(汽车),所以人形机器人就是同一个大脑换了一副身体。前提是:
“Tesla is arguably the world’s biggest robotics company because our cars are like semi-sentient robots on wheels” ↗
“特斯拉可以说是世界上最大的机器人公司,因为我们的车就像长着轮子的半有知觉的机器人”
他给它的用途,是接手人们不想干的活,而且用一副适应人类世界的身体:
“it’s intended to be friendly, of course, and navigate through a world built for humans, and eliminate dangerous, repetitive, and boring tasks” ↗
“当然,它的设计初衷是友好的,能在为人类建造的世界里行动自如,消除危险、重复和无聊的任务”
最能说明他思维的是,他把机器人的身体极限设计成一项安全特性:慢到你跑得掉,弱到你制得住:
“you can run away from it and most likely overpower it” ↗
“你能跑得过它,而且很可能制服得了它”
对于为什么要造它,他用的是对待 AI 的同一套逻辑:既然它无论如何都会到来,不如由一个重视安全的人来造:
“if we don’t, someone else would, will, and so I guess we should make it” ↗
“我们不造,别人也会,肯定会造,所以我想我们应该把它造出来”
这是本百科中擎天柱的首次发布,是这组信念 2021 年 8 月的起点。后来 2021 年 12 月莱克斯·弗里德曼 #252 中“工作将变成可选项”和陪伴的讨论,以及 2024 年和 2025 年“史上最大的产品”的宣讲,都是在此基础上展开的。(机器人的参数,即身高 5 英尺 8 英寸、八个摄像头、FSD 计算机、时速约 5 英里,属于产品细节,放在正文里交代。)
“经济是什么?……是劳动”:富足的结论(可持续的富足)
站在机器人旁边,马斯克从它一路推到经济学,得出了他一贯的后稀缺结论。劳动这个前提,以及它的第一个推论:
“what is the economy? It is, at the foundation, it is labor. So, what happens when there is, you know, no shortage of labor? That’s why I think long term that there will need to be universal basic income” ↗
“经济是什么?从根本上说,它是劳动。那么,当劳动力,你知道,不再短缺的时候,会发生什么?所以我认为,从长远看,将需要全民基本收入”
最终状态:工作是自选的,而不是必须的:
“physical work will be a choice. If you want to do it, you can, but you won’t need to do it” ↗
“体力劳动将成为一种选择。你想干就可以干,但你不需要非干不可”
还有最宏大的论断:劳动力一旦不再稀缺,经济也许就没有天花板了:
“capital equipment is just distilled labor, then, is there any actual limit to the economy? Maybe not” ↗
“资本设备不过是提炼出来的劳动,那么,经济有没有任何真正的上限?也许没有”
这是明确与机器人发布绑在一起的富足论点,也是 2024 年“经济没有真正的上限”那句话在 2021 年的起点。它重申了 2017 年那条自动化 → 全民基本收入 → 富足的链条,只是这次把擎天柱当作了具体的动因。“体力劳动将成为一种选择”这个说法,和同一年的 2021 年“工作将变成可选项”是一回事;它也是 2025 年“全民高收入”这条线的早期形态,当时还叫“基本收入”。
自动驾驶的最高指令:“别撞上”,认不认得出来都一样(自动驾驶)
问答环节里,有人问到多模态和语言,马斯克把自动驾驶的目标归结为一条规则和一种失败模式。最高指令是:
“the prime directive is ‘don’t crash’” ↗
“最高指令是‘别撞上’”
由此引出一个第一性原理式的推论:避撞不需要分类。不管车能不能叫出一个物体的名字,都必须避开它:
“Even if it’s a UFO that crash-landed on the highway – still don’t hit it. It should not need to recognize it in order to not hit it” ↗
“哪怕是一个迫降在高速公路上的 UFO,也照样别撞上。它不应该需要认出那是什么,才能不撞上它”
这和本百科从 2017 年(“解决了视觉,自动驾驶就解决了”)一直追踪到 2019 年“激光雷达是傻子才干的事”的推理如出一辙:依靠摄像头和视觉,从问题本身出发推导。只不过这一次,它指向的是目标函数:把安全定义为“别撞上它”,而不取决于感知系统能不能给世界贴标签。
迭代速度:Dojo 的理由(工程算法)
被问到 Dojo,马斯克用他一贯的创新速度论点来解释这台超级计算机为什么重要:进步等于迭代次数乘以每次迭代的进步,所以缩短每次迭代的时间才是关键杠杆:
“if you can reduce the time between iterations, the rate of improvement is much better” ↗
“如果你能缩短两次迭代之间的时间,改进的速度就会好得多”
他还给 Dojo 定了一个很有他特色的行为试金石:“如果软件团队想把 GPU 集群关掉,它就成功了”(转述)。这和他在别处用的“看人们是不是真的换过去”的直觉是同一种。Dojo 架构本身(D1 芯片、训练模块、ExaPOD)是文卡塔拉马南的工程工作,不在范围内。这与火星学会 2020上那句“让我们的创新速度呈指数级提升”是同一套“加快周期”的逻辑,只是这里用到了神经网络训练上。
关联(涉及的页面)
- 特斯拉——扩充了 AI 日 2021 上“远不只是一家电动车公司”/“现实世界 AI 的领导者”的重新定位(特斯拉是一家 AI 和机器人公司),时间是 2021 年 8 月,介于 2016 年和 2023 年两份宏图计划之间。
- 人形机器人——扩充了擎天柱的首次发布(2021 年 8 月):汽车即机器人的连续性逻辑(“长着轮子的半有知觉的机器人” → 人形),消除无聊任务的用途,刻意设计得能被制服的安全性,以及“我们不造,别人也会……要确保它安全”这种既然不可避免、就由自己负责的思路。
- 可持续的富足——扩充了与机器人发布绑在一起的劳动经济学结论(“经济是什么?……是劳动”;“体力劳动将成为一种选择”;“全民基本收入”;“经济有没有任何真正的上限?也许没有”),这是“经济没有上限”这一说法在 2021 年的起点。
- 自动驾驶——扩充了“最高指令是‘别撞上’”这条规则,以及“不必认出来也能避开”的第一性原理安全原则。
- 埃隆·马斯克——扩充了“特斯拉 AI 日 2021 揭示了什么”一节,串起 AI 公司的定位、擎天柱发布、富足的结论、自动驾驶的最高指令,以及迭代速度的理由。
- 工程算法——记录了重申:迭代速度和创新速度是 Dojo 的理由(引语块放在 埃隆·马斯克 页面)。
- AI 生存风险——记录了重申:“我们不造,别人也会……要确保它安全”这种既然不可避免、就由自己负责的逻辑,与他对待 AI 的逻辑相同(引语块放在 人形机器人 页面)。