ChatGPT可以开我的车吗?自主的法学硕士案例
人工智能已经大了,人工智能模型也是如此。100亿参数通用模型正在粉碎5000万参数特定任务的模型,展示了从单个模型解决许多任务的卓越性能。
人工智能模型也正在成为多模式。微软的Florence 2和OpenAI的GPT-4V等新视觉模型正在扩展这些模型的应用,以结合图像、视频和声音,将大型语言模型(LLM)的力量带入数百万个新用例。
由于在模型工程领域,更大的被证明更好,每个应用程序都经历了类似的进展:
一项任务,一个领域:特定用例的简单模型——道路的对象检测器、室内场景的深度分割模型、图像字幕模型、Web应用程序的聊天机器人等。
一项任务,每个领域:将该简单模型的应用扩展到许多用例——任何地方的对象检测器(YOLO、DINO等)、一切的深度分割(MobileNet)、多个产品的聊天插件)。
每个任务,每个领域:可以做任何事情的大型模型,新法学硕士(例如佛罗伦萨、GPT-4V、ChatGPT)使范式转变成为可能。
每个任务,一个领域:为一个领域优化大型模型,实现实时应用程序和更高的可靠性——例如,用于交互式搜索的GPT-3.5-Turbo,用于研究和起草法律文档的Harvey.ai,用于自动驾驶的DriveGPT。
在小型车型上自动驾驶
自动驾驶仍然在小型车型上运行。虽然许多单任务模型、专用传感器和精确映射的组合提供了一个令人印象深刻的原型,但今天的配方尚未提供支持日常司机所需的安全或规模。
以下是仍然阻碍我们的原因:
零射击概括。现有模型往往会失败到前所未有的场景中,通常被称为驾驶的“长尾”。如果没有经过充分的训练,模型就无法从第一原则中推理下一步该做什么。迄今为止的解决方案是建立另一个特殊用途的模型。难以映射的动态场景是大多数自主产品的一个关键弱点。
解释司机和演员的意图。现有模型无法理解人类互动和意图的微妙之处,无论是车辆内的司机还是车辆外的道路行为者。
准确绘制整个世界地图。虽然地图绘制良好的区域大多是可驾驶的,但准确的高清地图已被证明难以扩展。如果没有准确的地图,基于地图的驾驶就无法正常工作。
缩放车辆。今天的小型机器人轴依靠专门的传感器、昂贵的计算和许多特殊用途模型的组合——这是一个复杂而昂贵的配方,尚未扩展到日常司机。
LLM和长尾问题
在所有应用程序中,模型工程师正在使用LLM作为超能力开发工具,以改进模型工程流程的几乎每个方面。事实证明,LLM对于开发和改进模拟环境、对海量数据集进行排序、理解和标记,以及解释和调试作为神经网络的“黑匣子”非常有用。
也许法学硕士在开发过程中的最大优势之一是能够用自然语言表达复杂的多步逻辑,通过绕过对专家代码的需求来加快开发。事实证明,这在文本总结或代码完成等复杂问题领域非常有用,在代码库中具有复杂的依赖性。
所有这些工程工具都广泛地改善了开发工作,包括自主性,但最有趣和最有影响力的应用直接在于驱动任务本身:推理复杂场景并规划最安全的前进道路。
自动驾驶是一个特别具有挑战性的问题,因为某些边缘情况需要复杂的、类似人的推理,远远超出了传统算法和模型。法学硕士在超越纯粹的相关性,展示真正的“对世界的理解”方面表现出了希望。这种新的理解水平延伸到驾驶任务,使规划者能够通过安全和自然的操作来驾驭复杂的场景,而无需明确的培训。
当现有模型可能因建筑工人出现在十字路口或事故现场周围的路线而感到困惑时,LLM已经表现出以非凡的熟练程度推理正确路线和速度的能力。LLM提供了一条解决“长尾”的新途径,即处理前所未有的情况的能力。在过去的二十年里,长尾一直是自动驾驶的根本挑战。
自主任务的法学硕士限制
今天,大型语言模型对自主应用程序仍然有真正的局限性。简而言之,法学硕士需要变得更加可靠和快速。但解决方案是存在的,这就是艰苦工作的地方。
延迟和实时约束
安全关键的驾驶决定必须在一秒钟内做出。在数据中心运行的最新LLM可能需要10秒或更长时间。
这个问题的一个解决方案是混合云架构,该架构通过数据中心处理来补充车载计算。另一个是专门建造的LLM,可将大型模型压缩成足够小和足够快的外形尺寸,以适应汽车。我们已经看到在优化大型模型方面有了巨大的改进。Mistral 7B和Llama 2 7B的性能与GPT-3.5相媲美,参数少了数量级(70亿对1750亿)。摩尔定律和持续优化应该会迅速将更多这些模型转移到边缘。
幻觉
大型语言模型基于相关性,但并非所有相关性在特定场景中都是有效的。例如,站在十字路口的人可能意味着停车(行人)、去(十字路口警卫)或减速(建筑工人)。正相关性并不总是能给出正确的答案。当模型产生不反映现实的输出时,我们将该结果称为“幻觉”。
通过人类反馈强化学习(RLHF)通过将模型与人类反馈对齐,以了解这些复杂的驾驶场景,为这类问题提供了潜在的解决方案。凭借更好的数据质量,像Llama 2 70B这样的小型模型的性能与GPT-4相当,参数减少了20倍(700亿比1.7万亿)。
研究项目也使更好的数据质量更容易扩展。例如,OpenChat框架利用了强化学习微调(RLFT)等新技术,这些技术可以提高性能,同时避免昂贵的人类偏好标签。
新的长尾巴
语言模型将“一切”编码在其中,但可能仍然没有涵盖每个特定于驾驶的概念,例如导航正在建设的繁忙十字路口的能力。这里的一个潜在解决方案是将模型暴露在长序列的专有驾驶数据中,这些数据可以将这些更详细的概念嵌入到模型中。例如,Replit使用其用户群的专有编码数据,通过微调不断改进其代码生成工具,优于Code Llama 7B等大型模型。
自动驾驶的新未来
自动驾驶尚未达到主流,今天只有少数车辆处理最复杂的城市环境。大型模型正在改变我们开发自动驾驶模型的方式,最终它们将改变自动驾驶——为最终将技术交付给日常司机提供必要的安全和规模。
Prannay Khosla在自动驾驶软件提供商Ghost Autonomy领导模型工程。