人工智能 频道

人工智能的硬件基石:细数四大核心处理器

  人工智能(AI)常被描述为一场软件革命,这一判断具有充分依据。神经网络结构的持续演进、Transformer架构的提出与广泛应用、大型语言模型(LLM)的规模化落地,共同构成近年来技术进步最显著的主线。算法突破直观呈现了AI能力的跃升,也容易使人将发展动因归结于模型本身。

  但现代人工智能实现突破性的可能,高度依赖硬件能力的根本性提升。训练大型语言模型需在海量数据集上执行数万亿次数学运算;文本生成图像任务须在数秒内完成数十亿次计算;智能手机等终端设备运行AI功能,则要求计算在短时间内快速完成,且功耗极低。

  传统计算机硬件并非为人工智能设计。然而,随着AI模型规模的持续扩大,对计算能力的需求日益增长,新的硬件架构便成为运行这类模型的必要条件。如今,中央处理器(CPU)、图形处理器(GPU)、张量处理器(TPU,谷歌自研的AI神经网络张量/矩阵运算专用加速芯片,用于大模型训练与推理,能效显著高于通用GPU)以及神经网络处理器(NPU),均在人工智能领域发挥着重要作用。

  本文将解析驱动现代人工智能技术的硬件,并阐述不同任务在处理器选型上的技术考量。

  为何AI需要专用硬件

  要理解人工智能为何需要专用硬件,不妨先回顾机器学习过程中的计算特性。本质上,训练神经网络需要对一组数据反复执行数学运算,其中大部分涉及矩阵乘法与张量积,且这类运算需重复数百万甚至数十亿次。

  这与其他软件应用程序存在显著差异。例如,网络浏览器的主要任务是响应用户输入和加载资源,而人工智能应用程序则通常需要对海量数据重复执行相同的操作。

  因此,人工智能若要实现高性能,必须支持大规模并行计算。这种对高并发、规则化、可重复计算模式的刚性需求,直接推动了面向人工智能优化的专用硬件的发展。

  下面我们就来谈谈具体的硬件!

  CPU:通用的元老级硬件!

  谈及硬件,需从中央处理器(CPU)说起。CPU是现代计算的基础单元,存在于每一台笔记本电脑、智能手机、工作站和服务器中,承担系统调度、指令执行与任务协调等核心职能。

  CPU的设计目标是兼顾通用性与灵活性,能够高效处理各类指令序列,并在不同任务间快速切换上下文。我们可以将CPU比作一位技艺精湛的多面手——它既能胜任多种不同工作,又能灵活适应不断变化的需求。

  为实现这个目标,CPU通常包含少量功能强大的核心。这种设计使其成为运行操作系统、管理内存、处理用户交互、协调软件应用程序以及执行逻辑判断等任务的理想选择。

  尽管CPU功能强大,但其设计并未针对大规模同构数据的并行计算进行优化。因此,在处理人工智能工作负载——例如需对数千乃至百万级数据点重复执行相同操作时,CPU的计算吞吐效率会明显受限。

  因此,CPU虽仍是人工智能系统的重要组成部分,却通常扮演协调与支持的角色,而非承担大部分繁重的数学运算任务。

  在现代人工智能流程中,CPU主要负责数据的加载与预处理、硬件设备间的通信协调、训练工作流程的管理,以及计算任务的调度安排。  

  GPU:深度学习革命背后的引擎

  若要论及与现代人工智能联系最为紧密的硬件,图形处理单元(GPU)无疑是首要代表。

  GPU最初是为视频游戏和可视化应用程序的图形渲染而开发设计。渲染一副图像需要对数百万像素执行高度相似的数学运算,这本质上是一个并行处理过程。因此,GPU采用数千个规模较小、结构统一的计算处理核心,可同时执行大量相同指令。

  研究人员很快发现,神经网络的训练过程具有类似特征:在大规模数据集上反复进行矩阵乘法运算,这些操作可高效拆分并分发至众多核心并行执行。因此GPU成为深度学习训练的主流硬件平台。

  CPU侧重通用性与任务切换灵活性,GPU则聚焦高吞吐量并行计算。这一差异显著缩短了模型训练周期——过去需数周或数月完成的任务,如今可在数天甚至数小时内达成。

  当前,多数先进人工智能模型依赖由数百乃至数千块GPU组成的集群进行训练。深度学习革命不仅源于算法演进,更离不开GPU所提供的规模化、高效率计算支撑。  

  TPU:专为人工智能设计的硬件

  GPU已在人工智能领域确立重要地位,而张量处理单元(TPU)作为专用硬件新成员随之出现。TPU由谷歌开发,核心目标是加速神经网络中高频出现的张量运算,特别是矩阵乘加(GEMM)与卷积操作。

  TPU并不追求通用计算能力,而是专注于机器学习训练与推理中的特定运算环节。这种高度专业化的设计具有显著优势:不仅能实现更高的计算吞吐量与更优的能效比,还能降低指令开销,并深度适配典型的机器学习应用场景。

  随着人工智能工作负载在算力需求、部署规模与能效约束等方面的要求持续提升,硬件设计思路正从通用架构向特定领域优化演进。TPU正是这一趋势的典型代表,目前已深度集成于谷歌云平台,在训练全球规模最大的一批人工智能模型中发挥着关键作用。  

  NPU:让人工智能走进现实

  并非所有人工智能工作负载都发生在数据中心。事实上,大量人工智能应用直接部署并运行于个人设备终端。在本地运行人工智能具有诸多优势,例如可显著降低延迟、提升数据隐私保护水平,同时减少对持续云连接的依赖。

  为满足终端设备本地运行人工智能的高效需求,制造商推出了神经网络处理器(NPU)。NPU专为人工智能推理任务设计,与侧重大规模训练的GPU不同,其架构聚焦于已训练模型的低功耗、高效能执行。

  这一特性使其在现代消费电子设备中得到广泛应用:智能手机的人像增强、语音唤醒、实时字幕生成与离线翻译等功能,大多由NPU直接实现。

  随着人工智能加速融入日常消费类终端设备,NPU正逐步成为继CPU、GPU之后普及的第三类基础计算单元。  

  协同运作

  现代人工智能系统很少依赖单一硬件组件,而是整合了多种专门技术,每种技术都针对特定功能设计。  

  硬件的选择很大程度上取决于具体任务需求,不存在适用于所有场景的“更优”人工智能处理器。

  不同人工智能任务的特性差异显著:模型训练需高吞吐与大显存带宽支撑,云端推理注重低延迟与高并发能力,终端侧应用则优先考虑能效比与实时响应。现代系统正采用CPU、GPU、TPU、NPU等异构硬件协同工作的架构,各类硬件各司其职、相互补充。

  结语

  人工智能的飞速发展常被归功于算法的进步,但硬件同样在幕后发挥着举足轻重的作用。

  CPU为现代计算奠定了基础,GPU推动了大规模深度学习的实现,TPU则展现了专为机器学习设计的硬件优势,而NPU正将人工智能直接融入个人设备。

  了解这些硬件组件,能让我们深入理解现代人工智能系统的运行机制,以及它们在过去十年间飞速发展的原因。随着人工智能的持续演进,未来的突破或将既依赖于算法本身的改进,也离不开硬件与内存领域的创新。

  原文链接:https://towardsdatascience.com/the-hardware-that-makes-ai-possible/

0
相关文章