Meta自研定制AI芯片或将重塑AI的经济模式
Meta宣布,作为将其整体计算能力提升至14 GW计划的一部分,公司将于9月开始生产一款新的自研定制AI芯片。这是该公司旨在减少对外部芯片供应商依赖目标中的一个重要里程碑。
这款代号为“Iris”的新芯片已顺利完成测试阶段,未出现任何重大问题,这表明它已准备好投入量产。该芯片有望更高效地支持Meta的AI推理工作负载,同时帮助降低基础设施成本。这预计将使Meta对其快速扩张的AI基础设施拥有更大的控制权。
推出自研定制芯片的意义远不止于芯片本身。我们一直关注着这样一个更广泛的行业趋势:超大规模科技公司正试图拥有更多自己的AI基础设施。许多人将此视为一项重要的战略优势,而Meta似乎也认同这一观点。
拥有自研芯片的最大好处或许在于能够降低运营成本。Meta每天在Facebook、Instagram、WhatsApp和Meta AI上处理数十亿次推理请求。只要单位功耗算力、单次推理成本实现10%至15%的优化,每年便能省下数亿美元开支,每年也能节省数亿美元。
另一个关键优势是减少对英伟达的依赖,这意味着Meta无需再根据芯片制造商的产品路线图、定价或供应链波动来调整其战略。这些因素是Meta无法控制的,而拥有内部能力恰恰能提供这种灵活性。这反过来也使其在与英伟达等供应商的谈判中拥有更大的议价能力。
Meta还能获得针对自身工作负载优化的芯片。与旨在支持广泛AI应用的通用GPU不同,Iris可以专门针对驱动Meta平台的推荐系统、排序模型、广告算法和生成式AI服务进行定制。
另一个优势在于,Meta不仅能优化芯片本身,还能在开发芯片的同时同步优化其软件、网络和数据中心,从而使各部分更高效地协同工作。以Meta的规模而言,即使整个系统中微小的改进,也能产生显著的影响。
不过,开发定制AI芯片并非易事。设计一款新芯片需要数年时间,成本可能高达数十亿美元。正因如此,只有极少数公司拥有足够的资金和工程人才来尝试这一挑战。
Meta还必须与英伟达(Nvidia)竞争,而这绝非易事。英伟达不仅制造了强大的GPU,还花费数年时间开发了使这些芯片发挥作用的软件、网络技术和开发工具。构建这样的生态系统,比制造芯片本身要困难得多。
此外还需注意,Meta并非试图为所有人打造一款芯片。“Iris”专为Meta自身的基础设施和工作负载而设计。英伟达的GPU仍具备更大的灵活性,未来很可能继续承担Meta许多最重要的AI训练任务。Meta的初衷仅仅是将更多的推理工作负载转移到其自有并掌控的硬件上。
这也不是Meta首次涉足定制芯片领域。该公司此前已概述了其“Meta训练与推理加速器”(MTIA)路线图,其中包括面向自身基础设施的数代AI芯片。Meta尚未确认Iris是否属于该系列,但它显然遵循着相同的战略。
Meta在最近的一篇工程博客中强调了这一挑战:“每天,Meta平台上有数十亿用户享受着各种由AI驱动的体验,从个性化推荐到AI助手,不一而足。”
“与此同时,将定义下一代计算时代的AI模型,其演进速度已远超任何单一代硬件所能预见的范围。在全球范围内部署各类AI模型,同时将成本控制在最低水平,是业内最具挑战性的基础设施难题之一。”
Meta计划在2027年前,大约每六个月推出一款新的AI芯片。这比传统上每隔一两年发布一款新芯片的节奏快得多。
为支持这一扩张,该公司已与三星电子就内存芯片、与闪迪就闪存、与住友电气就光纤设备签署了长期供应协议。预计仅在2026年,Meta在AI基础设施上的投入就将高达1450亿美元。这充分彰显了其AI雄心的规模。
Meta并非唯一一家致力于开发定制芯片的公司。谷歌拥有TPU,亚马逊拥有Trainium和Inferentia,微软则拥有Maia。这些公司都在为自身的AI工作负载开发专用芯片,而非完全依赖英伟达的GPU。
这并不意味着英伟达会退出市场,其GPU几乎肯定仍将是训练最大规模AI模型的首选。然而,随着AI对这些企业的重要性日益提升,拥有更多支撑AI运行的硬件,将有助于它们降低成本,并对AI基础设施的构建与扩展拥有更大的控制权。