人工智能 频道

大模型背后的数据与算力挑战

  在人工智能的浪潮中,大模型无疑成为了最引人瞩目的技术之一。它们通过海量的数据和强大的算力,展现出令人惊叹的能力,引领着AI技术的新发展。然而,在这一技术飞速发展的背后,数据与算力的挑战也日益凸显。

  大模型的成功离不开三大核心资源:算法、数据和算力。近年来,随着开源算法的不断涌现,算法资源已不再是制约大模型发展的主要因素。相反,数据和算力逐渐成为决定大模型性能和应用范围的关键因素。

北京智源人工智能研究院副院长兼总工程师 林咏华

  近日北京智源人工智能研究院副院长兼总工程师林咏华在公开场合发表了主题为《大模型背后的数据与算力挑战》的演讲,深入剖析了当前大模型发展所面临的数据与算力两大核心挑战,并提出了应对之策。

  数据挑战:数量、质量与使用的三重困境

  林咏华首先指出了数据在数量、质量和使用上面临的挑战。在数量方面,尽管全球大模型训练所依赖的一个重要数据集Common Crawl已积累了超过2500多亿的网页数据,为语言模型的训练提供了丰富的素材,但在多模态模型和文生视频模型的训练中,对高质量图文对和视频数据的需求更加迫切,而目前这类数据资源还远远不够。特别是中文相关开源数据集的稀缺性更是一个亟待解决的问题。

  在数据质量方面,林咏华引用了GPT-4o分词器训练所用的中文数据质量问题作为案例,强调了数据质量对大模型训练的重要性。她指出,低质量的数据集不仅会浪费宝贵的算力资源,更可能对模型的生成内容安全造成严重影响。因此,提高数据质量是当前大模型发展中的重要任务之一。

  此外,数据使用问题也引发了广泛关注。林咏华提到,在现有法律体系下,对于让机器进行“学习”的数据这一新型的使用方式并没有相关的定义。如何在尊重数据版权的前提下充分利用高质量数据进行大模型的开发成为了一个亟待解决的问题。

  算力挑战:增长与需求之间的矛

  除了数据挑战外,大模型还面临着算力挑战。林咏华表示,随着模型参数量的不断增加和训练数据量的日益庞大,大模型对算力的需求也呈现出爆炸性的增长。然而,目前AI算力建设尚显不足且与国际先进水平相比还存在一定差距。同时国内AI芯片的生态割裂问题也亟待解决各种AI芯片的硬件架构指令集存在差异导致上层算法的迁移成本高昂这不仅增加了开发团队的负担也限制了AI技术的广泛应用。

  面对数据与算力的挑战林咏华提出了开源开放和技术基座共筑的解决方案,在数据方面智源研究院通过开源开放的方式推动数据资源的共享和使用,这三种数据共享使用方式包括完全开源下载、联盟内部共享以及“数算一体”的使用方式为整个产业提供了更多高质量数据资源这不仅有助于解决数据数量和质量的问题还能在一定程度上缓解数据使用中的版权纠纷。

  在算力方面林咏华介绍了通过打造统一开源开放的软件生态降低多元AI芯片的接入门槛的举措,她提到可以借鉴CPU生态的构建方法利用开源编程语言Triton及其编译器推动AI算子库的开发和芯片厂商的移植优化工作这将有助于降低算法开发团队的迁移成本提高算力的利用效率,智源研究院正在朝着这个方向努力前行通过推动数据资源的共享和算力的统一生态构建为大模型技术的发展提供有力支持。

  展望未来:共筑AI大模型产业的技术基座

  展望未来数据与算力仍将是AI大模型发展的核心资源,林咏华在演讲中强调了开源开放与技术基座共筑的重要性她表示:“我们希望通过开源开放跟大家一起共筑好基座”。为了实现这一目标智源研究院等机构正在积极探索解决方案。

  首先针对数据挑战智源研究院将继续推动数据的共享和使用通过开源开放的方式汇聚更多优质资源和智慧共同推动大模型技术的发展,同时智源研究院还将加强数据质量的把控和提高数据的利用效率为产业提供更多高质量数据资源。

  其次在算力方面智源研究院将致力于打造统一开源开放的软件生态降低多元AI芯片的接入门槛,通过推动Triton等开源编程语言及其编译器的发展降低算法开发团队的迁移成本提高算力的利用效率,此外智源研究院还将积极探索新的算力技术如量子计算等为大模型技术的发展提供更多可能性。

  最后林咏华表示智源研究院将继续加强与其他机构和企业的合作与交流共同推动AI大模型产业的发展她相信在不久的将来AI大模型将在更多领域展现出强大的能力为人类的进步和发展贡献更多力量。

  综上所述大模型背后的数据与算力挑战仍然存在但通过开源开放与技术基座共筑我们可以共同应对这些挑战推动AI大模型技术的快速发展和应用落地,同时我们也需要关注数据质量和算力效率的提升为大模型技术的发展提供有力支持。

0
相关文章