人工智能 频道

模型微调和RAG的局限性

  随着生成性人工智能的不断发展,炒作与敬畏已逐渐平息。尽管“通才”大型语言模型(LLMs),例如GPT-4、Gemini(前Bard)和Llama,能够生成听起来很聪明的句子,但它们在专业领域知识、避免产生幻觉、情商以及对时事的关注方面存在明显不足,这常常带来意想不到的问题。尽管这些生成性人工智能在某些方面超出了我们的预期,但在我们需要它们表现出可靠性而非仅仅是趣味性时,却往往不尽如人意。

  为了解决这一问题,特定领域的“专家”型LLM应运而生,旨在提供更可信的答案。例如,LEGAL-BERT针对法律领域,BloombergGPT服务于金融界,而谷歌研究的Med-PaLM则专注于医学。然而,如何最有效地创建和部署这些“专家”型LLM,仍是人工智能领域的一个未解之谜。这一问题的答案可能会对生成性人工智能行业产生深远影响,因为尽管该行业估值不断攀升,但由于开发“通才”和“专家”型LLM的巨大成本,其利润状况并不乐观。

  在专业化LLM的过程中,人工智能开发者主要依靠微调和检索增强生成(RAG)两种关键技术。然而,这两种技术都存在局限性,使得以合理成本开发“专家”型LLM变得颇具挑战。不过,这些局限性也为新技术提供了契机,这些新技术有望在不久的将来改变我们专业化LLM的方式。

  “专家”模型过于昂贵

  当今,表现最出色的LLM往往是那些“通才”模型。若想要获得特定领域的“专家”模型,通常的做法是选取一个性能优秀的“通才”模型作为基础,然后通过微调来使其适应特定的领域知识。这一过程与研究生通过进修STEM课程来获得人文学科的专业学位颇为相似。然而,与研究生教育一样,微调过程既耗时又成本高昂。它已成为生成式人工智能开发的一个瓶颈,因为很少有公司同时具备从头开始构建高性能“通才”模型的资源和专有技术。

  我们可以将LLM想象成一个巨大的数字球体,其中蕴含了单词、短语和句子之间的复杂关系。这个数字球体的表现似乎与其背后的文本数据语料库大小成正比。因此,一个拥有1万亿参数的LLM在一致性和准确性上通常会超越一个只有700亿参数的模型。

  为了将“通才”LLM微调为特定领域的“专家”,我们需要对这个数字球体进行调整,或者向其中添加一组互补的数字。例如,若要将一个通用的LLM转变为法律领域的专家,我们可以向其提供大量的法律文件以及与之相关的正确和错误答案。经过这样的微调,LLM将能够更好地总结法律文件并回答与之相关的问题。

  然而,微调的成本并不低。使用Nvidia GPU进行的一个微调项目可能会花费高达数十万美元。因此,专业型的LLM很少会每周或每月进行超过一次的微调。这导致它们往往无法及时了解到其所在领域的最新知识和事件。

  如果存在一种通向专业化的捷径,那么将有数千家企业能够进入LLM领域,从而带来更多的竞争和创新。如果这条捷径能够使专业化过程变得更快、更便宜,那么专业型的LLM也许就能够实现持续更新。RAG技术就是这样一条捷径,但它也存在一定的局限性。

  总的来说,尽管微调是提升LLM专业领域性能的有效手段,但其高昂的成本和耗时的过程限制了其频繁应用的可能性。因此,行业仍在寻求更高效、更经济的专业化方法,以期实现LLM领域的持续创新和发展。

  向RAG学习

  在生成性人工智能领域,特定领域的LLM总是面临信息更新不及时的问题。当我们向这些模型提出关于近期发生的事件或新出现的话题时,它们往往无法给出准确答案,甚至可能产生误导性的信息。这与一个本科计算机科学专业的学生在没有准备的情况下被问到陌生主题时的反应相似:有些人可能选择不回答,而有些人则可能编造出听起来似乎合理的答案。

  然而,如果我们能为学生提供一份关于那个陌生主题的入门资料,他们就有可能学到足够的知识来回答相关问题。这就是RAG技术的基本原理。通过向LLM提供额外的相关信息以及正确和错误答案的示例,我们可以增强模型生成的内容。虽然这样的LLM可能不像经过微调的模型那样拥有深厚的知识,但RAG技术可以以更低的成本加速LLM的学习过程。

  尽管如此,RAG技术在实际应用中仍然受到一些限制。首先,是代币津贴的问题。就像在一个定时考试中,我们只能向学生引入有限的新信息,以免让他们感到不知所措,LLM也有一个代币限制,这通常限制在每个提示在4k到32k令牌之间。这不仅限制了LLM在实时学习中可以接收的内容量,而且调用LLM的成本也基于令牌的数量,因此合理的令牌预算对于控制成本至关重要。

  其次,是向LLM提交RAG示例的顺序问题。示例中引入概念的时间越早,LLM就会越关注它。虽然系统可以自动重新排序检索增强的提示,但由于令牌限制,可能不得不削减或淡化某些重要事实。为了降低这一风险,我们可以尝试以三种或四种不同的方式向LLM发送信息,以检查响应是否一致。然而,在这一点上,我们投入的时间和计算资源可能会带来越来越小的回报。

  第三个挑战是如何实施检索增强,以避免降低用户体验。如果应用程序对延迟敏感,RAG往往会增加延迟。相比之下,微调对延迟的影响微乎其微。这是因为微调是模型已经“知道”了信息,而RAG则需要模型先“阅读”信息,然后才能生成答案。

  一种可能的解决方案是结合使用微调和RAG技术。首先,我们可以对LLM进行微调,使其具备一定的基础知识。然后,使用RAG技术更新其知识或引入无法包含在公开可用模型中的私有信息(如企业知识产权)。值得注意的是,虽然微调是永久性的改变,但RAG只是暂时性地重新训练LLM。这可以防止单个用户的偏好和参考材料以意想不到的方式对整个模型产生过大影响。

  总的来说,我们正在不断探索如何以更低的成本和更高的速度将LLM专业化,同时不牺牲性能以达到令牌限制、解决提示排序问题和降低延迟敏感度。通过测试微调和RAG技术的局限性,我们可以进一步完善人工智能中的这一未决问题。

  如何解决

  在探讨生成性人工智能的成本效益问题时,我们关注到了一种潜在的解决方案:通过组合多个低参数的特定领域LLM,并应用RAG技术,以实现更具成本效益的专业化的专家模型。

  这一思路的本质在于,我们不再依赖耗时且成本高昂的“通才”培训过程,而是直接培养一批专注于特定领域的“专家”。这就像是将一群文科学生的本科课程从四年缩短到一年,并让他们迅速深造获得相关研究生学位。通过这种方式,我们可以快速组建一个由专家组成的委员会,共同回答问题。

  这种方法的优势在于,它有望降低专家模型的开发和运行成本。就像五位各有五年经验的律师可能比一位拥有50年经验的律师更可靠一样,我们相信,如果专家委员会的成员之间能达成广泛共识,那么尽管他们各自的经验可能较少,但作为一个整体,他们仍有可能给出正确的答案。

  目前,我们已经看到了一些实验,这些实验将多个专家LLM组合在同一提示上协作。迄今为止,这些实验的结果都相当令人鼓舞。例如,代码专家LLM Mixtral就采用了高质量的专家模型(SMoE)与八个独立的LLM的稀疏混合物。Mixtral会将任何给定的令牌反馈到两个模型中,虽然其总参数达到467亿,但每个令牌实际上仅使用了129亿参数。

  此外,这种方法还有助于减少使用单个LLM时固有的随机性。单个LLM产生幻觉的概率相对较高,但五个LLM同时产生幻觉的几率则显著降低。当然,我们仍然可以结合RAG技术来共享新信息,从而进一步提高模型的性能。

  如果这种方法最终证明是有效的,那么小型企业也有望开发出比微调专家更专业的LLM,并且还能在实际应用中不断学习新知识。

  值得注意的是,对于人类学生来说,过早的专业化可能会带来一些问题。通才知识对于掌握高级材料并将其置于更广泛的背景下通常至关重要。然而,对于专业LLM来说,它们并不承担公民、道德和家庭责任,因此我们可以放心地让它们“年轻时”就专攻某一领域,而无需担心由此产生的任何缺陷。

  https://www.infoworld.com/article/3715306/the-limitations-of-model-fine-tuning-and-rag.html

0
相关文章