人工智能 频道

Nature 研究颠覆认知:大模型越大越不可靠?

  2024 年 9 月 27 日讯,一项震惊业界的研究近日登上权威科学期刊《Nature》,其结果彻底颠覆了人们对大语言模型的传统认知。一直以来,人们普遍认为人工智能模型的参数规模越大,生成的答案就越准确、可信,但这项研究表明,事实并非如此。

  瓦伦西亚理工大学团队及其合作者在对 GPT、LLaMA 和 BLOOM 系列大语言模型进行深入研究后发现,大参数模型虽然在复杂任务上表现出色,但整体可靠性却较低,甚至在一些简单任务上出现更多低级错误。例如,GPT-4 在处理简单的加法和字谜时的错误率竟比一些小模型高出 15%。

  研究人员从人类用户与大语言模型互动的角度,探讨了难度一致性、任务回避和提示稳定性三个核心元素对模型可靠性的影响。结果呈现出一系列令人意外的现象。

  难度悖论:“越简单,错得越多?”

  模型在面对复杂任务时表现显著提升,然而在简单任务上的错误率却有明显上升,这种 “难度不一致” 现象令人费解。以加法任务为例,模型能解决复杂的多位数加法,却在简单的两位数加法上频繁出错。这一结果表明当前模型的扩展可能过于集中于复杂任务,而忽视了简单任务。

  优化后的模型大幅减少了回避行为,转而给出更多表面上 “合理” 但实际上错误的答案。这意味着虽然模型更 “自信” 了,但错误率却随之增加。这一现象在 GPT-4 和 GPT-3.5-turbo 等模型中尤为明显,规模扩展并未带来预期的稳定性。

  提示词带来的是稳定性,还是陷阱?

  随着模型规模的增加,模型对不同自然语言表述的敏感度有所提高,但在不同难度级别的任务上仍然存在不一致的表现。优化后的模型在提示词敏感性上有所改善,表现更加稳定,但也存在一定的变异性。且当用户的难度预期与模型的输出结果不一致时,模型和用户的错误监督都会增加。

  尽管该研究取得了重要成果,但也存在一些局限性。研究人员表示,将进一步扩大数据集,引入更高质量的数据进行模型训练,并通过 AI 来训练监督者,改进模型的优化过程。在关键领域,可通过设计拒答选项或与外部 AI 监督者结合的方式,提高模型的回避能力。

  这项研究为未来的 AI 发展提供了新的方向,即在模型规模与任务难度之间找到平衡,或许才是智能进化的真正关键。

0
相关文章