从数据治理飞跃到人工智能治理
数据治理的话题已经走得很好,即使不是所有公司都遵循该学科被广泛接受的戒律。如今,人工智能治理正在变得有点令人毛茸茸,这是C级成员和董事会心目中的话题,他们希望接受生成性人工智能,但也希望将公司排除在人工智能行为不端的头条新闻之外。
这是人工智能治理的早期。尽管人工智能技术取得了所有进展,并对人工智能项目进行了投资,但实际上并没有硬性和快速的规则或法规。欧盟在《人工智能法案》方面处于领先地位,乔·拜登总统发布了一套公司在美国根据行政命令必须遵守的规则。但围绕人工智能治理的知识和实践存在相当大的差距,这是一本在很大程度上仍在撰写的书。
希望在人工智能治理中向前推进的技术提供商之一是Immuta。马里兰州大学公园公司由Matt Carroll创立,他之前曾就数据和分析问题为美国情报机构提供建议,该公司长期以来一直将管理数据作为防止机器学习和人工智能模型偏离轨道的关键。
然而,随着GenAI引擎在2023年启动,Immuta客户要求该公司对大型语言模型(LLM)和GenAI应用程序的其他组件中的数据消耗方式进行更多控制。
Immuta的第四份年度数据安全状况报告中暴露了客户对GenAI的担忧。正如Datanami在11月报告的那样,700名调查受访者中有88%表示他们的组织正在使用人工智能,但50%的人表示他们组织的数据安全策略跟不上人工智能的快速发展速度。Ali Azhar报告说:“超过一半的数据专业人士(56%)表示,他们对人工智能最关心的是通过人工智能提示暴露敏感数据。”
Immuta研究副总裁Joe Regensburger表示,该公司正在努力解决客户的新兴数据和人工智能治理需求。在本月的一次谈话中,他与Datanami分享了他的团队正在研究的一些研究领域。
Regensburger的人工智能治理挑战之一是围绕确保GenAI生成的内容结果的真实性展开。
“现在有点像未知的问题,”他说。“关于你如何使用......AI作为决策支持工具,有一个责任问题。我们在一些法规中看到了这一点,如《人工智能法案》和拜登总统提议的《人工智能法案权利》,结果变得非常重要,并将其纳入治理领域。”
法学硕士倾向于用整块布来制作东西,这对任何使用它的人都构成了风险。例如,Regensburger最近要求LLM就他在研究生院研究的一个主题生成摘要。
“我的背景是高能物理学,”他说。“它生成的文本似乎非常合理,它生成了一系列引文。所以我决定看看引文。我已经有一段时间没有上研究生院了。也许从那以后发生了一些事情?
“引文完全是虚构的,”他继续说道。“完全。它们看起来非常合理。他们有物理评论信。它有所有正确的格式。在你第一次随意检查时,它看起来很合理......它看起来像你在档案中看到的东西。然后当我输入引文时,它根本不存在。所以这为我敲响了警钟。”
Regensburger说,进入法学硕士并弄清楚为什么它正在编造东西,这可能超出了一家公司的能力,需要整个行业的有组织努力。“我们正试图理解所有这些含义,”他说。“但我们在很大程度上是一家数据公司。因此,随着事情远离数据,我们将不得不成长或与之合作。”
Immuta的大多数数据治理技术一直专注于检测数据库中的敏感数据,然后制定政策和程序,以确保其在被使用时得到充分保护,主要是在高级分析和商业智能(BI)工具中。治理政策可能很复杂。SQL表中的一段数据可能允许用于一种类型的查询,但当与其他数据结合时,将不允许使用。
为了为GenAI中使用的数据提供相同级别的治理,需要Immuta在用于存储数据的存储库中实施控制。存储库大多不是结构化数据库,而是非结构化来源,如呼叫日志、聊天、PDF、Slack消息、电子邮件和其他通信形式。
Regensburger说,尽管在结构化数据源中处理敏感数据存在挑战,但在处理非结构化数据源时,任务要困难得多,因为信息的上下文因来源而异。
“这么多背景是由它驱动的,”他说。“电话号码不是电话号码,除非它与一个人有关联。因此,在结构化数据中,你可以有原则说,好吧,这个电话号码与社会保障号码重合,与某人的地址重合,然后整个表格具有不同的灵敏度。而在非结构化数据中,你可能有一个可能只是800号码的电话号码。它可能只是一个公司帐户。因此,这些事情要难得多。”
公司可能获得控制点的地方之一是矢量数据库,因为它用于即时工程。矢量数据库用于容纳LLM提前生成的精细嵌入。在运行时,GenAI应用程序可能会将矢量数据库的索引嵌入数据与添加到查询中的提示相结合,以提高结果的准确性和上下文。
Regensburger说:“如果你正在现成训练模型,你将使用非结构化数据,但如果你在提示工程方面这样做,通常来自矢量数据库。”“对于如何在矢量数据库上应用一些相同的治理原则,有很多潜力,也有很多兴趣。”
Regensburger重申,Immuta目前没有开发这种能力的计划,但这是一个活跃的研究领域。他说:“我们正在研究如何将一些安全原则应用于非结构化数据。”
随着公司开始制定GenAI计划并开始构建GenAI产品,潜在的数据安全风险会得到更好的看待。保持私人数据的私密性是目前很多人名单上的一件大事。不幸的是,说“数据治理”比实际做要容易得多,特别是在处理敏感数据和概率模型的交叉点时,这些模型有时行为方式无法解释。