数据治理应该如何发展以应对生成性人工智能挑战
我最近想到的是数据治理,所以我决定通过输入提示来查询ChatGPT:“什么是数据治理?”人工智能回应说:“数据治理是一套流程、政策、标准和指导方针,可确保数据在组织内得到妥善管理、保护和利用。”这是一个好的开始,关于数据治理及其意义,目前还有很多话要说。
生成性人工智能时代的数据治理
数据治理涵盖一系列学科,包括数据安全、管理、质量和编目。这种做法需要定义使用策略,创建主数据源,分析数据集,记录字典,并监督数据生命周期。组织模型通常定义促进战略的首席数据官、为数据集制定政策的数据所有者以及负责提高数据质量的数据管理员的角色。
Precisely首席技术官Tendü Yogurtçu博士说:“数据治理是数据完整性的关键要素,使组织能够轻松找到、理解和利用关键数据——从而实现准确的报告和明智的决策。”“它提供了对数据含义、血统和影响的理解,因此企业可以保持合规性,并确保人工智能模型以值得信赖的数据为燃料,以获得可靠的结果。”
Yogurtçu说,数据治理曾经是一项专注于合规性的技术工作。她说:“随着人工智能的日益普及,数据已成为最重要的公司资产,数据治理应该是整个企业的优先事项。”
对于许多尝试genAI或使用大型语言模型(LLM)构建应用程序的组织来说,有更大的数据治理责任,员工使用人工智能工具的风险更大,以及非结构化数据的新范围。我咨询了几位专家,了解数据治理必须如何发展,以应对生成性人工智能工具和功能中固有的机会和风险。
为genAI发展数据治理的4种方法
审查用于genAI工具和LLM的数据策略
加速数据质量计划
审查数据管理和管道架构
将数据治理扩展到genAI工作流程
审查用于genAI工具和LLM的数据策略
数据治理部门监督数据目录并传达数据使用策略,以帮助员工利用集中的数据集,并将其用于构建机器学习模型、仪表板和其他分析工具。这些部门现在正在更新政策,包括是否以及如何在LLM和开放的genAI工具中使用企业数据源。开发人员和数据科学家必须审查这些政策,并就有关使用数据集支持genAI实验的任何问题与数据所有者协商。
Egnyte的联合创始人兼首席安全官Kris Lahiri说:“随着生成性人工智能带来更多的数据复杂性,组织必须有良好的数据治理和隐私政策,以管理和保护用于培训这些模型的内容。”“组织必须特别注意这些人工智能工具使用哪些数据,无论是OpenAI、PaLM等第三方,还是公司可能在内部使用的内部LLM。”
审查有关隐私、数据保护和可接受使用的genAI政策。许多组织要求在将数据集用于genAI用例之前提交数据所有者的请求和批准。在使用必须符合GDPR、CCPA、PCI、HIPAA或其他数据合规标准的数据集之前,请咨询风险、合规性和法律功能。
在与第三方数据源合作时,数据政策还必须考虑数据供应链和责任。EDB首席产品工程官Jozef de Vries说:“如果发生涉及特定区域内受保护的数据的安全事件,供应商需要明确他们和客户的责任,以适当减轻责任,特别是如果这些数据旨在用于AI/ML平台。”
对于那些对genAI机会感到兴奋的人来说,通过了解其组织的数据隐私、安全和合规政策,拥有第一件事至上的心态很重要。
加速数据质量计划
许多公司提供数据质量解决方案,包括Attacama、Collibra、Experian、IBM、Informatica、Prechicely、SAP、SAS和Talend。2022年,全球数据质量工具市场规模超过40亿美元,预计每年增长17.7%。现在,许多公司正在尝试人工智能工具和法学硕士,我预计会有更高的增长。
Piwik Pro首席运营官Mateusz Krempa说:“由于人工智能只与推动它的数据一样好,使用人工智能的许多挑战都与数据质量有关。数据质量差可能会导致误导或错误的见解,严重影响结果。”
Krempa说,数据质量挑战源于大数据的数量、速度和多样性,特别是因为法学硕士现在利用了组织的非结构化数据源。希望开发内部LLM的公司需要扩展数据质量计划,以包括从文档、协作工具、代码存储库和其他存储企业知识和知识产权的工具中提取的信息。
Hakkoda的数据治理负责人Karen Meppen说:“数据治理正在转变,不仅是为了为LLM系统提供大量数据,而且是为了明智和安全地做到这一点。”“重点是确保数据不仅大,而且智能——准确、可理解、隐私意识、安全,并尊重知识产权和公平的风险和影响。”
根据业务目标和数据类型,可以使用不同的工具来提高数据质量。
传统的数据质量工具可以重复数据删除、规范数据字段、根据业务规则验证数据、检测异常和计算质量指标。
主数据管理工具(MDM)帮助组织连接多个数据源,并围绕客户和产品等业务实体创建真相来源。
客户数据平台(CDP)是集中客户信息并实现营销、销售、客户服务和其他客户互动的专用工具。
期待升级和新的数据质量工具,以改善对非结构化数据源的支持,并提高genAI用例的数据质量能力。
Matillion的首席信息官Graeme Cantu-Park的另一项建议侧重于数据谱系的重要性。“人工智能将需要一种完全不同的方式来看待治理优先事项和实践,以便更好地了解为人工智能应用程序和模型提供数据管道和数据血统。”
数据谱系有助于揭示数据的生命周期,并回答有关数据变化的人、何时、何地、为什么以及如何变化的问题。由于人工智能扩大了数据范围及其用例,了解数据血统对组织中的更多人来说变得更加重要,包括负责安全和其他风险管理职能的人。
审查数据管理和架构
除了政策和数据质量,数据治理领导者必须将其影响力扩展到数据管理和架构功能。主动数据治理使一组功能能够实现,以便更多员工能够利用数据、分析以及现在的人工智能来完成工作并做出更明智的决策。数据如何存储、访问、产品化、编目和记录都是组织能够如何快速、轻松和安全地将其数据扩展到genAI用例的因素。
Teradata的首席产品官Hillary Ashton建议以下方法将最令人兴奋的人工智能用例变为现实:
创建可重复使用的数据产品,或精选的已知良好数据集,以帮助组织更好地控制和灌输对其数据的信任。
尊重数据重力,使劳动力中的更多人能够获得信息,而无需在不同环境中移动数据。
考虑到可扩展性的试点人工智能计划,包括具有强大治理的AI/ML数据管道,也实现了开放和连接的生态系统。
数据团队的一个关键是识别易于使用并支持多个用例的框架和平台。Ensono总经理兼副总裁Sean Mahoney表示:“治理框架开始看起来更加敏捷,让团队能够更快地响应技术进步的步伐。”他建议数据治理领导者也审查并参与这些工具:
数据网格,用于将数据管理委托给创建数据的人。
矢量数据库用于处理生成AI和LLM固有的可扩展性和复杂性。
实时监控工具,以在更多系统中扩展数据治理。
另一个考虑因素是数据治理、管理和架构如何需要了解全球数据存储法规。EDB的de Vries建议:“企业应实施全球分布式数据库,通过在其区域内保留高度监管的数据来提升其数据治理实践,同时在全球范围内分发限制性较小的数据,以便在输入人工智能平台时保持敏捷性。”
将数据治理扩展到genAI工作流程
数据治理功能还必须考虑使用genAI工具和LLM如何需要政策和实践。例如,在本文开头,我明确引用了ChatGPT,以便读者知道回复来自genAI来源。良好的数据治理要求对员工进行教育,让他们了解提高透明度的程序、允许他们使用的工具以及尽量减少数据隐私问题的做法。
Forethought首席执行官Deon Nicholas说:“我看到的最重要的事情是,在保持隐私和真实性的同时,准确利用、共享和学习数据的方法的兴起。”“例如,像Perplexity这样的基于LLM的搜索引擎总是引用其来源,或私人人工智能等数据编辑技术,这些技术使您能够在摄取或将数据发送到LLMS之前擦洗和编辑PIl。”
数据治理领导者应该考虑的一个新的、积极主动的措施是创建即时库,员工可以在其中记录其即时的用例,并在整个组织之间共享。这门学科扩展了许多数据治理团队已经围绕维护数据目录和数据字典所做的知识管理实践。
RelationalAI的研究ML副总裁Nikolaos Vasiloglou说:“法学硕士的燃料包括通常存储在知识图中的干净和精心策划的内容,以及通常以即时图书馆形式存在的专家知识。虽然我们有知识图的良好治理实践,但如何管理后者并不明显。”
我喜欢蜘蛛侠电影中流行的一句话:“权力越大,责任越大。”我们看到genAI能力的快速发展,问题是数据治理团队是否会站在他们一边。