人工智能 频道

DataChat用GenAI实现数据探索

  如果您能告诉计算机您想如何探索数据集,计算机将自动执行分析并向您提供结果呢?这就是DataChat背后的想法,DataChat是一个基于人工智能的生成性数据探索和分析工具,从威斯康星大学麦迪逊分校的研究项目中分离出来,现在是一个商业产品。

  Jignesh Patel目前是卡内基梅隆大学的计算机科学教授,也是DataChat的联合创始人,他最近与Datanami虚拟坐下来,讨论生成性人工智能时代数据探索的性质,以及本月早些时候在Gartner数据与分析峰会上正式启动的新DataChat产品。

  创建DataChat的动力始于2016年,当时Patel在威斯康星大学麦迪逊分校担任计算机科学教授和Pivotal(现在是VMware Tanzu和母公司Broadcom的一部分)的首席技术官。大数据爆炸正在如火如荼地进行,Hadoop是新分布式框架的集结点,数据科学家的需求量很大。

  虽然这项技术发展迅速,但当谈到数据分析和探索时,太多公司正在转动轮胎,帕特尔感觉到等式中缺少了一些东西。

  “每个首席技术官,他们的首要目标是雇佣一支数据科学家大军。他们无法满足数据科学家,”帕特尔说。“我在早期就开始观察的是数据科学家的工作方式。这都是临时分析。它没有脚本,与BI世界相反,您正试图在非线性路径上从数据中获得一些东西。”

  大部分数据探索工作都是手动完成的,使用Jupyter数据科学笔记本等工具。数据科学家会探索一个特定的数据集,直到一些有趣的东西出现,然后想出一种提取那部分数据的方法,将其转换为更有用的形式,然后将其输送到机器学习算法中,在那里它可以用于应用程序。

  帕特尔认识到这种模式适合某种形式的自动化,这种自动化对非专家来说更易近人。

  “从字面上看,他们这样做的方式是一步一步地解决问题,然后试图在网络上的某个地方找到代码,并在里面进行改装。这就是许多细胞在笔记本中构建的方式,”他说。“所以我们在2017年写了一篇论文说,如果我们能让用户用自然语言表达这个数据科学单元来填充呢?”

  当然,这是ChatGPT之前的日子,自然语言处理(NLP)的最新水平与今天相去甚远。虽然NLP技术会得到改进,但Patel和他的威斯康星大学博士研究生Rogers Jeffrey Leo John做了艰苦的工作,构建了一种紧凑的控制语言,该语言可以位于用户和底层SQL和Python代码之间,分别查询数据并调用机器学习算法。

  Patel说:“中间[语言]......很棒,因为现在我们可以采用任何任意语言,将其转换为中间语言,现在将其转换为SQL和Python。”“因为如果你正在与SQL数据库交谈,做ETL,这就是你需要做的。如果你想构建机器学习模型,你真的必须跨越数据科学的两种主要语言,即SQL和Python。”

  数据科学的自然语言

  DataChat的目标是创建一个可以遵循简单英语说明的数据分析和探索工具,减少用户了解SQL或Python对数据高效的需求。用户可以键入简单的命令,例如“为客户流失创建可视化”,产品将根据数据自动生成可视化。 

  Jignesh Patel是DataChat的联合创始人,也是卡内基梅隆大学的计算机科学教授

  Patel说,这个想法是让DataChat具有互动性,具有自然流动。坐在类似电子表格的界面后面,用户可以对数据提出问题。并非向DataChat提出的每个问题都会立即产生可靠的答案。但给予和接受允许产品和用户以可预测的方式前进。

  “你问,你就得到,”帕特尔说。“当你拿回一些东西时,我们也会告诉你步骤。有取与取。我要问你一些事情,这没有意义,你问的方式略有不同,但我每一步都在取得进展。”

  商业用户、数据分析师和数据科学家是DataChat的目标用户。对于商业用户和数据分析师来说,目标是在没有太多培训的情况下将他们的技能提升到数据科学领域。数据科学家通常会使用DataChat,只是为了让他们了解新数据集中的内容。

  “他们可能只是戳着它DataChat说'嘿,我的三个关键列中有多少个空值?'”帕特尔说。“他们不是编写SQL查询,而是指向、单击或询问,然后得到答案,速度要快得多。他们可以写它,但他们从使用它中获得了时间的好处。”

  DataChat工作流程可以从Excel工作簿到Databricks或Snowflake中的数据仓库中的任何数据生成三个工件:报告、图表或机器学习模型,包括回归、分类和时间序列。Patel说,每个工作流程都将伴随着解释它如何以及为什么产生它所做的答案,这是该产品的一个重要特征。

  他说,对于一个流失模型,DataChat不会产生“一些疯狂的技术答案”。“但它会说,'好吧,这三件事——人的年龄、合同类型以及他们是否购买了保险。这是60%的影响或20%和10%的影响,根据数据,这是它没有影响的东西。”

  帕特尔说,这种透明度水平在数据科学中至关重要。他说:“从第一天起,我们就一直在考虑解决数据科学问题,科学需要透明度,所以这已经融入了产品的理念中。”

  NLP的转变

  DataChat于2017年首次注册为公司,并在2020年的种子轮中筹集了400万美元(此后又筹集了2500万美元)。2017年,Patel和John用当时的NLP技术一路前进,该技术远没有今天的大型语言模型(LLM)那么强大,也不容易使用。

  他们构建了语言解析器,并深入研究了语义理解,“所有那些疯狂的东西,”Patel说。“但作为这样做的一部分,我们建造了堆栈底部的其余部分,”他继续说道。“如此重要的层都准备好了。它们是可扩展的,它们经过了成本优化,特别是对于云数据库。”

  几年后,当LLM革命爆发时,Patel和John很快意识到新方法的优越性,并抛弃了基于现已过时的NLP技术的堆栈顶部。他们用OpenAI的Codex取代了它。一年前,当OpenAI杀死Codex时,他们再次转向,使LLM组件在堆栈中可交换。

  Patel说:“因此,这显然对我们来说是地狱,但作为这样做的一部分,我们在LLM作品中重新设计了我们的工程框架,以确保下次发生这种情况时,我们可以即插即用LLM,使其尽可能无痛。”

  今天,该公司主要依靠OpenAI的GPT-4,它通常被认为是当今市场上最强大、阅读最好的LLM。DataChat使用GPT-4来学习和生成DataChat的中间语言。Patel说,GPT-4被告知用户想要一般分析的数据类型,但客户的实际数据从未接触过GPT-4。

  帕特尔说:“我们将构建模式结构的摘要,所以我们说'这是元素'。”“我不需要给[GPT-4]实际数据值。”

  Patel说,LLM是非确定性机器,不能完全信任,这就是为什么DataChat仅将LLM用作“指南”。“他们产生幻觉,他们做错事,”他说。“所以他们只是给我们一些东西,我们将把该查询转换为中间语言......我们将为您生成的内容完全是确定性的。”

  他说,用户可以从一段数据中获取DataChat生成的工作流程,并在另一段数据上运行,它将以完全相同的方式运行。“所以没有模棱两可之处。”

  对帕特尔和约翰来说,这是一条漫长的道路,但这家总部位于威斯康星州麦迪逊的公司终于接受了DataChat的订单。在Gartner展会上正式推出后,Patel准备看看他的第四家初创公司的下一章将带来什么。

  Patel说:“当我们开始写那篇初稿时,每个人都认为这在数据库世界中是疯狂的。”“但从某种意义上说,我们很幸运,GenAI作品降落在了现在更可用的地方。但这就是技术的乐趣:它四处移动,如果你愿意随它四处走动,好事就会发生。”

0
相关文章