数据无处不在,但要收获自己的最佳 AI 性能
数据市场的迅速发展使组织很容易获得第三方数据。并且预训练的深度学习模型在互联网上也很容易获得。但就像塑料包装的即食食品通常不是最健康的选择一样,预包装的数据可能无法让您的 AI 模型以最佳性能运行。
在大数据的早期,组织非常关注数据科学,将其作为机器学习成功的途径。数据科学家花费大量时间和精力从头开始训练他们的模型,然后对其进行调整以达到最佳准确性。但随着新技术和新技术的兴起,包括深度学习和迁移学习,权力平衡正在从数据科学家转向数据本身。
在以数据为中心的人工智能领域,数据至高无上。虽然数据科学家仍然是这个难题的关键部分,但他们的技能组合往往不像以前那样对成功至关重要。相反,拥有最能代表人工智能可能遇到的现实世界条件的数据集可能是一种更好的方法。

您可以通过使用自己的数据(Pdusit/Shutterstock)利用迁移学习来微调预训练的深度神经网络
数据标记工具和服务提供商Appen的首席技术官 Wilson Pang 表示,预训练的深度学习模型和迁移学习技术的广泛可用性正在彻底改变企业 AI,因为它允许组织快速启动和运行新的 AI 用例。.
“很多时候,您的模型已经使用一些开源数据集或您自己公司的另一个现有数据集进行了预训练,然后您将该模型用于新的用例,”Pang 说。
Pang 说,通过迁移学习,从业者可以仅重用 20 层深度学习模型中的 16 层,而只专注于再训练 4 层。这允许用户利用已经发生并且存在于开放领域中的训练,同时微调模型以更好地处理模型从未见过的特定数据。
以数据为中心的人工智能
Pang 使用了一个用于旅游业的 AI 模型的假设示例。ImageNet中有很多酒店的图像,这是一个包含超过 1400 万张图像的开源存储库,用于训练计算机视觉算法。但它可能没有合适的。
“我需要了解图像是否与客户有关,”庞说。“这是关于酒店房间的吗?这是酒店的大堂,这是餐厅等。我需要对它们进行分类,但我没有几千万张图像来训练这些模型。”

最好的人工智能结果可能来自收集您自己的数据(CoreDESIGN/Shutterstock)
通过迁移学习,Pang 可以从在 ImageNet 上预训练的图像分类模型开始。但是,Pang 可以提供他假设的旅游行业 AI 模型所需的特定图像(可能有数千个),而不是按原样使用模型,并使用这些图像来完成模型的训练。
“你正在使用自己的数据来真正重新训练模型,只调整最后几层的参数,”他告诉Datanami。“你会得到一个适用于该数据集的模型。”
每个用例都是不同的,没有绝对的。但是迁移学习在最流行的人工智能用例中具有广泛的适用性,包括那些涉及计算机视觉和自然语言处理的用例。
在 NLP 中,像 GPT-3 这样的大型语言模型在大量文本语料库上进行训练,并且需要价值数百万美元的计算才能完全训练。对于大多数组织来说,从头开始训练自己的大型语言模型是不切实际的。但是,借助预训练模型和少量自定义数据,迁移学习可以帮助大数据从业者超越她的体重。
关注数据
Pang 说,通过从一开始就专注于拥有高质量的数据,组织可以节省资金并获得性能更高的 AI 模型。
“我们看到一些客户……以较低的价格获得所有这些培训数据的用例,然后他们发现质量不太好,基本上他们需要重新进行培训,”他说。“所有的钱都被浪费了。”

Waymo 的开放数据集是自动驾驶汽车模型的一个很好的起点——但竞争对手需要自己的数据(图片由 Waymo 提供)
很难找到对训练特定类型的 AI 有用的高质量数据的开源存储库。这就是为什么在几乎所有情况下,由各个组织自行获取数据的原因。为最后一英里的 AI 训练购买高质量数据“这并不常见”。“通常你必须收集自己的数据,”他说。
例如,Waymo 已经开源了从自动驾驶汽车实验中收集的数据存储库。这可能对竞争对手有用,但仅限于一定程度。很可能任何竞争对手的数据收集技术都会略有不同,因此需要不同的数据来完成自动驾驶汽车模型。
“他们的数据可能与 Waymo 的数据大不相同,因为他们的摄像头不同,激光雷达不同,汽车也不同,”庞说。“但是,我们仍然在谈论联网汽车数据,所以你可以使用 Waymo 的数据集进行一些预训练,然后进行一些迁移学习”来微调新模型。
那里有很多很棒的开放数据集,Pang 鼓励人们使用它们。但他强调,用户很可能需要携带自己的数据来使用他们特定的 AI 模型来获得最佳性能。
“我认为现在对数据的关注比以前重要得多,”他说。“人们意识到,花费时间和精力来获取正确的数据实际上可以帮助模型显着提高性能。”