人工智能 频道

Google Vertex AI Studio将承诺放在生成性人工智能上

  Vertex AI Studio是一个用于构建人工智能应用程序的在线环境,以谷歌自己的多模式生成人工智能模型Gemini为特色,可以处理文本、代码、音频、图像和视频。除了Gemini,Vertex AI在其Model Garden中还提供40多个专有模型和60多个开源模型的访问,例如来自Google Research的专有PaLM 2、Imagen和Codey模型,来自Meta的Llama 2和来自Anthropic的Claude 2和Claude 3等开源模型。Vertex AI还为语音、自然语言、翻译和视觉提供预先训练的API。

  Vertex AI支持提示工程、超参数调优、检索增强生成(RAG)和模型调优。您可以使用自己的数据调整基础模型,使用调整选项,如适配器调优和从人类反馈(RLHF)强化学习,或为图像生成执行样式和主题调优。

  顶点AI扩展将模型连接到现实世界的数据和实时操作。Vertex AI允许您在谷歌云控制台中以及通过Python、Node.js、Java和Go中的API使用模型。

  竞争产品包括Amazon Bedrock、Azure AI Studio、LangChain/LangSmith、LlamaIndex、Poe和ChatGPT GPT Builder。这些产品的技术水平、范围和编程语言支持各不相同。

  Vertex AI Studio是一个谷歌云控制台工具,用于构建和测试生成性AI模型。它允许您设计和测试提示,并自定义基础模型,以满足您的应用程序的需求。

  基础模型是顶点AI中发现的生成性AI模型的另一个术语。称它们为基础模型强调了一个事实,即它们可以用您的数据进行定制,用于应用程序的专门目的。他们可以生成文本、聊天、图像、代码、视频、多模态数据和嵌入。

  嵌入是其他数据的矢量表示,例如文本。搜索引擎通常使用矢量嵌入、余弦度量和最近邻算法来查找与查询字符串相关(类似)的文本。

  Vertex AI中可用的专有谷歌生成AI模型包括:

  Gemini API:高级推理、多圈聊天、代码生成和多模态提示。

  PaLM API:自然语言任务、文本嵌入和多回合聊天。

  Codey API:代码生成、代码完成和代码聊天。

  Imagen API:图像生成、图像编辑和视觉字幕。

  MedLM:医学问题回答和总结(私人GA)。

  Vertex AI Studio允许您使用提示示例测试模型。提示画廊按模型类型(多模式、文本、视觉或语音)和正在演示的任务进行组织,例如“从财务报告表中总结关键见解”(文本)或“阅读此手写笔记图像中的文本”(多模式)。

  Vertex AI还可以帮助您设计和保存自己的提示。提示类型按目的细分,例如文本生成与代码生成和单次生成与聊天。在您的提示上进行意想,是定制模型以产生您想要的输出的一种令人惊讶的强大方式,我们将在下面讨论。

  当提示工程不足以哄骗模型产生所需的输出,并且您拥有合适格式的训练数据集时,您可以采取下一步,以几种方式之一调整基础模型:监督调谐、RLHF调谐或蒸馏。同样,我们将在稍后的评论中更详细地讨论这个问题。

  Vertex AI Studio语音工具可以将语音转换为文本,将文本转换为语音。对于文本到语音,您可以选择您喜欢的语音并控制其速度。对于语音转文本,Vertex AI Studio使用Chirp模型,但有长度和文件格式限制。您可以使用云语音到文本控制台来绕过这些。

  Google Vertex AI Studio概述控制台,强调谷歌最新的专有生成AI模型。注意将Google Gemini用于多模态人工智能,将PaLM2或Gemini用于语言AI,Imagen用于视觉(图像生成和填充),以及通用语音模型用于语音识别和合成。

  " style="color: rgb(239, 76, 35); text-decoration: none; position: relative; display: block; overflow: hidden; max-width: 620px;" _href="https://images.idgesg.net/images/article/2024/03/vertex-ai-studio-01-100962938-orig.jpg?auto=webp&quality=85,70">顶点ai工作室01


  Google Vertex AI Studio概述控制台,强调谷歌最新的专有生成AI模型。请注意,将Google Gemini用于多模态AI,将PaLM2或Gemini用于语言AI,Imagen用于视觉(图像生成和填充),以及通用语音模型用于语音识别和合成。

顶点ai工作室03

  来自顶点AI的多模式生成AI演示。尽管书法非常精致,但模型Gemini Pro Vision能够从图像中读取信息。

  生成性人工智能工作流程

  正如您在下图中看到的,Google Vertex AI的生成性AI工作流程比简单地在墙上抛出提示并获得回复要复杂一些。谷歌负责任的人工智能和安全过滤器同时适用于输入和输出,保护模型免受恶意提示,保护用户免受恶意响应。

  处理查询的基础模型可以预先训练或调整。如果需要,可以使用几种方法执行模型调优,所有这些方法都是查询/响应工作流程的带外,而且相当耗时。

  如果需要接地,则在此应用。该图显示了流程中模型之后的接地服务;正如我在1月份解释的那样,这不完全是RAG的工作原理。带外,您构建矢量数据库。带内,您为查询生成嵌入向量,使用它对向量数据库执行相似性搜索,最后将从向量数据库中检索的内容作为对原始查询的增强,并将其传递给模型。

  此时,该模型可能基于多个文档生成答案。工作流程允许在通过安全过滤器将响应发回给用户之前包含引文。

顶点ai工作室02

  生成人工智能工作流程通常从用户的提示开始。在后端,提示通过安全过滤器进入预训练或调整的基础模型,可以选择使用RAG的接地服务。在引用检查后,回复通过安全过滤器传递给用户。

  人工智能搜索

  正如您可能从RAG的工作方式中所期望的那样,Vertex AI要求您采取一些步骤来启用RAG。首先,您需要“加入Vertex AI搜索和对话”,只需点击几下即可,等待几分钟。然后,您需要创建一个AI搜索数据存储,可以通过抓取网站、从BigQuery表导入数据、从云存储桶(PDF、HTML、TXT、JSONL、CSV、DOCX或PPTX格式)导入数据或调用API来实现。

  最后,您需要使用支持RAG的模型(目前只有文本野牛和聊天野牛,都是PaLM 2语言模型)设置一个提示,并将其配置为使用您的AI搜索和对话数据存储。如果您使用的是Vertex AI控制台,此设置位于提示参数的高级部分,如下面的第一个屏幕截图所示。如果您使用的是Vertex AI API,此设置位于参数的groundingConfig部分:

  { 实例:[ { "prompt": "PROMPT"} ], 参数:{ 温度:温度, "maxOutputTokens": MAX_OUTPUT_TOKENS, "topP":TOP_P, "topK":TOP_K, "groundingConfig":{ 来源:[ { "类型": "VERTEX_AI_SEARCH", "vertexAiSearchDatastore": "VERTEX_AI_SEARCH_DATA_STORE" } ] } }}

  如果您正在为支持接地的模型构建提示,则右侧“高级”下的“启用接地”开关将被启用,您可以单击它,就像我在这里一样。单击自定义将显示另一个右侧面板,您可以从下拉列表中选择Vertex AI搜索,并填写Vertex AI数据存储的路径。

  " style="color: rgb(239, 76, 35); text-decoration: none; position: relative; display: block; overflow: hidden; max-width: 620px;" _href="https://images.idgesg.net/images/article/2024/03/vertex-ai-studio-04-100962941-orig.jpg?auto=webp&quality=85,70">顶点ai工作室04

  如果您正在为支持接地的模型构建提示,则右侧“高级”下的“启用接地”开关将启用,您可以单击它,就像我在这里一样。单击“自定义”会显示另一个右侧面板,您可以在其中从下拉列表中选择Vertex AI Search,并填写Vertex AI数据存储的路径。

  请注意,可能需要也可能不需要接地或RAG,这取决于模型的训练方式和时间。

  通常值得检查,看看您是否需要为任何给定的提示/模型对接地。我想我可能需要添加Poetry.org网站的诗歌部分,以获得“我应该把你比作夏日吗?”但正如你在上面看到的,文本-bison模型已经知道它可以(也确实)引用的四个来源的十四行诗。

  " style="color: rgb(239, 76, 35); text-decoration: none; position: relative; display: block; overflow: hidden; max-width: 620px;" _href="https://images.idgesg.net/images/article/2024/03/vertex-ai-studio-05-100962942-orig.jpg?auto=webp&quality=85,70">顶点ai工作室05

  通常值得检查,看看您是否需要为任何给定的提示/模型对接地。我想我可能需要添加Poetry.org网站的诗歌部分,才能很好地完成“我应该把你比作夏日吗?”但正如你在上面看到的,文本野牛模型已经知道它可以(也确实)引用的四个来源的十四行诗。

  Gemini、Imagen、Chirp、Codey和PaLM 2

  谷歌的专有模型提供了Vertex AI网站的一些附加值。Gemini在多模态模型(以及文本和代码生成模型)方面很优秀,就在我写这篇文章的几周前。然后OpenAI GPT-4合并了DALL-E,这允许它生成文本或图像。目前,Gemini可以从图像和视频中生成文本,但GPT-4/DALL-E不能。

  目前在Vertex AI上提供的Gemini版本包括Gemini Pro,一种具有“性能优秀的Gemini模型,具有广泛任务功能的语言模型”;Gemini Pro Vision,一种多模态模型“从头开始创建为多模态(文本、图像、视频)并跨各种任务扩展”和Gemma,“Google DeepMind的Gemini模型的开放检查点变体,适合各种文本生成任务。”

  宣布了其他双子座版本:Gemini 1.0 Ultra、Gemini Nano(在设备上运行)和Gemini 1.5 Pro,这是一个专家混合(MoE)中型多模态模型,针对跨各种任务进行了优化,其性能与Gemini 1.0 Ultra相似。据Google DeepMind首席执行官兼联合创始人Demis Hassabis称,Gemini 1.5 Pro具有标准的128,000个令牌上下文窗口,但少数客户可以通过私人预览中的Vertex AI尝试高达100万个令牌的上下文窗口。

  Imagen 2是Google Brain Research的文本到图像扩散模型,谷歌表示,该模型具有“前所未有的逼真和深层次的语言理解”。它与DALL-E 3、Midjourney 6和Adobe Firefly 2等公司竞争。

  Chirp是通用语音模型的一个版本,具有超过2B参数,可以在单个模型中以100多种语言转录。它可以将音频语音转换为格式化文本,字幕字幕视频,并转录音频内容以进行实体提取和内容分类。

  Codey存在于代码完成(code-gecko)、代码生成(̉code-bison)和代码聊天(codechat-bison)的版本中。Codey API支持Go、GoogleSQL、Java、JavaScript、Python和TypeScript语言,以及Google Cloud CLI、Kubernetes资源模型(KRM)和Terraform基础设施作为代码。Codey与GitHub Copilot、StarCoder 2、CodeLlama、LocalLlama、DeepSeekCoder、CodeT5+、CodeBERT、CodeWhisperer、Bard和其他各种已对OpenAI Codex、Tabnine和ChatGPTCoding等代码进行微调的LLM竞争。

  PaLM 2存在于文本(text-bison和text-unicorn)、聊天(̉chat-bison)和安全特定任务(sec-palm,目前仅通过邀请提供)的版本。PaLM 2文本bison适用于总结、问题回答、分类、情绪分析和实体提取。PaLM 2聊天野牛经过微调,可以进行自然对话,例如提供客户服务和技术支持,或担任网站的对话助理。PaLM 2文本独角兽是PaLM家族中最大的模型,擅长编码和思想链(CoT)等复杂任务。

  谷歌还为文本(textembedding-gecko和textembedding-gecko-multilingual)和modal(multimodalembedding)提供嵌入模型。嵌入加上矢量数据库(Vertex AI Search)允许您实现语义或相似性搜索和RAG,如上所述。

  多模态模型的Vertex AI文档概述。注意右下角的示例。文本提示“给我一个这些饼干的食谱”和一张无标签的巧克力片饼干图片使双子座以巧克力片饼干的实际食谱做出回应。

  " style="color: rgb(239, 76, 35); text-decoration: none; position: relative; display: block; overflow: hidden; max-width: 620px;" _href="https://images.idgesg.net/images/article/2024/03/vertex-ai-studio-06-100962943-orig.jpg?auto=webp&quality=85,70">顶点ai工作室06

  多模态模型的顶点AI文档概述。注意右下角的示例。文本提示“给我一个这些饼干的食谱”和一张无标签的巧克力饼干图片使双子座以巧克力饼干的实际食谱做出回应。

  AI模型花园

  除了谷歌的专有模型外,Model Garden(文档)目前还提供大约90个开源模型和38个特定于任务的解决方案。一般来说,模型有模型卡。Google模型可以通过Vertex AI API和Google Colab以及Vertex AI控制台获得。API按使用情况计费。

  其他模型通常在Colab Enterprise中可用,并且可以作为端点部署。请注意,端点部署在带有加速器的严重实例上(例如96个CPU和8个GPU),因此只要部署它们,就会产生大量费用。

  提供的基础模型包括Claude 3 Opus(即将推出)、Claude 3 Sonnet(预览)、Claude 3 Haiku(即将推出)、Llama 2和Stable Diffusion v1-5。微调模型包括用于3D重建的PyTorch-ZipNeRF、用于表格数据的AutoGluon、用于文本到图像生成的稳定扩散LoRA(MediaPipe)和̉̉MoViNet视频动作识别。

  生成性人工智能提示设计

  谷歌人工智能提示设计策略页面在解释如何为生成性人工智能设计提示方面做了体面且一般不与供应商中立的工作。它强调清晰度、特异性,包括示例(几针学习),添加上下文信息,使用前缀来清晰,让模型完成部分输入,将复杂的提示分解为更简单的组件,并尝试不同的参数值以优化结果。


0
相关文章