人工智能 频道

大规模交付 AI 应用:ADC 的关键作用

  人工智能流水线并不会随着数据到达模型而结束。从很多方面来说,这才是最艰难工作的开始。

  当数据被摄取、转换并交付用于训练或推理之后,组织仍需将这些数据整合到面向用户、合作伙伴和系统的 AI 应用中,且规模必须足够大。这些应用如今被超级赋能,用于客户体验、自动化工作流以及实时决策支持。因此,可用性、性能、安全性和治理仍然是应用交付的首要关切。

  可靠地交付 AI 应用,需要的不仅仅是最新、最强大的模型或基础设施。它需要一个控制层,能够智能地管理 AI 流量、保护稀缺资源,并适应高度动态的环境。

  这正是应用交付控制器(ADC)继续发挥核心作用的地方。

  为什么 AI 应用交付与众不同

  传统应用通常处理短暂且可预测的请求。AI 应用的行为则大不相同。在我走访世界各地并与许多构建 AI 应用的人交谈的过程中,我注意到了这些对话中的一些共性。

  AI 流量往往是突发且不均匀的。请求可能包含大型提示词和上下文。响应可能是持续流式传输,而非一次性全部返回。单个请求可能会扇出到多个服务,包括检索系统、嵌入服务和下游工具。在幕后,推理工作负载消耗着昂贵且容量受限的资源,例如 GPU。

  AI 应用还引入了一种新的会话概念。会话数据不再保存在单个服务器内,而是存在于提示词和响应中传递的上下文里。虽然这减轻了推理服务器的负担,但它意味着需要在应用交付层构建大量的智能。ADC 现在已成为应用不可或缺的一部分。

  AI 系统中的故障也很少是二元的。推理集群可能正在运行,但某些节点已超载。检索服务可能响应缓慢。某个区域可能已经饱和,而其他区域仍然健康。如果没有智能的交付控制,这些局部故障会迅速降低用户体验并推高成本。

  在大规模场景下,AI 应用交付是一个系统问题,而不仅仅是网络问题。

  ADC 作为 AI 应用的控制平面

  ADC 提供了一个集中式控制平面,位于客户端和 AI 服务之间。它不仅仅是转发流量,而是主动管理 AI 应用的消费方式。

  像 F5 BIG-IP 这样的平台可以跨混合和云原生环境管理 AI 流量,实时适应变化条件的同时,一致地执行策略。F5 BIG-IP 既是 ADC,也是 F5 应用交付和安全平台的核心组件。

  F5 AI 参考架构展示了整个 AI 流水线中的战略性流量管理和关键安全节点。

  在 F5 AI 参考架构中,BIG-IP 充当 AI 应用的前门。它为模型端点、检索服务和支持性 API 代理访问,确保流量被高效路由、适当保护并持续可观测。

  AI 工作负载的智能流量管理

  AI 应用交付对流量管理提出了新的要求。简单的轮询负载均衡已不再足够。

  ADC 支持基于后端健康状态、地理位置、容量和语义策略的智能请求引导。请求可以被路由到特定的模型版本、推理池或区域,使团队能够通过金丝雀部署或分阶段发布安全地引入新模型。当后端性能下降时,流量可以自动重定向,无需等待完全宕机。

  当后端资源稀缺且昂贵时,这种方法至关重要。组织无需过度配置 GPU 来吸收峰值,而是可以使用 ADC 级别的控制来平滑流量、将请求从繁忙节点引开,并保护整体系统稳定性。

  AI 入口的安全与治理

  每个 AI 应用端点仍然是一个应用端点,而且往往对网络犯罪分子极具吸引力。

  随着 AI 采用的增长,新的滥用形式也在增加。成本耗尽攻击、自动化抓取、提示词洪水攻击以及对高级模型的未授权访问正成为常见关切。这些风险无法仅在模型内部解决。

  ADC 为安全和治理控制提供了自然的执行点。身份验证、授权、速率限制、API 保护和模型保护都可以在流量到达 AI 服务之前一致地应用。这降低了风险,同时为应用团队保留了灵活性。

  重要的是,ADC 可以成为纳入治理目标的理想场所。组织可以执行租户级配额、优先处理关键工作负载,并将 AI 使用与策略和预算约束对齐,而无需重写应用或重新训练模型。

  交互式 AI 的性能优化

  随着 AI 变得越来越交互化,性能对用户变得可见。

  延迟峰值、停滞的响应和中断的流会立即侵蚀信任。ADC 通过管理长连接、卸载 TLS 开销以及高效管理流式协议来帮助优化性能。它们可以及早检测到后端饱和,并在用户注意到性能下降之前重新路由流量。

  通过将交付问题与应用逻辑分离,团队获得了随工作负载演变动态调整性能的能力。

  服务发现与 Kubernetes 集成

  大多数 AI 应用运行在 Kubernetes 上,其中服务动态扩展,端点频繁变化。

  ADC 与 Kubernetes 集成,自动发现服务、实时跟踪扩展事件,并在 Pod 或服务出现和消失时将流量路由到正确的目标。Kubernetes 具有支持推理智能的构造,F5 充分利用了这些构造。这种集成使 F5 能够将一致的交付和安全策略扩展到集群之外,覆盖混合和多云环境。

  对于 AI 工作负载,这种外部控制平面尤其有价值。它将流量管理和策略执行与单个集群解耦,即使 AI 服务快速且独立地扩展,也能实现集中式可见性和治理。

  为什么选择 F5 进行 AI应用交付?

  F5 将流量管理、安全和可观测性整合在一个单一的成熟平台上。对于 AI 应用,这意味着可预测的性能、对昂贵后端资源的更强保护,以及跨环境的一致治理。

  通过在交付层运营,F5 使组织能够安全地扩展 AI,而不会减缓创新。团队可以引入新模型、支持新用例并跨云扩展,同时保持对成本、风险和可靠性的控制。(了解更多关于 F5 及其在 AI 应用交付中的作用:https://www.f5.com.cn/products/big-ip)。

  从精炼燃料到可靠交付

  在 F5 官网(f5.com.cn)上关于 AI 数据交付的前一篇文章中,我们将 AI 之旅比作石油管道开采,其中摄取、转换和交付准备了燃料。数据被提取、精炼并准备就绪。

  AI 应用交付是这一旅程的最后一步。它是确保精炼燃料真正安全、高效且大规模地到达引擎的分配网络。泵、阀门、计量和监控都与精炼能力同等重要。

  应用交付控制器为 AI 提供了该控制层。它们调节流量、防止过载、执行策略,并在需求增长时维持服务水平。没有它们,即使是先进的模型也难以提供一致的业务价值。

  在大规模场景下,AI 的成功不仅在于模型能做什么。而在于这些能力被交付得有多可靠。

  F5 在任何地方交付和保护 AI 应用

  如需了解我们的 AI 数据交付解决方案,请访问我们的 AI 数据交付和基础设施解决方案页面:https://www.f5.com.cn/solutions/use-cases/ai-data-delivery#overview

  F5 对 AI 的关注不仅限于数据交付。探索 F5 如何随时随地保护和交付 AI应用:https://www.f5.com.cn/solutions/ai-security

特别提醒:本网信息来自于互联网,目的在于传递更多信息,并不代表本网赞同其观点。其原创性以及文中陈述文字和内容未经本站证实,对本文以及其中全部或者部分内容、文字的真实性、完整性、及时性本站不作任何保证或承诺,并请自行核实相关内容。本站不承担此类作品侵权行为的直接责任及连带责任。如若本网有任何内容侵犯您的权益,请及时联系我们,本站将会在24小时内处理完毕。
0
相关文章