大规模交付 AI 应用:ADC 的关键作用
人工智能流水线并不会随着数据到达模型而结束。从很多方面来说,这才是最艰难工作的开始。
当数据被摄取、转换并交付用于训练或推理之后,组织仍需将这些数据整合到面向用户、合作伙伴和系统的 AI 应用中,且规模必须足够大。这些应用如今被超级赋能,用于客户体验、自动化工作流以及实时决策支持。因此,可用性、性能、安全性和治理仍然是应用交付的首要关切。
可靠地交付 AI 应用,需要的不仅仅是最新、最强大的模型或基础设施。它需要一个控制层,能够智能地管理 AI 流量、保护稀缺资源,并适应高度动态的环境。
这正是应用交付控制器(ADC)继续发挥核心作用的地方。
为什么 AI 应用交付与众不同
传统应用通常处理短暂且可预测的请求。AI 应用的行为则大不相同。在我走访世界各地并与许多构建 AI 应用的人交谈的过程中,我注意到了这些对话中的一些共性。
AI 流量往往是突发且不均匀的。请求可能包含大型提示词和上下文。响应可能是持续流式传输,而非一次性全部返回。单个请求可能会扇出到多个服务,包括检索系统、嵌入服务和下游工具。在幕后,推理工作负载消耗着昂贵且容量受限的资源,例如 GPU。
AI 应用还引入了一种新的会话概念。会话数据不再保存在单个服务器内,而是存在于提示词和响应中传递的上下文里。虽然这减轻了推理服务器的负担,但它意味着需要在应用交付层构建大量的智能。ADC 现在已成为应用不可或缺的一部分。
AI 系统中的故障也很少是二元的。推理集群可能正在运行,但某些节点已超载。检索服务可能响应缓慢。某个区域可能已经饱和,而其他区域仍然健康。如果没有智能的交付控制,这些局部故障会迅速降低用户体验并推高成本。
在大规模场景下,AI 应用交付是一个系统问题,而不仅仅是网络问题。
ADC 作为 AI 应用的控制平面
ADC 提供了一个集中式控制平面,位于客户端和 AI 服务之间。它不仅仅是转发流量,而是主动管理 AI 应用的消费方式。
像 F5 BIG-IP 这样的平台可以跨混合和云原生环境管理 AI 流量,实时适应变化条件的同时,一致地执行策略。F5 BIG-IP 既是 ADC,也是 F5 应用交付和安全平台的核心组件。
F5 AI 参考架构展示了整个 AI 流水线中的战略性流量管理和关键安全节点。
在 F5 AI 参考架构中,BIG-IP 充当 AI 应用的前门。它为模型端点、检索服务和支持性 API 代理访问,确保流量被高效路由、适当保护并持续可观测。
AI 工作负载的智能流量管理
AI 应用交付对流量管理提出了新的要求。简单的轮询负载均衡已不再足够。
ADC 支持基于后端健康状态、地理位置、容量和语义策略的智能请求引导。请求可以被路由到特定的模型版本、推理池或区域,使团队能够通过金丝雀部署或分阶段发布安全地引入新模型。当后端性能下降时,流量可以自动重定向,无需等待完全宕机。
当后端资源稀缺且昂贵时,这种方法至关重要。组织无需过度配置 GPU 来吸收峰值,而是可以使用 ADC 级别的控制来平滑流量、将请求从繁忙节点引开,并保护整体系统稳定性。
AI 入口的安全与治理
每个 AI 应用端点仍然是一个应用端点,而且往往对网络犯罪分子极具吸引力。
随着 AI 采用的增长,新的滥用形式也在增加。成本耗尽攻击、自动化抓取、提示词洪水攻击以及对高级模型的未授权访问正成为常见关切。这些风险无法仅在模型内部解决。
ADC 为安全和治理控制提供了自然的执行点。身份验证、授权、速率限制、API 保护和模型保护都可以在流量到达 AI 服务之前一致地应用。这降低了风险,同时为应用团队保留了灵活性。
重要的是,ADC 可以成为纳入治理目标的理想场所。组织可以执行租户级配额、优先处理关键工作负载,并将 AI 使用与策略和预算约束对齐,而无需重写应用或重新训练模型。
交互式 AI 的性能优化
随着 AI 变得越来越交互化,性能对用户变得可见。
延迟峰值、停滞的响应和中断的流会立即侵蚀信任。ADC 通过管理长连接、卸载 TLS 开销以及高效管理流式协议来帮助优化性能。它们可以及早检测到后端饱和,并在用户注意到性能下降之前重新路由流量。
通过将交付问题与应用逻辑分离,团队获得了随工作负载演变动态调整性能的能力。
服务发现与 Kubernetes 集成
大多数 AI 应用运行在 Kubernetes 上,其中服务动态扩展,端点频繁变化。
ADC 与 Kubernetes 集成,自动发现服务、实时跟踪扩展事件,并在 Pod 或服务出现和消失时将流量路由到正确的目标。Kubernetes 具有支持推理智能的构造,F5 充分利用了这些构造。这种集成使 F5 能够将一致的交付和安全策略扩展到集群之外,覆盖混合和多云环境。
对于 AI 工作负载,这种外部控制平面尤其有价值。它将流量管理和策略执行与单个集群解耦,即使 AI 服务快速且独立地扩展,也能实现集中式可见性和治理。
为什么选择 F5 进行 AI应用交付?
F5 将流量管理、安全和可观测性整合在一个单一的成熟平台上。对于 AI 应用,这意味着可预测的性能、对昂贵后端资源的更强保护,以及跨环境的一致治理。
通过在交付层运营,F5 使组织能够安全地扩展 AI,而不会减缓创新。团队可以引入新模型、支持新用例并跨云扩展,同时保持对成本、风险和可靠性的控制。(了解更多关于 F5 及其在 AI 应用交付中的作用:https://www.f5.com.cn/products/big-ip)。
从精炼燃料到可靠交付
在 F5 官网(f5.com.cn)上关于 AI 数据交付的前一篇文章中,我们将 AI 之旅比作石油管道开采,其中摄取、转换和交付准备了燃料。数据被提取、精炼并准备就绪。
AI 应用交付是这一旅程的最后一步。它是确保精炼燃料真正安全、高效且大规模地到达引擎的分配网络。泵、阀门、计量和监控都与精炼能力同等重要。
应用交付控制器为 AI 提供了该控制层。它们调节流量、防止过载、执行策略,并在需求增长时维持服务水平。没有它们,即使是先进的模型也难以提供一致的业务价值。
在大规模场景下,AI 的成功不仅在于模型能做什么。而在于这些能力被交付得有多可靠。
F5 在任何地方交付和保护 AI 应用
如需了解我们的 AI 数据交付解决方案,请访问我们的 AI 数据交付和基础设施解决方案页面:https://www.f5.com.cn/solutions/use-cases/ai-data-delivery#overview
F5 对 AI 的关注不仅限于数据交付。探索 F5 如何随时随地保护和交付 AI应用:https://www.f5.com.cn/solutions/ai-security