
乍看之下,云网络似乎并不会对人工智能(AI)工作负载产生重大影响。毕竟,云网络通常既快速又可靠。IT领导者很可能会认为,AI的性能与成本优化更多地取决于模型设计和训练流程等因素,而非云网络配置。
然而实际上,云网络在AI部署的成效方面发挥着至关重要的作用——正因如此,那些希望充分利用AI潜力的企业必须精心规划其云网络架构与配置。ExtremeNetworks在其《2026年网络AI现状》(StateofAIforNetworking2026)调查中发现,92%的IT高管表示AI增加了对计算资源和带宽的需求;这凸显了AI的应用如何给现有基础设施带来压力,并催生了对更具可扩展性的云原生网络的需求。
请了解云网络如何影响AI工作负载、面临的主要挑战,以及针对AI优化云网络的策略。
云网络如何影响AI工作负载?
云网络通过多种方式影响AI,具体包括:
性能:为了实现实时决策(这是AI应用场景的常见目标),数据需要在网络中以极低延迟进行传输。
可靠性:带宽受限或丢包等网络问题可能导致AI工作负载失败,因为系统无法可靠地获取所需数据。
成本:跨网络传输数据需要付出成本。当数据离开云环境时,情况尤为明显,因为这会产生云服务提供商收取的数据流出费用(egresscharges)。
可扩展性:网络带宽和性能的局限性可能会制约AI工作负载的可扩展性。例如,云端模型在推理阶段每秒能处理的提示词(prompt)数量,取决于云网络在用户与模型之间传输这些提示词的速度。
简而言之,对于托管在云端和/或需与云环境进行数据收发的AI模型而言,云网络很容易成为影响模型整体性能、可靠性、成本及可扩展性的薄弱环节。
AI工作负载在云网络方面面临哪些挑战?
总体而言,云网络通常是可靠的。与企业在自有数据中心或利用本地(on-prem)基础设施部署的网络相比,云网络往往性能更佳,故障率也更低。
但这并不意味着企业只需采用云服务提供商提供的默认网络配置便可高枕无忧。恰恰相反,针对AI工作负载,企业在云网络方面需要考量诸多特定挑战,例如:
多云网络延迟。在同一云平台内部传输数据时,云网络通常表现优异。然而,对于采用多云架构的企业而言,在不同云平台之间传输数据时产生的延迟和带宽限制,可能会成为制约AI性能的瓶颈。
数据流出费用(Egresscharges)。如前所述,云服务提供商通常会对数据流出(即数据传输至云平台外部)收取费用。这会给AI成本管理带来挑战,因为如果模型频繁在不同云平台间传输数据,流出费用将迅速累积。
访问控制。保障云网络安全需要部署访问控制策略,以限制资源间的交互方式。然而,配置上的疏忽可能会引发AI性能问题。例如,错误的配置可能会阻碍两个AI智能体(AIagents)之间的通信。
可观测性。无论在何种环境下,监控和观测网络性能都极具挑战性。而在云端部署AI工作负载时,由于数据传输量巨大且云网络架构复杂,这一任务变得尤为棘手。
如何针对AI优化云网络?
企业应考虑以下最佳实践,以充分利用云网络,从而实现AI工作负载之间以及AI工作负载与IT基础设施其他部分的高效集成。
VPC
虚拟私有云(VPC)是一种在网络层面隔离工作负载的云网络资源。它们有助于在不牺牲性能的前提下提升AI安全性。例如,企业若将AI模型部署在VPC内,便能更轻松地管控哪些用户或软件服务可以连接到该模型。VPC还能支持诸如提示词(prompt)过滤之类的AI安全措施,因为它们可以将所有提示词和响应引导至一个中央端点进行过滤处理。
智能体网格(Agentmeshes)
智能体网格是一项旨在整合AI智能体的新兴技术。在大多数情况下,其运作方式是通过中央枢纽在智能体与AI模型之间路由通信,并在此枢纽处对数据进行过滤、转换、拦截等处理。这样一来,便无需在每个单独的智能体内执行这些任务。
从云网络角度来看,智能体网格在提升性能和缓解安全问题方面大有可为。例如,它们可以剔除智能体发送给模型的请求中不必要的数据。这不仅能减少网络传输的数据量从而提升性能,还能降低数据流出成本(若数据是在不同云环境之间传输的话)。
面向AI的边缘计算
边缘计算是指将工作负载部署在靠近最终用户的位置,而非集中式的云数据中心。对于AI工作负载(尤其是那些需要实时响应用户请求的任务)而言,边缘计算能缩短数据传输距离,从而显著提升性能。
面向AI的边缘计算也带来了一系列挑战,例如需要在边缘侧部署能够承载计算密集型AI模型的各类基础设施。但从网络角度来看,其带来的性能提升往往相当可观。
互连(Interconnection)
网络互连是指在两个或多个特定站点之间运行的专用网络连接——例如连接两个不同的公有云,或连接公有云与私有数据中心。
由于互连允许企业通过专用基础设施而非“通用”互联网传输数据,因此能大幅提升性能。这是加速AI性能(特别是针对实时工作负载)的另一种有效途径。
官方微信
天猫店铺
京东店铺
销售王经理