AI 基础设施
AI基础设施的真正瓶颈:数据传递而非GPU算力
企业AI部署中,GPU利用率低下常被归因于算力不足,但实际瓶颈在于数据从存储到算力的传递效率。本篇分析数据传递架构对AI性能、成本和可靠性的影响,并探讨松散耦合架构与智能控制层如何解决这一挑战。
当GPU等待数据时,算力投资正在浪费
过去18个月,企业疯狂采购GPU、训练大模型、部署AI工具。然而,从试验转向生产时,ROI压力骤增。IDC 2025年报告指出,组织正从一次性AI部署转向可重复、可扩展的生产架构,性能、安全、可靠性和运维一致性变得与模型创新同等重要。
但许多企业发现,AI项目表现不佳的根本原因并非算力不足,而是数据传递效率低下。昂贵的GPU在等待数据时持续空转,每秒钟的空转成本高达数美元。Uptime Institute 2025年度中断分析显示,超过半数企业最严重的中断成本超过10万美元,五分之一超过100万美元——而中断往往源于数据路径拥堵。
冰山模型:被忽视的90%基础设施
F5产品营销高级副总裁Nirav Shah用冰山模型形容AI基础设施:水面之上是LLM、AI应用、编排框架和昂贵的GPU集群——这10%吸引了大部分投资;水面之下是存储、网络、流量管理、安全控制和负责数据传递的系统——这90%决定投资能否真正产生价值。
现代AI系统依赖海量非结构化数据,存储在S3兼容的对象存储中。训练、微调、RAG和推理工作负载都需要数据在存储和GPU环境之间持续流动。当管道受限,GPU利用率直线下降。Shah指出:“症状看起来像是计算问题,但根源往往是数据饥饿。”
与传统企业应用不同,AI工作负载会放大基础设施的微小弱点。一个常规环境中不被注意的延迟尖峰、吞吐阻塞或流量激增,在AI场景下会产生不成比例的影响。
从紧耦合到松耦合:架构变革驱动灵活性
当前瓶颈源于AI出现之前的架构决策。历史上,企业将应用直接连接到存储环境,简单高效。但到AI规模下,这种简单性变成负债。存储系统被迫处理本不属于它的任务:终止加密连接、管理网络流量、执行安全策略、处理大量分布式的AI请求。每个加密事务消耗CPU,每个连接产生开销,每个流量尖峰给存储系统带来额外压力。
解决方案是转向松散耦合架构:在计算与存储之间插入应用交付控制器(ADC),作为智能控制平面。ADC成为存储前门,处理TLS终止、证书管理、流量优化、策略执行和协议感知的S3处理。将网络和加密功能移至专门的基础设施中,存储系统得以专注于服务数据。同时,存储环境的升级、扩展或迁移无需强制应用变更,带来运营灵活性。
中间层不再只是“额外跳”:ADC提升而非降低性能
过去基础设施团队对数据路径中任何额外层持怀疑态度,认为每个组件增加延迟。AI基础设施正在挑战这一假设。SecureIQLab的独立测试评估了在企业对象存储前放置ADC的影响,结果显示无意义的吞吐损失,实际网络条件下,经过控制层管理的流量吞吐往往更好。原因在于ADC不只是传递流量,而是优化连接、管理协议、卸载加密处理、智能引导请求,帮助数据路径更高效运行。
案例分析:数据传递优化带来5倍性能提升
一家大型全球金融服务机构准备扩展AI基础设施,使用Kubernetes工作负载和S3对象存储。原有环境依赖共享虚拟负载均衡,数据量增加后出现性能和可靠性问题。该机构没有增加计算容量,而是专注于存储到计算的边界:在对象存储前部署专用物理ADC基础设施,创建集中控制点进行流量管理和S3优化。结果:对象创建、读取和删除操作性能至少提升5倍,删除延迟改善一个数量级以上,同时未出现性能回归。
弹性三维度:可达性、策略与交付
F5解决方案架构师Mark Menger提出评估AI数据交付架构的三个维度:
- 可达性:确保AI工作负载总能访问健康的存储资源。存储集群降级或不可用时,流量自动重定向而不中断AI应用。
- 策略:防止自我造成的中断。AI工作负载可能产生“惊群”效应、重试风暴等异常流量,智能控制层可整形流量、执行策略,维持一致安全态势而不牺牲性能。
- 交付:关注连续性。存储节点故障、硬件升级、软件补丁——弹性架构将AI客户端与这些变动隔离,即使后端基础设施变化,数据流也不中断。
三者共同确保GPU在底层环境压力下保持高效。
ADC进化到ADSP:统一交付与安全平台
随着AI环境变大、更分散,仅流量管理已不够。组织需要可观测性、安全、策略执行和运维一致性。这推动了对应用交付与安全平台(ADSP)的兴趣,结合应用交付、流量工程、安全控制和可见性。
“AI打破了将交付和安全作为独立问题解决的模式,”Shah说,“当数据在混合多云环境中持续在存储、计算和应用之间移动时,你需要一个同时交付和保护流量的统一平台。”这类似于20年前Web基础设施的演进:从简单负载均衡发展到复杂应用交付控制器。
CloudTechDaily Insight
AI基础设施的瓶颈正在从计算转向数据传递。企业若仅关注GPU采购而忽视存储到计算的管道效率,将面临严重的投资浪费和性能不可靠。松散耦合架构和智能控制层(如ADC/ADSP)不仅能提升GPU利用率,还能降低运维复杂度、增强弹性。对于CIO和云架构师,数据传递层应成为AI基础设施战略的核心组成部分。未来,随着推理和边缘AI需求增长,数据路径的优化将决定AI部署的成败。企业需重新评估当前架构:是否将网络、安全和流量管理功能从存储中分离?是否引入了统一交付控制平面?答案将直接影响AI项目的ROI和可扩展性。
参考链路 · cloudtechdaily
cloudtechdaily 将这段说明放在「云平台 / 关注公有云平台、区域发布、价格变化、伙伴生态以及企业上云迁移策略。 / 数据中心」的站点语境中: 日期、名称和状态变化仍需重新核对。「云平台 / 关注公有云平台、区域发布、价格变化、伙伴生态以及企业上云迁移策略。 / 数据中心」解释了本文的本地编辑角度;读者复用摘要前应先打开来源链接。