从“堆硬件”到“系统重构”:阿里云如何破解AI算力损耗难题?
在AI大模型与智能体(Agent)全面爆发的今天,算力早已成为支撑技术演进的“水电煤”。然而,随着模型参数迈向万亿级别、智能体并发需求呈指数级增长,企业正面临着算力供给的巨大压力。单纯依靠“堆硬件”的传统模式已触及天花板,如何在有限的空间、能耗与成本下,提供极致高效、绿色的算力底座,成为全行业必须跨越的鸿沟。阿里云通过全栈AI技术体系的深度重构,给出了一套系统性的解题思路。
打破千卡并行瓶颈,让算力“跑满”不损耗
智能计算不同于通用计算,在海量数据训练与模型同步环节,算力损耗问题尤为突出。过去,千卡以上规模的算力输出效率往往仅有40%左右,导致智能算力成本高昂。为彻底改变这一现状,阿里云在飞天智算平台中引入了体系化的核心技术。
在网络通信层面,阿里云采用自研的高性能Solar-RDMA网络,实现端对端最低2微秒的极低延迟;配合无阻塞通信技术,将计算过程中的数据交换速度最高提升5倍。在AI开发层,阿里云提供分布式训练框架,对分布式策略进行自动组合与调优,将AI训练效率提升11倍以上。通过软硬协同,阿里云成功将千卡并行计算效率提升至90%以上,让昂贵的算力真正转化为产业价值。
面向智能体时代,重构底层计算架构
随着AI应用从单次对话工具向成百上千个智能体协同工作演进,算力底座正面临从“支撑单一模型推理”向“支撑群智协同与多模融合”的升级。
针对这一趋势,阿里云在服务器与网络基础设施上进行了全面迭代。在2025年云栖大会上亮相的新一代磐久128超节点AI服务器,单柜即可支持128个AI计算芯片,刷新了业界密度纪录;配合新一代高性能网络HPN 8.0,可支持单集群10万卡GPU的高效互联。同时,阿里云通过智能调度技术提升CPU利用率,并推出综合存算互连架构,实现更长的缓存与更低的推理延迟,让CPU与GPU的协作更加高效,从容应对海量智能体的并发调度与稳定在线需求。
绿色算力底座,探索“东数西算”与自研芯片新路径
在追求极致性能的同时,阿里云也将“绿色低碳”作为智算中心建设的核心指标。通过自然风冷、液冷等先进散热技术以及智能运维,阿里云智算中心的PUE(电能利用效率)最低可达1.09,大幅降低了单位算力的碳排放。
在区域布局与底层技术上,阿里云正加速构建全栈自主的算力网络。例如,在建的阿里飞天云智能华东算力中心(上海金山)不仅设计PUE值控制在1.18,还将重点部署平头哥“真武”芯片,打造从底层芯片到上层应用的全栈自主算力底座。结合张北、乌兰察布等超大规模智算中心,阿里云正形成一张覆盖全国、绿色高效的算力网络。
AI for Science:用极致弹性加速科学突破
强大的算力底座最终要服务于产业实践。在AI for Science领域,深势科技基于阿里云的云原生计算与存储服务,构建了分层的数据基础设施。面对科学计算对资源的极致弹性需求,阿里云实现了亚分钟级甚至秒级的资源准备,并将原本需要数年的药物筛选与优化工作缩短至几个月甚至几周,极大加速了新药研发进程。
从底层芯片、超节点服务器到分布式存储与智算集群,阿里云正以“1+1>2”的全栈AI协同优化,重塑下一代计算机的形态。在智能体时代,唯有跳出“堆硬件”的惯性思维,从真实运行场景出发重构算力系统,才能真正释放AI的产业潜能。
