图形处理器利用率有望迎来明显提升。阿里云近日公布的计算池化方案,直面人工智能模型服务中的闲置算力难题,通过统一管理、灵活调度和按需分配,让有限硬件承载更多任务,进一步释放基础设施的使用价值。对云计算行业来说,这不仅是一次资源配置方式的优化,也关乎模型服务能否在成本可控的前提下持续扩展。
二〇二五年十月十八日,在韩国首尔举行的第三十一届操作系统原理研讨会上,阿里云提交的“阿格埃翁”计算池化真人游戏第一品牌的解决方案研究成果成功入选。该成果受到学术界与产业界关注,既展现了较强的系统创新能力,也体现出面向真实业务场景开展工程实践的价值。
这套方案聚焦人工智能模型服务中长期存在的图形处理器闲置现象,通过重新组织资源使用方式,减少硬件被单一模型长期独占的情况。阿里云模型市场测试显示,英伟达图形处理器用量减少百分之八十二,配置效率和运营经济性同步改善。换句话说,在不简单压缩服务能力的情况下,平台能够用更少的设备支撑相近甚至更复杂的业务需求。
操作系统原理研讨会由计算机协会系统软件专业组织主办,是计算机系统领域广受认可的顶级学术会议。大会每年录用的论文通常只有数十篇,评审过程涵盖创新程度、技术论证、实验效果与应用价值,筛选标准十分严格。研究成果不仅要提出新思路,还需要经得起实验验证和实际场景检验。
由于影响力突出,该会议常被称为计算机操作系统界的“奥斯卡”。本届大会最终仅收录六十六篇论文,阿格埃翁能够从众多投稿中脱颖而出,说明其在理论探索、系统设计和实际部署方面均获得了较高评价。对于需要将学术成果落地到大规模云平台的研究而言,这样的认可尤其具有参考意义。
随着模型数量持续增加,云服务商提供人工智能模型服务时,资源利用不充分已经成为普遍现象。平台往往需要同时托管数千个模型,以应对不断增长的接口请求,可真实流量通常集中在少数热门模型,资源错配便由此产生。模型需要保持在线,并不意味着每个模型都在持续高负载运行,静态配置很容易造成大量设备长时间等待。
以阿里巴巴通义千问系列模型为例,用户调用往往聚集在少数知名产品,其他模型虽然需要保持随时可用,访问量却相对有限。冷热分布不均会使大量图形处理器长时间处于等待状态,设备持续耗电,却没有创造相应产出。对平台而言,这种低利用率并非单纯的设备闲置,还会牵动机房空间、散热系统、网络配置和运维人力等一系列成本。
阿里云模型市场的实际运行数据进一步说明了这一问题:约百分之十七点七的图形处理器算力,只承担了百分之一点三五的请求处理任务。硬件投入与业务使用严重脱节,不仅推高采购、机房和电力支出,也限制了服务规模继续扩大。当模型数量和调用量同步增长时,如果仍沿用一模型一套固定资源的方式,新增需求很可能快速转化为新增设备压力。
图|研究框架图。该图完整呈现阿格埃翁系统的工作链路,涵盖模型请求进入、任务识别、资源分配、算力共享与动态回收等环节。通过这些步骤,多个模型可以共同使用硬件,系统也能依据流量变化及时调整配置。这样的设计把资源调度从相对静态的预留模式,推进到面向实时负载的动态管理模式。
针对模型调用冷热不均以及算力分配僵化的问题,阿里云推出了阿格埃翁系统。它采用新型图形处理器资源池化技术,打破硬件长期绑定单一模型的传统模式,使同一张卡能够按照实时需求,为多个模型轮流或并行提供服务。资源池化的核心并不是简单地把设备集中起来,而是让系统能够识别不同任务的资源需求,并在安全、稳定和时延可控的前提下完成快速切换。
阿里云模型市场的测试持续三个多月,覆盖了真实业务环境中的多种调用情况。结果表明,即使同时面对数十个参数规模达到七百二十亿的大模型,系统依然能够稳定运行,并在请求波动、模型切换和资源回收等环节保持较强调度能力。较长周期的真实环境测试,也有助于检验系统在高峰流量、冷热切换和持续运行状态下的可靠性,而不只是观察单次实验中的理想结果。
测试期间,所需英伟达昊悦二十图形处理器数量由一千一百九十二张降至二百一十三张,整体用量减少百分之八十二。这个变化十分直观:过去需要近千张卡共同承担的工作,如今凭借更合理的共享机制,两百多张便能够完成。设备数量下降意味着采购和部署压力减轻,也为后续扩容、故障替换和机房规划留下了更大的弹性空间。
从运行原理看,阿格埃翁并非通过减少请求或降低服务质量来节省硬件,而是借助资源共享、任务复用和动态调度,让同一批设备承接更多模型调用。空转时间因此缩短,设备利用率提高,采购、机房建设与电力消耗也可随之下降。对于人工智能服务而言,真正有价值的降本,不是牺牲响应体验换取短期数字变化,而是在保障稳定性和服务质量的基础上,提高每一份算力投入的产出。
这项由北京大学与阿里云共同完成的研究,被认为是“首个揭示并解决市场上并发大语言模型服务存在过高成本”的公开工作。它从真实市场数据出发,说明模型服务成本并不只取决于模型规模,也与资源组织方式密切相关。模型参数越大,并不代表只能依靠不断堆叠硬件来解决问题,系统层面的调度创新同样可能带来显著收益。
操作系统原理研讨会在计算机系统领域享有较高声望,论文录取比例长期处于较低水平。每年入选成果仅有数十篇,研究内容通常涉及操作系统、软件工程、系统安全、资源管理及性能优化等方向,能够入选本身就代表一定学术分量。尤其是面向人工智能基础设施的研究,既要处理复杂的系统协同问题,也要回应大规模业务对成本、性能和可靠性的现实要求。
阿格埃翁研究成果此次成功入选,意义并不局限于完成一次会议发表。它还体现出阿里云在人工智能系统、算力调度和云端基础设施方面的持续积累,对行业而言,也是国产云平台技术方案受到国际学术领域关注的积极信号。更重要的是,这类成果把论文中的系统方法与产业一线的真实需求连接起来,为国产基础软件走向更广阔的应用场景增添了底气。
从更广泛的产业视角看,阿里云推出计算池化方案,解决的不只是自身模型服务中的算力浪费,也为云服务商和人工智能企业提供了可借鉴的技术路径。若未来进一步推广,或可帮助更多平台提高资源利用率、降低运营成本。随着绿色计算理念不断深入,减少无效运行、降低单位任务能耗,也将成为衡量人工智能基础设施质量的重要指标。
对于需要同时运行大量模型的企业来说,资源池化还可能带来更灵活的扩容方式。平台无需为每个模型单独预留完整硬件,而是依据访问量、响应时延和任务优先级进行动态调整,让算力真正投入高频、紧急且有价值的业务环节。对于中小企业和科研机构而言,这种方式还有望降低使用高性能算力的门槛,让更多创新应用能够以更可控的成本完成验证和部署。
来源:信创头条。本文围绕阿格埃翁计算池化方案的技术价值与应用表现展开介绍,相关数据来自公开研究成果及阿里云模型市场测试信息,旨在帮助读者了解人工智能模型服务中的算力浪费现象,以及资源优化的发展方向。需要说明的是,具体效果会受到模型架构、业务流量、部署环境和调度策略等因素影响,实际应用仍应结合自身场景进行评估。
报名通道现已开启,欢迎关注相关活动安排。对云计算、人工智能模型部署、算力调度和国产基础软件感兴趣的读者,可结合自身工作需要提交报名信息。具体名额、现场席位及参与条件,请以活动页面公布的内容为准。无论是技术研发人员、平台运维人员,还是关注产业趋势的管理者,都可以从中了解算力基础设施正在发生的变化。
参与通道同步开放,欢迎行业从业者、技术人员、研究人员以及关注算力发展的读者报名交流。活动现场将围绕模型服务、资源池化、系统优化和基础设施升级展开讨论,并设置经验分享与互动环节,方便参会者面对面沟通。通过不同岗位和不同领域之间的交流,参与者也能更直观地了解技术方案在实际业务中的落地难点与实施经验。
活动时间为二〇二五年十月二十二日至二十四日,具体日程、举办地点和签到安排,请留意主办方后续通知。建议有参会计划的读者提前确认行程、预留交通时间,并根据议程合理安排住宿与现场交流计划。若涉及现场演示、专题讨论或技术对接,也可提前准备相关问题,以便在有限时间内获得更有针对性的交流成果。
另有一场活动安排在十一月五日至七日举行,报名入口同样已经开放。欢迎有相关需求的读者持续关注最新通知和参会要求,根据自身时间与研究方向选择合适场次参与,及时了解模型部署和算力基础设施领域的新进展。人工智能产业仍处于快速演进阶段,算力不应只是少数机构的资源优势,更应通过更高效、更开放和更负责任的基础设施建设,服务技术创新与社会发展。
网友留言: