高校算力建设普遍面临“集中式统建”调度僵化与“分散式自治”重复建设的两难困境。华中科技大学以制度创新破局,提出“众筹式”共建模式,通过出资托管、远程接入两类机制与差异化权益设计,将分散于院系的算力资源整合为全校“一盘棋”;同时以容器化混合调度架构支撑HPC与AI异构负载协同,并延伸出校企共建、国产化生态等多层次跨域协同路径。
随着算力成为国家战略生产力,高校作为科研与人才培养主力,面临AI for Science新范式下多学科计算需求差异化、资源供给弹性不足等挑战。当前,部分高校的“集中式统建”调度僵化、扩容滞后,“分散式自治”重复建设、形成资源“孤岛”,整体利用率偏低。同时,HPC与AI训推负载深度融合,对异构调度与数据安全提出了更高要求。
对此,华中科技大学立足科研与教学的迫切需求,系统性推进算力资源统筹建设,通过制度创新、技术融合、生态构建三位一体的实践,探索出一条校内集约共享、校企跨域协同、技术架构融合、服务体验升级的建设路径,为高校算力治理体系升级提供了“华科大方案”。
制度破局:“众筹式”
共建实现校内算力集约共享
针对校内算力资源“散而小”的突出问题,学校创新性提出“众筹式”建设模式,通过制度设计与权益激励,实现了算力资源从“分散自治”到“全校一盘棋”的转型。
在制度层面,学校出台了《华中科技大学高性能计算公共服务平台建设与运行管理办法》,确立“统一规划、分步实施,开放共享、有偿使用”的基本原则,明确二级单位不再新建独立算力平台,存量及新增集群须接入校级平台统一纳管。同时设计了两类参与机制:一是出资托管模式,院系用科研经费按标准采购设备,硬件托管至学校机房,由平台统一运维;二是远程接入模式,院系自建集群经技术改造后,通过光纤专网接入平台,保留硬件属地管理权。
在激励机制层面,出台《华中科技大学高性能计算公共服务平台共建单位免费机时折算及机时收费分配标准》,构建差异化权益体系(表1)。出资托管单位可选择“高免费机时+零分红”、“平衡型”、“纯分红”三类组合,远程接入单位因承担硬件运维成本,可获70%共享收益分红。权益期限最长达8年,确保参与方稳定回报,形成“学校轻资产扩容、院系降本增效、科研团队便捷调用”的多方共赢格局。
多维拓展:构建多层级跨域协同算力生态
校内集约共享是基础,而跨域协同则是突破算力规模边界、响应爆发式需求的关键。华中科技大学在“众筹式”校内共建的基础上,进一步向校企协同、产教融合、跨地域调度延伸,构建了多维度、多层次的跨域协同体系,破解算力建设周期长、弹性不足、自主可控能力弱等痛点。
校内跨域:实现异地集群逻辑统一调度
跨域协同的第一层,是打破地理空间限制,实现校内异地算力集群的统一纳管与透明调度。依托万兆光纤专网与统一调度架构,学校成功将“强磁一号”、“引力一号”、“成像一号”等异地科研集群接入校级算力平台,实现物理分散、逻辑统一。学生用户在提交作业时无需感知算力的物理位置,平台可根据用户需求自动跨域调度资源。此种跨地域的资源统合模式,既保留了重大科技基础设施的属地化管理属性,又充分释放了其闲置算力的共享价值,为高校多校区、多场地算力协同提供了可行路径。
校企协同:探索算力共建共营新模式
针对AI大模型训练等爆发式算力需求与传统采购周期冗长的矛盾,华中科技大学在“众筹式”模式基础上,启动千P级“融合算力中心”建设,探索“校内空间、企业承建、共管共享、共营共赢”的校企协同新机制。
在该模式下,学校提供机房场地、电力基础设施及政策保障;合作企业投入算力、存储、网络等硬件设备,以及调度管理、监控运维等软件平台与专业运营团队。双方联合成立管理委员会,统筹需求规划、资源配置与运营决策,实现优势互补、风险共担、收益共享。目前学校已成立融合算力中心建设指挥部,新建计算机大楼作为核心机房场地已顺利封顶,未来将构建HPC与AI深度融合的异构算力平台,全面支撑多学科交叉研究、重大科研攻关与科技成果转化。
这种校企协同模式,既保障了算力资源的本地化部署与科研数据安全,又大幅缩短了算力扩容周期,减轻了学校一次性资金投入压力,是高校算力建设从“自建自用”向“共建共营”转型的重要探索。
产教协同:共建国产化算力自主生态
为响应国家算力自主可控战略,华中科技大学积极推动国产软硬件在高校场景的落地应用,构建产教融合的国产化算力生态。学校与华为合作成立了“华中科技大学—华为鲲鹏昇腾科教创新孵化中心”,接入14台鲲鹏高性能服务器、16台昇腾AI训练/推理服务器,形成校级共享国产算力资源池。
依托该资源池,学校将国产算力芯片、开发框架与应用软件融入课程建设、实验教学与科研项目,既为师生提供了安全可控的算力支撑,也加速了国产化算力生态的人才培养与技术迭代,实现了科研支撑、人才培养与产业发展的同频共振。
技术支撑:容器化混合调度赋能异构负载协同
集约共享与跨域协同的落地,离不开底层技术架构的支撑。随着HPC与AI负载的深度融合,高校算力需求呈现高度异构化特征:传统科学计算以批处理、多节点并行为主,依赖Slurm等作业调度系统;AI训推则以交互式、单节点大显存为主,更适配容器化与云原生架构。单一调度体系无法同时高效支撑两类负载,易造成资源浪费与用户体验割裂。
全域容器化的资源底座
针对这一挑战,华中科技大学算力平台采用“容器化全域融合架构”(如图1所示),构建Slurm与Kubernetes协同的两级混合调度引擎,实现异构资源的统一管理与灵活调度。
架构以Kubernetes为核心引擎,将底层CPU、GPU、存储、网络等异构硬件资源抽象为标准化容器单元,彻底解耦算力供给与物理基础设施。通过统一的容器调度层,平台可按需组装不同形态的计算环境,既可以是由多个容器节点组成、预装Slurm调度系统的传统HPC集群,也可以是封装为单节点容器的SaaS私有实例,还可以是虚拟机形态的高性能工作站。
该架构同时实现了多租户安全隔离、故障自动恢复与资源弹性伸缩,为跨域资源的统一纳管提供了标准化的技术底座,无论本地集群还是异地集群,均可通过标准接口接入统一资源池。
两级协同的混合调度机制
平台构建“容器资源调度+作业调度”的两级混合调度架构:底层由Kubernetes负责基础设施层面的资源分配、弹性扩展、故障迁移与生命周期管理;上层运行Slurm作业调度系统,专门管理用户提交的MPI并行计算等传统HPC作业队列。
两级调度通过标准化接口协同联动,既保留了HPC用户熟悉的作业提交方式与使用习惯,又赋予了平台容器化的灵活部署能力,一套架构可同时支撑批处理计算、交互式开发、模型训推、可视化分析等多种负载。
多形态的资源交付模式
基于混合调度架构,平台向用户提供三类差异化的资源交付模式,覆盖全场景科研需求:
HPC公共集群:经预配置的容器镜像快速部署虚拟化计算集群,用户通过SSH方式访问,操作体验与传统物理集群完全一致,适合大规模并行计算任务;
专属计算集群:用户可自主创建、全权管理独立容器集群,支持部署定制化调度系统与软件环境,直接调用物理GPU与高速网络,适合有特殊环境要求的科研团队;
按需私有服务:涵盖JupyterLab、RStudio等云端开发环境,GaussView、VMD等交互式图形软件,Windows/Linux虚拟桌面,以及AI模型API服务网关,支持开箱即用的敏捷计算。
通过“计算环境即服务”的交付模式,用户无需感知底层硬件差异与跨域调度细节,通过统一门户即可一键获取多形态算力资源,真正实现了异构负载的高效协同与算力服务的普惠化。
服务赋能:打造无感化跨域协同服务体系
算力的集约共享与跨域协同,最终要落脚于用户体验的提升。高校传统算力服务普遍存在流程繁琐、报销复杂、技术支持响应慢等痛点,科研人员往往耗费大量时间在事务性工作上,挤占了核心科研精力。华中科技大学坚持“以科研人员为中心”,深度融合AI与信息化技术,构建全流程“无感化”服务生态,大幅降低算力使用的门槛与成本。
全线上财务闭环,告别纸质报销
平台无缝对接学校财务系统与电子签名平台,构建了从充值到结算的全线上经费管理闭环。用户在线选择所需的CPU核时/GPU卡时,系统自动关联具备测试费预算的科研项目;确认订单后,系统自动生成电子服务协议,经项目负责人在线签署后,实时冻结对应项目经费并同步充值机时,全程无需线下签字和纸质报销。
在收入结算端,平台定期批量办理充值收入入账,年终依据各共建单位的共享机时占比与分红比例,自动完成收益二次分配,拨付至各单位指定账户。全流程线上化的财务体系,年均为用户节省超5000小时事务性耗时,彻底解决了算力报销流程繁冗的痛点。
AI智能运维,7×24小时技术支持
依托本地化部署的外部大模型,通过集成Openclaw,完善平台运维skills文档,平台打造了“HPC科研助手”智能体,整合操作指南、软件编译、故障排查等全量知识库,提供7×24小时实时智能问答服务。用户在使用过程中遇到环境配置、作业提交、软件安装等问题,可随时通过平台入口咨询,智能助手可覆盖80%的常见运维问题,大幅提升了问题响应效率。
同时,平台建设科研计算交流社区,通过“积分兑换机时”的激励机制,鼓励用户分享使用经验、交流计算技巧,形成互助共享的社区氛围,未来还将探索跨校联盟社区模式,推动计算技术的跨校传播与协同。
统一身份与多渠道触达
平台对接校园统一身份认证系统,实现账号一键开通、权限自动同步,师生无需单独注册即可凭校园身份访问全部算力服务。同时,平台集成微信、短信、邮件等多渠道通知机制,资源审批、作业完成、余额预警等关键信息可分钟级触达用户终端,确保科研人员实时掌握任务状态,提升科研协作效率。
实践成效
通过“众筹式”整合与跨域协同建设,华中科技大学校级算力平台已接入国家脉冲强磁场科学中心和精密重力测量国家重大科技基础设施等9家单位的算力集群,成功聚合469个计算节点(含420个CPU节点、49个GPU节点),提供36016个CPU核心、215张GPU卡及超24PB存储,整体算力规模超78PFLOPS,其中HPC双精度算力4.16PFLOPS,AI算力(FP16)74.72PFLOPS。
平台目前支撑全校35个院系、343个科研团队开展科研计算,累计完成总计算量达2.3亿核时,预装20余种主流科学计算软件,可高效支撑多学科复杂计算与数据分析任务。截至目前,平台助力校内产出高水平学术论文500余篇,其中SCI一区论文291篇;服务国家级课题210项,为强磁场科学、引力物理、生物医学、人工智能等前沿领域的重大突破提供了坚实的算力保障。
结语
高校算力基础设施的高质量发展,是支撑教育数字化转型与科技自立自强的重要基础。从“分散建设”走向“集约共享”,从“单点支撑”走向“跨域协同”,是高校算力发展的必然趋势。华中科技大学通过制度创新、技术融合与生态构建,探索出一条“众筹共建聚资源、跨域协同扩边界、技术融合提效率、智能服务优体验”的建设路径,不仅有效提升了自身的科研支撑能力,也为同类高校提供了可复制、可推广的实践范式。
未来,随着全国一体化算力网络的持续完善,高校算力建设将进一步向跨校协同、区域联动的方向发展。华中科技大学将持续深化融合算力中心建设,推动算力资源在更大范围的共享与协同,为国家科技创新与人才培养贡献更强的算力支撑。
来源:《中国教育网络》2026年7月刊
作者:柳斌 张策(华中科技大学网络与信息化办公室)