当头部高校聚焦于算力如何“协同”和“赋能”时,许多地方高校仍在算力短缺的困境中挣扎。本文以武汉科技大学这一省属高校的深度调研为样本,揭示了地方高校普遍面临的五类结构性痛点,并提出了“分期建设、分级调度、软件共享、专业运维、安全管控”五位一体的解决路径,为同类院校提供了一个可参照的行动框架。
十余年间,算力在高校科研活动中的地位发生了实质性转变:从辅助性的科研工具,演变为支撑科研产出的必要条件,进而上升为高校办学的基础设施。
回望2015年前后,材料学专业教师借助高性能台式机运行VASP任务,数日至数周便可完成计算;而到了大模型时代,即便是用72B参数级别的模型进行参数微调,24G单卡显存已远不足以承载实际负载,依靠A100等高显存GPU集群才能起步。从分子动力学模拟到多模态大模型训练,计算任务对硬件的依赖度显著抬升,算力由过去的加分项逐渐转变为科研活动的入场券。
当前,国内高校算力供给的区域分化和校际分化均较为明显。少数顶尖高校依托国家超算中心、国家实验室等国家级平台,算力供给相对充足;而大量高校则普遍受制于经费紧张、设备老化、运维力量薄弱等约束,并因此错失了不少首发成果。此类差距直接影响科研产出的时效性与首发权,其影响已超出单纯的效率范畴,构成地方高校在高端科研竞争中的结构性短板。
研究方法
本次调研覆盖武汉科技大学的15个学院,涵盖理、工、医、文、管五大学科门类。调研周期为2025年5—6月,由学校信息化主管部门牵头组建跨学科技术团队(含信息化办公室、学科代表与外部技术顾问),共召开座谈会15场,50余位师生代表参加,回收有效问卷50余份。
调研内容覆盖三个维度:超算需求(含计算软件、规模、CPU核数、存储、年机时),智算需求(含大模型训练/微调/推理、GPU算力、数据存储),软件生态(覆盖47款常用科研软件的国产化适配情况)。除上述三类需求外,调研还重点关注了数据安全与经费合规两类衍生诉求。
数据收集与校验采用三级核对机制:课题组自报后由学院汇总,最终由调研组抽样比对,依次校验数据一致性,确保调研结论建立在多源交叉印证的基础上。
调研结果与需求分析
超算算力需求
调研统计,全校各类超算场景年度总算力需求约440 TFLOPS,结合学科发展规模与未来算力增长趋势,规划建设算力规模建议为500 TFLOPS级。校内超算需求排名前五的院系分属材料、生命健康、机械工程、交通工程、基础理科领域,前三者合计需求占全校超算总需求60%以上(见表1)。
超算应用场景集中于三个主要方向:材料学科的第一性原理计算与分子动力学模拟、工程领域的有限元仿真计算、生物信息方向的基因组测序数据分析。
材料学科方面,大量课题组长期依托校外超算平台开展计算,普遍反映外部算力收费高、任务排队周期长;工程领域方面,校内现有平台单任务最大分配核数不足16核,远达不到复杂仿真需求,交通工程方向重点装备研发类课题单次仿真计算需消耗近10万核时;生物信息方面,生命健康相关院系上百名科研人员年度算力消耗近90 TFLOPS,已成为校内算力消耗增长最快的应用方向之一。
智算算力需求
全校未来3~5年智算总算力需求约100 PFLOPS,规划建设规模建议120 PFLOPS级。
大模型训练与参数微调是智算需求的两大主要来源。电子信息类院系围绕多模态遥感大模型预训练、医学大模型LoRA微调、72B大模型增量训练等任务开展研究,单课题组算力需求近30 PFLOPS;交通工程类院系在自动驾驶多传感器融合仿真方向的需求约10 PFLOPS;经管类院系则将深度强化学习用于路径优化研究,并开展8B参数级别大模型微调,单方向需求也达10 PFLOPS量级。而从需求分布看,智能算力的使用场景已不限于传统理工类学科,而是逐步向人文社科领域延伸。
存储需求规模同样不容忽视:智算需求前三名院系合计约11PB,全校智算场景存储需求合计超过20PB,这对存储系统的扩展性与长期可靠性均提出了较高要求。
软件生态适配分析
本次调研对47款常用科研软件作了国产化算力适配性评估,结果显示:已源码适配30款(63.8%),适配中10款(21.3%),可转码支持7款(14.9%),整体适配率85.1%(见表2)。
从软件类别看,已完成源码适配的多为开源科研工具,涵盖生物信息学工具链(BWA、STAR、CellRanger、Seurat等)、材料计算核心(VASP、LAMMPS、GROMACS、Gaussian)、主流AI框架(PyTorch等);ANSYS、COMSOL、Matlab等主流商业仿真软件已可通过二进制转码方式在国产算力平台上运行。整体上,国产化算力平台对上述院系主要科研计算任务已形成基本支撑能力,但少数依赖特定商业软件封装格式的研究方向(如Materials Studio体系的材料建模)仍需依赖x86缓冲节点过渡,国产化替代的最后一公里尚未完全打通。
现存问题
基于本次调研的访谈记录、问卷反馈与平台运行数据,地方综合性高校在推进超算、智算一体化平台建设的实践中,集中暴露出五类共性问题。
算力供需严重失衡,科研竞争力不足
校内各院系均存在不同程度的算力缺口。超算平台CPU核数分配上限与课题实际所需的64核~512核规模存在量级差距,任务排队周期长、单次计算耗时久的问题较为突出。GPU资源供给的紧张程度更甚:电子信息类院系20名从事视觉与多模态大模型研究的教师反映,常规大模型微调任务即便设置极小批次,显存占用仍超出24G单卡上限;计算机相关方向15名教师表示,课题组常年自费租赁公有云算力,年度租赁成本从数万元到十余万元不等。长期外租算力推高了科研成本,课题因计算周期过长错失成果首发窗口的现象时有发生,算力短缺可能直接削弱学科在国内外的竞争力。
软件版权管理缺位,重复购买与盗版并存
首先,商用软件版权合规风险不容忽视。多院系存在非授权软件使用情况,易引发法律纠纷,并对论文发表与跨校国际合作形成实质性阻碍。其次,软件授权的分散采购造成经费浪费:各课题组独立采购VASP、ANSYS、Materials Studio等仿真软件授权,缺乏校级层面的统筹;与此同时,部分学院或科研团队私下购置超算或智算硬件设备,未纳入学校的统一管理,软硬件双重重复购置的现象并不鲜见。上述问题的深层次原因在于学校尚未搭建统一科研软件资产台账与共享授权管理机制,导致采购—使用—回收全链条缺乏制度约束。
运维服务体系薄弱,用户体验堪忧
调研中,各院系普遍反映现有校内计算平台在运维与用户支持方面存在较为突出的短板,集中体现在以下方面:底层操作系统版本偏旧,跨大版本升级风险高,一旦升级失败易破坏软件依赖链路并引发平台瘫痪;系统操作门槛偏高,非计算机专业师生不熟悉Linux命令行,误操作频发;远程访问稳定性不足,校外调用算力资源时常受网络链路波动影响;缺乏可视化图形操作界面,教师无法实时查看计算中间结果,调试效率偏低;配套培训与操作手册缺失,院系普遍缺少标准化的操作指引与故障处置预案。因此,硬件设施虽已到位,但配套服务能力与用户实际需求之间存在较大落差,进而拉低算力的实际使用效率。
数据安全与合规风险突出
数据安全与合规风险在多个维度同时存在。其一,科研敏感数据外泄隐患。校内算力不足时,部分课题组将涉密实验数据上传至公有云平台;与此同时,教师普遍担忧原始实验数据会被商用大模型抓取用于训练。其二,高保密横向科研项目对计算环境有严格的隔离要求。部分学院承接的工程研究项目,其试验数据仅允许本地硬盘存储、禁止网络传输,亟需独立物理隔离的专属计算环境加以支撑。其三,经费审计合规难题。课题组在校外租赁算力产生的费用,易被财务审计质疑合理性,往往需要额外出具佐证材料,无形中加重了科研人员的事务性负担。
资源调度机制缺位,分配效率低下
现有计算平台尚未建立分层分级调度策略,部分课题组占用大量资源却利用率偏低,其余课题组则长期排队等待;同时,各院系自主购置的小型服务器形成了大量碎片化算力,难以纳入统一调度。武汉科技大学目前尚未建立类似的制度安排,资源分配主要依赖行政协调,无法根据科研需求动态匹配算力供给。
具体对策
针对上述五类问题,本文提出“分期建设—分级调度—软件共享—专业运维—安全管控”五位一体的建设路径。下文逐项展开论述。
分期建设,量入为出
学校规划建设一体化算力集群,其中超算平台、智算集群及配套机房、安全、存储系统按合理比例分摊,分三期落地实施:
一期工程优先补齐传统超算缺口与当下紧迫的AI计算需求,二、三期则依据一期平台实际运行负载动态调整扩容规模。
一期部署数十台CPU计算节点、配套胖节点和管理节点,满足材料、生命科学、机械等传统仿真学科的算力需求;同步配套国产NPU智算资源与高速互联网络,支撑电子信息、交通、经管等学科开展大模型训练与微调任务。与省内同类地方高校的算力建设项目相比,部分院校仅单独建设智算或超算平台,本项目则采用超智融合的一体化方案,算力总体规模更契合多学科综合院校的长期发展需求。需要说明的是,分期建设并非简单的工程进度安排,本质上是把经费压力分散到不同财政周期、将技术风险控制在单个建设阶段内的治理策略。
构建分级资源调度体系
搭建全校统一算力资源管理中台,集成用户账号、数据存储、算力配额、实时调度模块,定期统计各课题资源利用率,将院系零散自建服务器虚拟化纳入统一算力池。落地三级分层调度机制:
A级(付费优先):科研经费充足的课题组通过校内内部结算购买专属算力配额,享受最高任务调度优先级,推行校内算力即服务运营模式;
B级(加急通道):经费有限但临近论文投稿、项目结题的课题,每季度可申请1~2次加急权限,临时提升1~3倍基础算力配额;
C级(普惠基础):给全体在校师生分配固定免费基础算力,保障课程教学、预实验、小规模探索研究需求。
该机制以分层配额为基础,以付费优先为补充,意在普惠保障与市场化激励之间形成动态平衡,提升资源供给与科研实际需求之间的匹配精度。
建设软件共享生态
第一,由校级层面统一集中采购高频商用软件的站点授权,覆盖VASP、ANSYS、COMSOL、Materials Studio、Gaussian、LAMMPS等主流仿真工具。以VASP等典型商业仿真软件站点授权为例,单个课题组独立采购的年度成本显著高于集中采购,统一集采模式较分散采购可节约半数以上经费。
第二,建立全校科研软件资产台账,实时监控各授权模块的使用频次与闲置时长,将授权闲置、刚需无授权的资源错配问题纳入台账预警。
第三,分阶段推进软件国产化适配:短期依靠x86缓冲节点兼容暂未适配的7款程序;中期完成源码层面的迁移改造;长期实现全部科研软件在纯国产算力环境下的无间断运行。
第四,搭建学科软件知识库,分领域整理5~10款核心软件的部署流程、性能调优方案、常见报错解决方案与典型计算案例,逐步降低非专业用户的使用门槛。
完善运维服务与用户支持
配齐常态化专职运维队伍是一切用户支持工作的基础。一期配套首年驻场运维服务预算约20万元,建议在二期建设前转为长期固定岗位,配置至少1~2名专职高性能计算运维工程师;同步推行学科服务联络员制度,从具备计算仿真背景的青年教师或博士后中遴选人员,对口对接2~3个院系,每月参与院系科研组会收集算力使用问题,形成“自上而下+自下而上”的双向反馈链路。
在软件环境层面,可推行容器化预制的学科专用计算镜像,采用通用基础镜像+自定义扩容的模式,分别搭建材料仿真、生物信息、工程有限元分析、AI大模型四类标准化镜像,支持师生通过Docker或Singularity自主拓展环境,降低非计算机专业师生的环境配置成本。
远程访问体验是地方高校算力平台长期被诟病的环节之一。建议在现有基础上优化远程访问体系,实现VPN全天候稳定接入、线上算力申请无纸化审批、远程图形可视化计算界面,逐步消除算力围着校园围墙转的实际体验。
在用户能力建设方面,建立分层次的培训体系,定期开展算力入门、并行计算、大模型实战等系列培训,为每个院系培育1~2名熟悉平台操作的骨干教师,形成以点带面的辐射效应。
健全数据安全与合规机制
硬件层面,设立独立物理隔离的内部超算机房,满足内部科研项目对软硬件隔离的硬性要求,整机采用“国产CPU+国产AI加速芯片”的全国产化软硬件架构,配套独立物理机房与专用内网链路,从物理层面切断与外网的非受控连接。
在数据管理层面,建立科研数据分级标签管理制度,划分“公开、内部、敏感、机密”四级数据,由系统依据数据标签自动限制高密级数据的对外传输与跨域流转,从源头杜绝涉密数据上传公有云平台的可能性。
在AI服务供给方面,推进大模型服务的校内私有化部署,一期上线千亿参数级开源大模型(多卡GPU集群),在不导出原始科研数据的前提下,满足师生AI辅助分析需求,从“数据出不去”与“算力进得来”两方面同时构建安全闭环。
在经费合规层面,完善算力外租合规凭证流程。校内算力确实无法满足需求而必须外租时,由网络信息中心统一出具校内算力资源不足证明,作为财务报销审计依据,打通科研算力采购与经费合规之间的制度通道。
结论
从需求侧看,地方综合性大学的算力需求结构已发生显著变化:传统CPU超算仍占基础地位,但以大模型训练与微调为代表的智算需求增速更快、覆盖学科更广,整体形成“超算+智算”并重的新格局。
围绕这一新格局,五类问题在调研中反复出现——算力供需失衡、软件版权管理缺位、运维服务体系薄弱、数据安全与合规风险突出、资源调度机制缺位。它们彼此关联、相互放大,单独治理任一类问题都难以根本改变现状。
对此,本文提出“分期建设—分级调度—软件共享—专业运维—安全管控”五位一体路径,力图在建设紧迫性与经费约束之间寻求平衡。这一路径强调五位一体,在于算力中心建设并非单纯的硬件投入问题,而是涉及建设时序、调度机制、软件生态、运维体系、安全合规等多个维度的系统工程:硬件投入只是入口,后续的运行组织、用户服务与生态培育才是决定平台长期效能的关键变量。本研究亦存在一定局限:调研仅覆盖一所高校,结论的普适性有待更多同类院校的样本加以验证;调研时点处于算力中心规划阶段,对策建议的实际运行效果尚需在后续实践中持续跟踪。
来源:《中国教育网络》2026年7月刊
作者:涂伟(武汉科技大学网络信息中心)