高校算力建设普遍面临资源分散、多主体管理、跨校区调度困难等结构性难题。北京师范大学以“京师智联”平台为抓手,通过500M专线实现两校区一张网互联互通,将分散于北京与珠海的算力资源纳入统一算力池。
在此基础上,平台以统一模型接口封装底层模型迭代,以“数智业务共生”理念将智能能力嵌入而非替代现有业务系统。其经验表明,跨校区算力协同的关键不在设备互联,而在于统一架构、制度设计与应用生态的同步推进。
近年来,以大语言模型(LLM)为代表的基础模型技术取得了突破性进展,其规模从数亿参数迅速跃升至数千亿参数,推理服务的算力需求也随之指数级增长。与此同时,高校人工智能应用场景持续拓展,覆盖智能助教、个性化学习支持、科研数据分析、文献综述自动化生成、校园治理智能化等多元领域,不同场景的算力需求特征存在显著差异,对算力资源的动态调度与精细化管理提出了更高挑战。
然而,长期形成的多主体分散管理格局与新型算力需求之间存在深刻的结构性矛盾。北京师范大学的算力资源配置现状具有典型代表性:算力资源分散于多个管理主体,多校区之间缺乏统一的调度机制,资源紧张与闲置并存的问题长期存在。
本文将系统梳理高校算力统筹面临的多重挑战,重点介绍北师大以“京师智联”平台为抓手的统筹实践,并对其运行经验与后续发展路径进行深入分析。
高校算力统筹面临的挑战
1.规模增长与分布失衡的矛盾
当前高校人工智能应用的算力需求增速已显著超出传统信息化基础设施的扩容节奏,且呈现出规模持续扩张与需求分布高度不均衡并存的特征。
首先是高校对算力的需求呈现爆发式增长。从当前高校主流部署的开源大语言模型来看,700亿参数规模的模型在FP16精度下进行全量推理,需占用约140GB显存,折合2~3张NVIDIA A800 80GB GPU卡,若同时支持数百并发用户访问,则需要数十张GPU卡协同工作。
另一方面,高校AI应用需求在时序上呈现明显的节律性波峰——学期初、考试周、论文提交截止日前后,智能助教与学术辅助类应用的访问量往往出现数倍于日常的峰值,而科研计算需求则在项目申报和成果冲刺阶段集中爆发。这种强烈的周期性峰谷特征,导致按峰值规模配置硬件的传统思路极为低效,而如何按需弹性调度恰恰是高校算力建设长期缺失的关键能力。
高校AI算力需求按类型可分为三类:一是面向全校师生的公共服务推理算力,要求低延迟、高并发、持续在线;二是面向科研团队的训练与微调算力,单次任务算力规模大、需支持多机多卡分布式训练,对延迟不敏感但对吞吐量要求极高;三是面向各学院业务部门的应用开发算力,需求规模相对较小但种类繁多。三类需求的资源特征差异显著,对统一调度系统提出了在同一硬件基座上兼容多类型服务的核心要求。
2.碎片化建设的结构性矛盾
北师大算力资源供给侧面临的结构性矛盾,是国内高校普遍困境的典型写照。
首先,算力由多主体分散管理,形成“算力孤岛”。学校超算资源由分析测试中心负责建设与运营,资源结构以CPU为主,仅配置少量GPU资源,且近年来未有新增算力投入,已无法适配以GPU为核心计算单元的人工智能应用需求。公共服务类算力资源则由信息网络中心统筹管理,仅持有数十张GPU卡。
珠海校区则于2022年底建成交叉智能超算中心并完成新一代超算设备部署,配置了规模化GPU资源,是全校当前规模最大的智能算力存量。但上述三大算力主体在管理权属、运营机制、使用规则层面相互独立,跨主体算力调度在制度层面与技术层面均不具备可行条件。
其次是重复建设与闲置并存,资源浪费严重。由于缺乏统一的算力供给平台,各学院在开展AI应用建设时,往往倾向于自行采购小规模GPU服务器,形成一个应用一张GPU卡的碎片化部署模式。
这一模式导致了双重浪费:其一,各学院自建算力在低负载时段大量闲置,综合利用率普遍偏低;其二,当某一学院需要更大规模算力时,无法借用相邻学院的闲置资源,只能继续扩购,进一步加剧了碎片化。这种“同时存在算力紧张和算力闲置”的悖论,反映出统筹调度机制缺失的根本问题。
再次是技术标准不统一,互联互通难度高。历史上各单位自主采购的算力设备在型号、网络接口、存储架构等方面缺乏统一标准,跨设备的分布式训练任务难以实施,数据的跨平台流转也面临技术壁垒。尤其是两校区之间的物理距离使算力协同调度对网络基础设施提出了更高要求,在一张网互联互通能力建立之前,跨校区算力统筹在技术上几乎无法实现。
最后,算力与“十五五”发展目标之间存在显著缺口。根据学校“十五五”规划,北师大智能算力需从当前的21PFLOPS提升至120PFLOPS。这一目标仅凭新增采购难以在规划周期内实现,但若通过统筹方式将珠海校区的现有算力资源纳入统一管理体系,则有望使学校总算力规模达到130PFLOPS,并提前完成目标。这充分说明,统筹而非新购同样是破解算力缺口的重要路径。
3.制度规范与可持续运营的深层难题
除需求与供给两方的结构性矛盾外,算力统筹的实现还需要跨越制度层面的多重障碍。
算力统筹本质上是一项涉及多个管理主体利益的组织变革,需突破各单位长期形成的独立运营惯例。如何在明确信息化部门作为统筹主责单位的同时,妥善处理与校内相关管理机构之间的职责边界,是推进算力统筹的首要行政挑战。
同时,算力平台的建设与运维成本高昂,若完全由学校财政补贴,难以保证资源的持续更新迭代。若引入收费机制,则需要设计合理的定价体系和计量计费技术,同时兼顾各学院的财务负担与使用积极性。如何建立既能覆盖运营成本、又能激励高效使用的算力收费制度,是算力平台可持续发展的关键制度命题。
“京师智联”平台的算力统筹核心实践
1.建设思路与总体架构
面对上述多重挑战,北京师范大学信息化建设办公室/信息网络中心以“京师智联”平台为核心抓手,确立了“统一架构、两区协同、分层服务、公共优先”的算力统筹建设思路,系统推进学校算力资源的集约化整合与高效化利用。
“京师智联”平台采用“算力底座—模型与数据中台—上层智能体应用”三级架构,在技术层面构建起统一的算力资源调度框架。北京与珠海两校区之间建有500M专线,可实现毫秒级数据传输,基本达成一张网互联互通。
“京师智联”平台充分利用这一基础设施条件,统筹两校区GPU算力资源。目前,平台已接入北京校区GPU卡,并纳管珠海校区部分GPU卡,将五十余张GPU卡形成统一的算力资源池,实现了跨地域的精准调度和高效利用。
平台建立了明确的服务优先级体系,将算力资源的服务对象分为公共服务、科研计算与应用开发三个层次,并以差异化的算力保障策略满足不同类型的需求。公共服务算力享有最高优先级,确保面向全校师生的AI应用在任何时段均能获得稳定支撑。科研计算按优先级排队调度,支持大规模分布式训练任务。应用开发资源通过多租户机制按需分配,实现资源的精细化管理。
在算力统筹的基础之上,平台进一步确立了“数智业务共生”的赋能理念:智能化应用并非替代原有业务系统,而是以嵌入方式深度融入现存业务生态,保护学校历年信息化建设的历史投资,使师生无需切换系统即可享受AI智能服务。具体而言,平台提供两种深度赋能模式:数据共享型和API接口型。
数据共享型模式中,业务系统将数据全面共享给平台,平台利用数据直接构建知识库与智能体,实现深度融合,适用于“京师大福”、“师小财”、巡视问答等场景。API接口型模式中,业务系统若因隐私或合规原因不便提供原始数据,在问答时可通过API实时传入数据,原始数据不离开业务系统,兼顾数据安全与智能体验,适用于师生信息查询、假期去向分析等涉及敏感数据的场景。
2.技术实现路径
“京师智联”平台采用解耦式中台架构,将模型能力、工具编排、业务系统、安全模块完全解耦,支持多模型、多技术、多组件的自由接入与替换。中台不绑定任何单一模型,目前已本地化部署DeepSeek、Qwen、GLM等多种大模型,无需重构架构即可完成模型的迭代、新增与下线,契合高校场景下模型快速迭代的现实需求。
同时,平台遵循标准化接口、模块可插拔且可替换的核心理念,自研能力与成熟第三方技术通过标准接口自由拼装,避免重复造轮子。整个平台不绑定任何特定模块,具备较强的生态开放性与长期演进能力,为后续接入更多前沿模型与自研模型预留充足空间。
平台开创性推出统一“木铎”大模型接口的封装式服务,将底层模型与服务商API完全封装,对外提供标准化统一接口,对内集中管理多服务商密钥、统一核算各模型用额与成本,并内置用户管理与额度控制系统。
这一设计的核心价值在于:用户无需变更任何接口,平台后台即可自由升级、替换、迭代模型,实现零感知、零成本、无迁移的模型升级,从根本上解决了高校传统模型服务“直接对外暴露模型和版本号”的痛点。传统模式下,模型每次升级都需要业务系统同步改造,多服务商API格式不统一导致二次分发困难,运维与迁移成本高昂。而统一封装后,模型迭代与业务系统彻底解耦,大幅降低了校园场景下大模型应用的运维与升级成本。
此外,平台集成了MCP(Model Context Protocol)功能,支持智能体动态调用外部工具与数据源,显著扩展了智能体的能力边界,为复杂业务场景的智能处理提供了标准化技术基础。平台同时采用流式输出技术,所有问答结果均标注知识来源,实现答案可溯源,有效提升了用户对AI生成内容的信任度。
平台依据用户类型与需求优先级,实行多层次的算力保障策略:对国家级重大科研项目、重点学科建设任务给予最高优先级支持;对日常教学和一般性科研项目按公平原则分配基础算力配额;对校外合作和社会服务类需求,在优先满足校内需求的前提下合理开放,实现算力社会价值的最大化。
平台建立了实时监控与动态评估体系,对闲置超过设定时长的算力资源实施自动回收与再分配,防止算力被长期占用但低效使用。推行算力使用预约制度,用户需提前提交算力申请与项目方案,经审核后合理分配,避免资源的无序占用。
硬件投入只是入口,后续的运行组织、用户服务与生态培育才是决定平台长期效能的关键变量。
3.核心应用的落地成效
目前,北京师范大学大模型算力平台已统筹管理GPU算力卡五十余张,并已纳管部分珠海校区的算力卡。算力平台累计提供服务调用1529万次,输出Tokens规模达数百亿。累计开发落地智能体应用29个,搭建专业领域知识库50个,已完成与校内10个单位的对接服务,对接范围覆盖教务部、学工部、财经处、审计处、巡视办、社会发展学院、地理学部等多个行政部门与教学科研单位,可为校内各类场景的人工智能应用提供稳定算力与模型支持。
应用方面,“京师大福”AI助手面向全校提供信息查询、学术支持等高频服务,本地化部署保障数据安全,上线以来自动检索超2.5万次,已迭代至2.0版实现服务闭环。课程中心智能助教覆盖1万余门课程,实现“一课一人一助教”,服务超10万人次。“师小财”财务智能问答则联合财经处打造的财务专项智能问答系统,基于学校财务制度、报销流程等专业知识库,为全校教职工提供7×24小时财务政策咨询与报销指引服务,大幅减轻了财务部门的人工咨询压力,是数据共享型模式的又一典型落地案例。上述应用验证了统一算力平台在公共服务、教学、管理及内部监督等场景下的可行性与安全性。
4.经验借鉴与发展展望
回顾北师大算力统筹的探索历程,以下几点规律性认识值得关注:
统一架构是统筹的前提,而非结果。只有先建立技术层面的统一调度框架,才能在此基础上逐步将分散的算力资源纳管进来。“京师智联”平台的建设经验表明,容器化的调度架构为异构算力的统一管理提供了成熟的技术基础。
公共服务优先是可持续发展的锚点。通过优先保障全校师生的基本AI使用需求,可形成覆盖面广、有目共睹的服务成效,为算力统筹争取更广泛的制度支持与资源保障。北师大的实践表明,智能助教等公共服务应用的良好运行,有效增强了学校对算力统筹建设投入的信心与意愿。
制度设计与技术建设必须同步推进。算力统筹的成功不仅取决于技术平台的性能,更取决于围绕平台建立的制度体系是否合理。计量计费制度、算力分配规则、使用行为规范等制度安排,与平台技术能力同等重要,必须在建设初期就进行系统性设计,而非等平台上线后再补救。
结论
人工智能大模型时代对高校算力基础设施提出的挑战,是一个技术问题、管理问题与制度问题相互交织的系统性命题。
本文阐述了以统一架构整合跨校区算力、以公共服务优先确立资源分配基准、以模型底座共享终结烟囱式部署、以“数智业务共生”理念赋能业务系统、以“智能化嵌入”取代“智能化替代”的系统性应对路径。
展望未来,高校信息化管理部门应将算力统筹和智能应用统一建设视为一项长期系统工程,在技术能力、制度设计与生态培育三个维度持续深耕,将有限的算力资源转化为支撑学校核心竞争力提升的战略性基础设施。
来源:《中国教育网络》2026年7月刊
作者:孙秋瑞、鲁学亮、杨栋、别荣芳(北京师范大学信息化建设办公室)