上海交通大学联合华为发布《高校AI能力中心建设指南》

旅游资讯 1 0

320 PFLOPS 自主创新智算底座、13.6 PB分层存储,支撑起一所大学的“教学—科研—管理”全面智能化。今天,这套经过真实业务验证的建设方法,被完整沉淀为一本可以向全国高校复制的指南。

在华为全联接大会 2026上,

上海交通大学网络信息中心联合华为共同发布《高校AI能力中心建设指南》

(以下简称“指南”)。

这份指南以上海交通大学“致远一号”校级智算平台的建设与运营实践为主要蓝本,把一所高校从“建算力”到“用算力”、再到“运营算力”的完整经验,系统梳理为一套标准化、可复制的体系架构、实施路径与运营规范,适用于各类高校在 AI 算力底座、模型服务、AI教学科研应用、智能校园治理等方向的规划与落地。

对高校而言,这标志着一个清晰的转变:

AI不再只是几台服务器、几个模型接口,而正在成为像图书馆、实验室一样,需要统一规划、统一建设、统一运营的新型基础设施。

人工智能正在深刻重塑高等教育的科研范式、教学模式与治理形态。几乎所有高校在起步时都会面对同一个问题:既然公有云上模型和算力触手可及,为什么还要自建?

指南给出的回答不是“替代”,而是“分工”——高校应构建“校内算力 + 云端算力”的混合架构。而自建校级 AI 能力中心的必要性,至少体现在四个方面:

数据安全与合规管控。 涉密科研项目、敏感学科数据、海量师生个人信息,依据《数据安全法》及科研保密规定,核心数据必须满足“数据不出校、链路可管控、使用可审计”。

科研创新的自主性与连续性。 大模型训练、大规模科学计算等任务周期长、负载重、不可中断。校内平台可自主制定调度策略,为重大科研项目设立专属算力通道与预留配额,支持长周期迭代与探索性试错。

人才培养与实践教学的深度适配。 公有云普遍封装底层算力架构与调度逻辑,师生只能调用上层接口,无法接触算力运维、分布式训练、性能优化的全流程。校内平台则可开放全链路实践权限,支撑集群部署、算法开发、算力调优等深度实操实验。

学科融合的定制化支撑。 校内平台可深度对接校内科研仪器、数据平台与业务系统,实现数据本地低时延流转;可按需定制编译环境、专用算法库与调度策略,为“AI+X”跨学科融合提供场景化支撑。

总体来看,校内平台承载核心敏感业务、常态化科研与教学需求,筑牢安全与自主创新底线;公有云作为弹性补充,承接非敏感的峰值需求。

2025年,上海交通大学基于昇腾建成“致远一号”校级智算平台。作为国内高校最大的校级算力平台,它的配置为:

算力:

128台 Atlas 800T A2,搭载 1024 张昇腾 910 处理器,FP16 算力约 320 PFLOPS;

存储:

OceanStor Pacific 9950全闪 + 9550 混闪构成高性能与大容量两层分级,配合云存储,总容量 13.6 PB;

通算:

101台鲲鹏CPU节点,形成5000+ vCPU通用计算池;

网络:

智算区划分业务面、参数面、设备管理面三个平面,AI服务器以 200Gbps 高速卡接入,参数面汇聚与 TOR 之间以16条 400GE 互联,构建 1:1 无阻塞高速计算网络;在架构上,高校AI能力中心遵循 “一个底座、三类服务、四大场景“的总体框架:

一个底座:

由基础设施与算力平台构成,是AI能力中心的物理与技术根基,承载算力、存储、网络资源;

三类服务:

依托底座面向全校提供算力服务(云算力、裸金属算力)、模型与 Token 服务(MaaS / TaaS)、智能体服务(智能体创新环境、Skills平台、AI工具等);

四大场景:

承载教学、科研、管理、服务等校园核心场景的应用落地。

各层之间通过标准化接口与统一调度机制紧密协同、逐层赋能。“致远一号”的定位因此不是单一的算力中心,而是校级公共 AI 能力中心:把底层资源封装为云主机、裸金属、开发训练、模型 API、实践教学和智能体等标准化服务,让不同学科使用 AI 不必先成为工程师。

硬件落成只是起点。近期,上海交通大学与华为围绕“用好算力”开展技术与场景联创,在真实业务中打磨出三项成果。

成果一:落地高校领域首个“高校 TaaS 平台”

以Agent和 Coding为主要目标使用场景,双方联合落地了高校领域首个具备“模型网关智能路由”和“多级缓存共享缓存”能力的自主创新算力TaaS(Token as a Service)平台。

之所以锚定这两个场景,是因为它们恰好代表了最典型的两类负载:Coding 业务包含多文件分析、跨模块依赖识别、长周期任务规划,对 Token 服务提出了长上下文精准处理、高并发稳定性、吞吐与成本平衡三重要求;Agent 业务则面临跨周期上下文维护、交互历史持续膨胀导致上下文窗口不断变长的问题。二者有一个共同点——如果KV Cache能够被高效复用,就能跳过大量重复的Prefill计算,显著降低响应延迟。

为此,“致远一号”基于 MemCache 构建了多级缓存与共享缓存方案:

采用 MemCache KV Cache 缓存方案,降低相同前缀的重复计算;

构建 片上内存+ DRAM 多级缓存,大幅拓展 KV Cache 容量;

基于 MemCache 实现多个推理实例接入同一个缓存池,让请求的缓存可被多实例复用。

实测数据显示:以 GLM-5.2 为例,在同样的硬件资源、同样的 TTFT 指标要求下,Token 吞吐能力上限提升至之前的 2.5 倍。

在网关侧,平台在 LiteLLM 统一网关与后端模型之间部署 Semantic Router(SR),形成“用户请求 → LiteLLM Proxy → SR → 推荐模型 → LLM 后端”的智能路由链路。应用以 model=“auto”发起请求时,SR基于关键词、Embedding 语义相似度及用户反馈识别任务类型(事实查询、编程、复杂推理、学术写作、简单任务、内容创作等),返回推荐模型,由 LiteLLM 改写模型名称并转发;显式指定模型的请求则直接调用目标模型。该机制实现了业务与模型的更有匹配,一方面提升使用体验,一方面节省推理开销。

经过业务验证,智能路由模型调度准确率达 88%,任务—模型匹配度提升 53 个百分点;通过规避“小任务”给到“大模型”,节省 32% 推理开销。

成果二:形成高校 AI4R 科研服务能力,打造“科研三件套”

依托“致远一号”的自主创新算力底座,在鲲鹏昇腾科教创新卓越中心的支持下,上海交大支撑了一批前沿科研课题,并沉淀为可复用的“科研三件套”:

一是科研垂域大模型训练。 计算机学院陈露团队的 ChemDFM化学领域大模型,使用 128 张昇腾 910 NPU构建训练环境;服务器内通过 HCCS 实现 NPU 高速互联,节点间通过 RoCEv2 完成参数交换,并采用 MindSpeed-MM 搭建端到端训练环境,完成预训练 + 后训练全流程,训练数据超千亿词元。目前致远一号已具备覆盖最新版本 ChemDFM 预训练与后训练全流程的能力。

二是自动化科研多智能体。Xcientist科研智能体的核心理念是“将科研推理外部化为可检查的研究过程”,覆盖研究整合、实验验证、报告写作全链路,并配套论文图谱基础设施——为研究整合提供领域演进知识、辅助识别研究空白,为实验验证提供合适的基线、评测基准与实现参考,把方法、基线、数据集和实验关系沉淀为可追溯的证据。目前已在天文等方向的课题中开展案例研究。

三是科研知识本体基础设施。 已沉淀80万篇CS文献,并逐步拓展至化学、生物、天文等领域,构建覆盖学术成果与领域本体的动态知识网络,为问题发现、假说生成、模型训练和智能体执行提供精准的知识锚点。

成果三:共同发布《高校AI能力中心建设指南》

把上述方案与经验系统总结,华为与上海交大共同发布本指南,涵盖基础设施建设、算力平台建设、模型与 Token 服务建设、应用场景、运营运维等关键内容。

指南共11章,覆盖总体架构、基础设施建设、算力平台建设、运维体系建设、算力服务建设、模型与 Token 服务、智能体服务、高校应用场景、运营体系建设与未来发展规划。

它不是一份“采购清单”,而是一套可以直接参考的施工图:

基础设施建设。 从业务规模、算力类型和服务目标出发,先核查机房空间与承重,再统筹制冷、供配电、消防、监测与运维。指南给出了可直接参考的量化参数。

算力平台建设。128 台 Atlas 800T A2 集群配置;OceanStor Pacific 两层存储与基于文件池策略的动态分级;结构化、模块化的三平面网络设计与 400GE/800GE 演进预留;按“一个中心、三层防护”构建的等保安全体系,覆盖通信网络、区域边界、计算环境与管理中心。

运维体系建设。 采用 Exporter + Prometheus + Grafana 的统一可观测性方案,形成从“用户访问、网关转发、模型推理、算力资源”的全链路观测能力;面向用户侧提供公开的使用量统计面板,把“算力用了多少、模型好不好用、谁在用”变为一眼可见;组织上采用“校方统一管理、驻场一线处置、厂商二三线升级、应用团队协同验证”的模式,并建立从发现登记到复盘改进的七步故障闭环。

服务与运营。 云平台服务与裸金属服务的定位边界、申请开通、访问控制与回收机制;模型上线前的准入测试标准;面向教学、管理、科研三类场景的差异化API供给与额度管理。

指南用法:

先查问题。 指南开篇即提供一张“实践速查指南”表,把高校最常问的九类问题——要建多大规模、为什么不能只租云、基础设施怎么配、设备怎么选型、怎么运维、怎么提供服务、模型怎么接入和统一管理、有哪些真正落地的场景、怎样帮助师生快速上手——直接映射到对应章节。

再定阶段。 结合自身所处阶段(新建、扩容、优化提升)针对性参考相应章节。

后做替换。 以“致远一号”的实践为参考,结合本校场地条件、经费规模、学科结构、算力类型等,形成自己的建设方案。

指南最后给出了高校 AI 能力中心的演进方向。总体而言,AI 将不再是少数课题组的“尖端设备”,而会像水电一样,成为高校的基础设施与基本服务。

其一,高校 AI 科研基础设施。 以“科研三件套”为核心持续构建:科研知识本体基础设施,构建覆盖全球学术成果、实验数据、专利标准与领域本体的动态知识网络,从“存储库”走向“思考引擎”;科研模型训练平台,发展为面向全学科开放的通用算力基座,融合自动调参、分布式并行策略与异常自愈机制;自动化科研智能体平台,成为覆盖科研全生命周期的“超级助手”,让科研人员只需提出高阶研究目标,即可完成文献调研、方案设计、数据采集与清洗、模型迭代乃至论文草稿撰写。三者协同联动,推动科研从“单兵作战”转向“人机协同、群体智能”。

其二,高校智能体开发平台。 面向全校师生提供统一的开发入口,兼顾低代码配置与专业代码开发,覆盖智能体从开发、调试、测试到部署、上线和运维的完整过程;与“致远一号”大模型服务便捷连接,把模型调用、身份认证、访问授权和资源配额封装为统一服务;成熟应用经审核后发布至校内智能体应用目录。对涉及成绩、科研数据、经费、人事和业务审批的操作,保留明确的权限控制与人工确认机制。

其三,精细化运营。 从“统一供给”走向“按需配置”:教学场景以课程为服务单元配置独立 API Key、调用额度与有效期;管理场景以学院或部门的具体应用为单元统一登记;科研场景以项目为单元单独评估。平台根据用户规模、调用并发、服务周期和业务重要程度核定额度并动态调整,推动模型与算力资源由统一供给向精细化、差异化服务转变。

从“交我算”十四年的平台演进,到“致远一号”的自主创新千卡智算底座,再到今天这份面向全国高校的《高校AI能力中心建设指南》,上海交通大学与华为的合作走出了一条“共建—联创—共享”的路径。AI能力中心,不只有AI算力,还有赋能团队,还有生态共建。

面向未来,双方将持续完善 AI 能力中心建设,夯实智算底座,推动 AI 全面融入教学、科研与管理,以人工智能赋能高等教育综合改革;也期待与更多高校、产业伙伴和开发者一道,共筑开放协同、持续演进的 AI 创新体系,让 AI 真正成为每一所大学触手可及的基础设施与基本服务。