近日,arXiv 上悄然挂出了一篇来自上海人工智能实验室与上海交通大学人工智能学院 LUMIA Lab 团队联合撰写的技术报告——《NCP-ArchPreview Tech Report》。没有什么铺天盖地的宣发,这篇论文却在短短几天内自发引爆了开源与极客社区:一举登顶 HuggingFace Daily Papers 榜首,HuggingPapers 官方及海外多位知名科技博主纷纷转发剖析;海外科技评论人VISION IA更是在 X 上给出了极高评价:“这篇论文很可能构成了未来 AI 的第一块基石(might constitute the first brick of the future of AI...)”。
让全球研究者如此兴奋的原因极其纯粹:他们打破了纯 Next-Token Prediction(NTP)的单一教条,在大规模预训练中直接引入“下一个概念预测(Next Concept Prediction, NCP)”这一全新的预训练任务,跑通了全球首个 8.9B 规模的离散隐空间基座模型,在Dolmo-3的 5.73T 大规模开源语料预训练中,仅消耗 51.3% 的 Token 预算就追平了 OLMo-3-7B 的最终预训练 Loss,等效收敛速度狂飙 1.95 倍! 与此同时,GSM8K 推理暴涨近 6 个点,更附带了“17M 参数零遗忘微调”、“推测解码免费加速”等一系列意想不到的外溢红利。目前,团队已将包含数十个训练阶段 Checkpoint 在内的全部资产彻底开源。
在视觉生成领域,从像素空间走向隐空间(Latent Space)的 Latent Diffusion 彻底改写了文生图的效率格局;在视频与具身智能领域,LeCun 力推的 JEPA 架构也在证明预测高维表征远优于重建底层细节。但在大语言模型(LLM)的世界里,大家似乎习惯了“逐词预测”的自回归范式。即使是当下大火的多Token预测(Multi-Token Prediction, MTP),其损失函数依然被牢牢绑定在浅层表面的 Token 上。语言模型内部明明已经自发形成了丰富的语义抽象与世界表征,我们为什么不能直接在隐空间中对其显式监督,让模型学会更高层级的“概念规划”
针对这一长期痛点,研究团队交出了一份惊艳的答卷:NCP-ArchPreview。
一、 51.3% Token 追平收敛!万亿规模下的效率神话
在以往的研究中,许多非标准 Transformer 架构往往只能在玩具级数据(Toy Dataset)或几百兆参数的小模型上自娱自乐,一旦推向 Trillion 级别的大规模真实预训练,常常遭遇 scaling 失效或训练崩溃。
但 NCP-ArchPreview 直接把实验做到了8.94B参数,并基于严格对齐完全开源的 5.73T Dolma-3 语料展开了全周期的工业级预训练。
对比开源界最具说服力的基准之一 OLMo-3-7B,其实验曲线呈现出令人咋舌的效率优势:
1.预训练收敛速度翻倍:在第一阶段(Stage-1)的 5.73T 训练中,NCP-ArchPreview仅用了 51.3% 的 Token 预算,就追平了 OLMo-3-7B 跑完全程才达到的最终预训练 Loss,等效收敛速度提升达 1.95 倍;最终收敛 Loss 比官方基线足足低了。在 Stage-2 退火阶段,其收敛速度同样达到基线的 1.51 倍。
2.计算 Pareto 前沿大幅外扩:团队进行了严格的 “算力对齐(Computation-aligned)”与“尺寸对齐(Size-aligned)”的消融实验。由于概念模块的序列长度被大幅压缩,NCP-ArchPreview 在仅消耗 40 层 Transformer 基线 85% 算力的情况下,逼近了后者的训练 Loss;在不同算力预算下的 Scaling Law 拟合表明,其计算帕累托效率带来了1.74 倍的系统性提升
更重要的是,更低的困惑度直接转化为了下游任务的全面领先:
二、 拆解 NCP 架构:
让模型学会“边想大纲,边抠字眼”
能够取得如此大幅度的效率跃升,NCP-ArchPreview 究竟在架构上动了什么底层手术?
团队在经典 Transformer 骨干中巧妙植入了一个“三段式”的隐空间概念处理流水线(Token Encoder → Concept Module → Token Decoder),配合乘积量化(Product Quantization, PQ)与分层残差路由机制,实现了显式的未来概念建模:
1. 概念提炼与乘积量化码本(VQ Codebook)
模型并非在无边界的连续向量空间里任意漫游,而是构建了一个结构化的离散概念词表:
2. 可微的下一个概念预测(NCP)
中间由 8 层 Transformer 组成的 Concept Module 负责自回归地预测“下一个概念”。
3. 严格的因果防泄漏反馈机制
预测出的未来概念并不是游离在外的辅助信号,它会被重复扩展回 Token 分辨率,并在时间轴上施加因果位移(Causal Shift Δ=k=4),残差融合进顶层 16 层的 Token Decoder 中。
这种因果位移保证了 Token Decoder 在解码第 t 个词时,能够合法地参考先验的“宏观概念方向”,而绝不会发生未来 Token 信息的泄露穿越。
4. 破除瓶颈的分层残差路由(IRC + CRC)
为了让底层 Token 细节与高层宏观概念顺畅互通,研究团队借鉴 MUDDFormer 设计了分层残差连接:
消融实验证实,仅需多引入 0.051% 的极微计算量,IRC+CRC 就能带来 0.0323 的系统性 Loss 下降。
三、 隐空间的额外彩蛋:
参数高效微调与推测解码“双丰收”
如果说大幅缩减预训练 Token 是 NCP 架构的“本分”,那么它在下游任务中展现出来的外溢收益,则完全称得上是意料之外的“巨大红利”:
彩蛋 1:仅微调 17M 隐空间参数,击败 LoRA 还不发生遗忘!
在下游领域微调中,全参数微调代价高昂且极易导致灾难性遗忘,而常规 LoRA 往往也会在通用基准上造成掉点。
由于 NCP-ArchPreview 拥有一套独立的离散概念码本,团队提出了一种前所未有的微调界面:完全冻结 8.9B 的骨干网络,仅仅微调其 VQ 码本和概念预测头(仅约 1700 万参数,+VQ 模式)。
评测结果令人瞩目:
在大模型推理加速领域,块级并行草稿模型(如 DFlash2)往往因为难以维持长距离的多步预测轨迹而限制了接受长度。
团队尝试将 NCP-ArchPreview 生成的 Chunk 级概念表征直接注入到 DFlash2 草稿模型中。整个过程仅仅为 1.1B 的草稿模型增加了 0.04M(约 4 万)参数,没有给 Target 模型带来任何额外计算,却让整体的平均接受长度(Mean Accepted Length, MAL)相对提升了 4.17%,在 HumanEval 代码任务上更是暴增+7.59%
这证明:隐空间学到的不仅是抽象特征,更是极具前瞻性的宏观逻辑规划,能够直接赋能推理加速。
四、 极其坦诚的技术洞见:踩坑与开源实践
在长达 40 余页的技术报告中,这篇工作展现出令人钦佩的严谨与工程透明度:
结语
在全行业算力逼近极限、单纯堆叠数据与参数的边际效益日益递减的当下,NCP-ArchPreview 用扎实的万亿 Token 实验证明:我们依然可以在自回归架构的根本机制上做文章。
从纯粹被动的微观 Token 模仿,转向具有宏观自顶向下指导意义的“隐空间概念预测”,不仅大幅拓宽了基础模型的训练效率上限,更为模型微调、长序列扩展乃至端到端系统加速开辟了一座全新的富矿。