9月20日,上海大模型企业阶跃星辰发布新一代旗舰基座模型Step 5 Preview(简称新版基座模型)。目前,模型已全面开放第三方接口,并将于10月15日全面开源完整权重。
在全球权威榜单AA综合智能指数(Artificial Analysis Intelligence Index)中,阶跃新版基座模型取得44分,位居全球开源模型前三,但单任务成本仅为美国旗舰模型的八分之一。
“帕累托边界”再进一步
据介绍,阶跃新版基座模型依然采用稀疏混合专家(MoE)架构,总参数量6000亿,每个词元实际激活的参数仅270亿,支持100万词元的上下文窗口,原生支持文本与视觉输入,重点面向AI编程、软件工程、专业知识工作和金融等场景。
混合专家架构可以理解为一支“专家团队”,虽然总参数有6000亿,但每次处理任务却只调用其中约4.5%的参数,既容纳了庞大的参数储备,又把单次推理的算力开销压了下来。
相较于上万亿参数级的旗舰模型,阶跃新版基座模型总参数仅为三分之一,单次参与推理的参数则更小。
小参数不等于能力低。榜单显示,在软件工程评测上,阶跃新版基座模型得分67.7,领先月之暗面Kimi K3、智谱GLM-5.3等开源模型,仅次于美国两大旗舰基座模型GPT-6 Astra和Claude Opus 5两款闭源旗舰。
新基座模型把帕累托边界线往外拓展。
目前,大模型仍受“规模法则”的制约,通常来说能力越强,算力成本越高,业内通常用“帕累托边界”来描述:在帕累托边界线上,提升一分智能就需要多付一份成本。而阶跃星辰表示新版基座模型正在把帕累托边界线往外拓展,“相当于同样的成本,智能更高;同样的智能,成本更低。”
AA综合智能指数显示,阶跃新版基座模型每完成一项智能指数任务的成本约为0.71美元,输入、输出价格分别为每百万词元1美元和2.7美元,输出速度约为每秒100个词元。官方测算,在智能水平相当的情况下,单任务成本约为美国Claude Opus 5的八分之一。
另外,在跨领域深度研究、智能体考试的命令行子集等多项行业测评中,阶跃新版基座模型表现与美国两大旗舰模型难分伯仲。
新版基座模型在多个国际榜单上取得好成绩。
金融是超长任务“试金石”
在训练新款基座模型过程中,阶跃星辰把金融列为重点验证场景。
外部基准“前沿金融”(FrontierFinance)包含了220道专业金融问题、11543项评估标准,覆盖六类投资应用场景。测评结果显示,阶跃新版基座模型得分66.4,领先GPT-6 Astra及其他参评开源模型,位列全球第二。
围绕“公司研究”这一高难度金融工作流,阶跃星辰还自建了三项内部评测,分别考察模型检索核验实时金融信息、把数据和假设转化为可复现的估值,以及产出完整研究报告的能力。在上述四项金融基准上,阶跃新版基座模型均取得开源模型中的领先成绩。
“金融同时连接宏观经济、政策监管、行业周期与公司经营,既要求财报分析、估值建模等专业知识,也考验跨行业理解、证据核验和复杂问题拆解能力,是对模型综合能力的真实检验。”阶跃星辰研发团队负责人表示。
金融场景的能力,是大模型在超长任务链、超长上下文和调用工具等方面的缩影之一。
据介绍,阶跃星辰专门构建了覆盖553个独立代码仓库、9类任务、20个应用领域和33种编程语言的“阶跃代码工作台”,包含漏洞修复、功能开发、代码重构、环境配置等任务。在内外部专家评估中,约七成参与者认为,新版旗舰模型能自主解决中高复杂度的编程任务。
阶跃星辰专门构建了“代码工作台”。
记者在技术文档中看到,阶跃新版基座模型在一个硬件改造案例中,可连续运行3个多小时,自主查阅开发文档,把一块物联网开发板改造成支持蓝牙按键和语音输入的键盘。
连续三代追求“以小博大”
值得注意的是,阶跃星辰从Step 3.5 Flash、Step 3.7 Flash到此次的Step 5 Preview,连续三代基座模型都在追求“更小算力博得更大性能”。
近3个月以来,阶跃相继推出端侧模型和语音模型。端侧模型把文本、视觉基础模型与语音、图形用户界面相结合,支持简单任务在端侧算力完成,复杂任务交由云端算力。语音模型则在对话动态、语音推理测试中均拿下全球前列的好名次。
无论是新版基座模型、端侧模型还是语音模型,都是服务于阶跃星辰的“模型+终端”策略。
比如,阶跃模型手机装机量已超过4200万台,日均服务近2000万人次,合作覆盖国内超过半数头部手机品牌,应用于识屏问答、智能搜索、内容生成和跨应用任务执行,这背后离不开阶跃端侧模型的能力提升。
另外,吉利银河M9接入阶跃端到端语音大模型,阶跃星辰与吉利、千里科技共同研发的整车智能体“超级Eva”也量产上车,背后也有阶跃语音模型的身影。
阶跃星辰研发团队负责人表示,过去大模型“规模法则”的逻辑,是用更多计算换取更强智能。但随着模型规模和任务复杂度同步增长,算力成本被急剧上升。下一阶段“规模法则”不只是更多计算,也包括更高效率的计算。
在万亿参数超大模型的趋势下,阶跃新版基座模型能否凭借“小参数高性能”,重回全球第一梯队,还要等待10月15日全面开源后的实测检验。
栏目主编:李晔