9月11日,Hugging Face上悄悄出现一个新仓库。没有发布会,没有预告,连官方博客都没写,直接挂了1.5TB的模型权重上去。
我叫AI蟑螂小强,是个正在做AI小程序的开发者。刷到这个叫Atria Dawn Preview的模型时,我头一个反应是又一个套壳炒作。点进去看了三天资料,README、技术报告、第三方拆解文章都翻了一遍,发现事情比我想的有意思。
这是上海人工智能实验室出的新一代智能体大模型。注意,官方给它的定位是智能体模型,对话机器人。
技术底子:744B参数的MoE架构,基座是GLM-5.2,256K上下文,MIT许可,商用不限制。权重在Hugging Face和ModelScope都能下,有BF16和FP8两个版本。
有几个数字值得单独拎出来说。
BF16版本完整权重约1.5TB,364个分片文件。FP8量化版约756GB。我算了下自己硬盘,看看就得了,这两个体积都跟我没有关系。
还有一个细节,第三方技术博客扒出来的:模型卡上写744B,但Hugging Face的配置文件里写的参数量是753B。同一个模型两种口径,大概率是不同精度下的四舍五入。这种小事官方没解释,我记下来当个观察点。
上下文也有类似情况。官方宣传256K,配置文件里max_position_embeddings写的是1048576。也就是说架构上限是1M,256K是官方实测过的窗口。你要自己部署硬往上顶,出了问题官方不背锅。
官方给了一张16项基准的对照表,对手是DeepSeek V4 Pro、KIMI K3、Qwen 3.8 Max、GLM 5.3、GPT 5.6 sol和Claude Opus 5。
赢的五项集中在智能体任务上。AutomationBench拿了53.8,同表其他选手的分数在41.7到49.7之间。BrowseComp 92.5,CyberGym 86.5,DeepSearchQA 96.0,BFCL v4 77.0。方向很明确,深度搜索、工具调用、长程任务执行是强项。
短板也写在同一张表上。SWE-bench Pro只有59.6,Claude Opus 5是74.7。Terminal-Bench 2.1拿78.3,Qwen 3.8 Max是89.3。简单说,科研探索类任务它强,工程交付类任务它弱。
这里必须泼两盆冷水。头一盆,这张表是厂商自报口径,到发稿为止还没有中立实验室复现。第二盆,官方自己在报告里写了,那些演示是挑出来的案例,不能当平均成功率看。
不过我反而对这份表多了几分信任。把自己的弱项原样印在官方材料里,这份坦然在厂商发布会里见得不多。
光看分数没什么体感,官方放出来的演示更直接。
头一个案例是天气预报。官方把模型的网络搜索关掉,扔给它超过100GB的全球气象数据,它自己设计了一个4亿参数的ViT网络,训练45000步,建了一套能学习69个气象变量演化规律的预报系统。按官方说法,这套系统1分钟内能预测未来一周的全球天气,部分指标比英伟达的经典预报模型FourCastNet还要好。
第二个案例更狠:给它一个空工作区,大约20分钟,它从零搭出一个带串口Shell、磁盘访问、持久化文件系统和解释器的MiniOS,还跑了两次QEMU会话验证重启后状态没丢。
还有把《红楼梦》里的大观园复刻成可漫游的三维场景这种活,属于展示性质的表演项目,看看就好。
这一段我照例要打个补丁:演示是官方挑出来的亮点案例,不代表日常任务的成功率,报告原文自己也写了这条声明。
9月14日,论文挂上arXiv,185位作者。跟论文一起放出来的,还有一份真实研发记录的复盘:56名参与者,769条任务记录,逐条标注哪些活是人干的、哪些是AI干的。
几个数据我反复看了几遍。
明确记录AI使用情况的739项任务里,713项用到了AI,占96.5%。也就是说,这个模型的研发流程里,AI已经是默认工具了。
AI提出了64.6%的技术方案,但拍板做主的85.5%是人。AI自己拍板的只占9.2%。换成目标或范围类决策,人拍板的比例升到93.4%。
还有个趋势数据:同一批22个人的固定队列里,每条人类提示引出的智能体行动数,一个月内中位数从11.0涨到28.5。人下一条指令,AI连着干二十多个动作,这个委派强度一个月涨了近两倍。
卡住了谁来救?588项记录了关键困难的任务里,人介入后继续推进的占76%,AI自行恢复的占23%。但人介入时干的事很有意思:35.2%是补充背景或澄清需求,34.7%是诊断问题或调整方法,真正动手改内容的只占3.2%。
这份账本给普通开发者提了个醒。人改变AI知道什么,比改变由谁来做,价值大约是后者的18倍。你与其抢着替AI写代码,不如把需求说清楚、把上下文喂足。
路径一,本地部署。先把丑话说前面:FP8版本建议8张H200级别的卡,BF16建议8张B300或者上多节点。部署文档倒是给得很全,vLLM要0.23.0以上,SGLang要0.5.13.post1以上,命令直接抄就行。
路径二,在线API。官方提供了OpenAI和Anthropic兼容的接口,国内国外都有入口,注册就能调。文档页目前没公布价格,这一点需要注意。
我自己更好奇的是接进Codex和Claude Code的玩法。官方README里直接给了配置,但里面藏着一个坑,值得展开讲讲。
Atria Dawn只接受纯文本输入。Codex默认认为所有模型都支持多模态,会尝试附加图片,结果就是你收到一个400错误,提示它不是多模态模型。官方的解法是写一个模型目录JSON文件,在里面声明input_modalities只含text,Codex就会在客户端直接把图片输入剥掉。Claude Code那边更直接,官方给了一段PreToolUse钩子代码,把Read工具读PDF和图片的请求全部拦截。
说实话,一段接入文档里放一个拦截图片的Python钩子,这件事本身就说明了它的定位。它是给你派活的工人,你递给它的东西必须是文字。
这个模型的看点排序,我个人是这么排的。
头一位是那份人机分工账本,真实数据比跑分有参考价值。第二位是MIT许可加全量开源,756GB起步的诚意摆在那。第三位才是跑分本身,而且要等第三方复现。
对大多数读者,我的建议是:别急着部署,先用官方API试试它的深度研究和工具调用能力,观察它跟你现在用的编程助手的差别。等第三方评测出来,再决定要不要认真跟进。
名字里带Preview,说明后面大概率还有正式版,现在入坑观察正合适。
你们觉得这种科研向的智能体模型,会改变你现在的开发工作流吗?评论区聊聊。