2026数博会期间,上海本原智数科技有限公司(以下简称“本原智数”)以实际的行动,强调了“数据”、“高质量数据集”在人工智能时代的重要性。8月28日,举行以“数据为本 原力智慧”为主题的“第一届本原智数生态发布会”,现场发布聚焦高质量数据集建设的“双十亿计划”:打造面向数字信息交互任务的“十亿条专家轨迹数据”和面向物理场景交互任务的“十亿小时具身操作数据”:8月29日,“本原智数”创始人兼CEO李逆勇在接受专访时再次明确,人工智能的长期竞争,不会只停留在算力和模型架构之上,真正决定智能上限的,是数据——更准确地说,是数据所承载的人类智慧、真实经验、复杂任务、专业知识与可验证反馈。
“我始终有一个观点:我们数据公司所做的事情,本质上就是把人类的知识跟经验萃取出来,投喂给AI模型。”李逆勇阐释说,我们可以把人类最精华的经验分为两种类型,第一种叫“理论知识”,掌握在教授、研究生手里;第二种叫“实践知识”,掌握在各个行业的行业专家手里,比如三甲医院的医生、知名律所的律师。具体萃取什么样的经验,取决于AI进化到了哪个阶段,比如大语言模型核心提炼的是人类语言,具身模型核心提炼的是人的肢体动作。
李逆勇曾梳理了一条清晰的“AI演进四阶段”路线图:语音模型、视频模型、自动驾驶、大模型。这一演进的方向很清晰:AI正在从“模仿感官”走向“模仿工作”;从“学知识”走向“学干活”。而干活的数据,互联网上没有现成的。
“本原智数给自己的定位是:全赛道、全生命周期的AI基础设施数据服务商。”李逆勇说,“全赛道”是指不仅服务大语言模型,还服务世界模型、具身模型等;“全生命周期”是指覆盖数据的采集、清洗、标注、合成、评测到智能体落地。
围绕这一定位,“本原智数”打造了“原测”“原识”“原智”“原物”四大数据基础设施平台。其中,“原测”平台主攻大模型、智能体能力评价与标准演进;“原识”平台主攻专家与高质量数据供给;“原智”平台主攻智能体运行与持续进化;“原物”平台则打造多技术路线的数据治理、训练和评测基础设施。这四大平台聚焦人工智能产业面临的能力难量化、数据供给不足、开发门槛高、仿真与真实场景偏差大等共性痛点,构建起“数据生产—模型训练—模型评测—持续优化”的完整产业闭环。
多年积累,“本原智数”在数据采集上沉淀了一套三梯队运营体系。李逆勇具体阐释说,底层,由科学家和各领域的专家制定规则;中层,有面向全球的12大交付网络,包括贵阳、成都在内;上层,有800万众包网络。“目前,我们已经生产了PB级别、面向不同领域和模态的高质量数据集。”他说,所谓高质量数据集,就是能够在某些细分领域高效地提升模型表现。
2025年,“本原智数”投资的贵州数策智算科技有限公司落地贵阳,主要专注于面向大语言模型的数据标注、面向具身智能的数据采集等数据服务,团队人数半年时间突破300人,并与省内10余所院校建立产教融合合作,为贵阳贵安数据标注产业快速集聚注入了鲜活动力。“贵阳是国家大数据综合试验区核心区、全国首批数据要素综合试验区(贵州)核心区,具备绿色数据中心集群和较好的综合成本优势。同时,贵阳正在形成从数据标注、AI训练到智能终端的产业链条。我们希望以贵阳为核心,把这里建设成为一个面向全球的数据生态枢纽,让更多数据企业、专业团队、专家人才和产业伙伴在这里汇聚。”李逆勇说。
记者 郑文丰