
真机演示视频直观展现机器人多样化实操能力:居家环境中,机器人能够独立完成煮面、调制饮品、日常收纳等任务;面向工业产线,流水线装配、精密小件组装、线缆梳理缠绕等高难度精细作业同样稳定完成。强劲的实操表现,依托新智具身全新N₀系列模型。
长期观察机器人落地场景不难发现典型痛点:不少机器人视觉识别精准无误,但一旦产生实物接触交互,失误频频发生。插头反复对位始终无法顺利插接、抓取容器力度失控造成壳体形变、折叠完成的织物松开后立即散落。在具身智能商业化落地过程中,这种 “视觉判断准确,物理交互失效” 的现象十分普遍。
大量实操案例印证行业共识:机器人能否稳定适配真实物理世界,视觉感知精度并非唯一决定因素,接触瞬间产生的触觉反馈才是关键。摄像头能够定位物体空间坐标,却无法识别接触状态、边界抵触、夹持过载、接触面滑移等交互细节;触觉感知缺失,正是机器人难以跨越物理交互 “最后一厘米” 的核心阻碍。

近期,上海新智具身智能科技有限公司(NeoteAI)联合复旦大学可信具身智能研究院发布三份重磅技术报告,重塑行业发展思路,推动触觉从辅助感知模态升级为支撑具身智能发展的底层核心基建。整套研究形成完整技术框架:一套标准化触觉数据底座,搭配两条不同技术取向的模型路线。
项目数据集与模型全部开源,行业研发人员可访问官方链接查阅完整资料:https://research.neoteai.com

触觉技术规模化落地长期被数据互通壁垒制约。不同厂商触觉传感器输出凝胶形变图像、电容矩阵、六维力向量等格式各异的数据,缺乏统一标准,难以跨硬件、跨机器人开展融合训练。
为突破这一困境,NeoteAI 搭建NeoData 数据集,打造标准化触觉数据底座:数据集汇聚超 3 万小时视觉 - 触觉交互素材,包含约 140 万条操作片段、33 亿个时间步;配套 80 亿帧 RGB 图像以及 100 亿帧触觉图像。数据采集依托 Franka、Piper、UR5e 等 6 类主流机器人平台,覆盖叠衣、接头插拔、液体倾倒等 450 项长程实操任务,由 90 名专业操作员参与采集。目前已有 5 千小时高质量视触觉交互数据对外开放。

与此同时,团队研发NeoForce 统一表征模型,打造通用触觉表达体系。该模型不受底层传感器硬件限制,能够学习具备强迁移能力的时序触觉特征,精准识别接触位置、受力大小、侧向拉力等关键信息。这套标准化 “触觉通用语言”,有效解决不同设备触觉数据难以互通融合的行业难题。

配套演示视频完整展示 N₀-Foundation 核心能力,涵盖硬件展示、数据样本、多维度性能评测等内容。

夯实触觉数据底座之后,团队重点探索如何将触觉模态高效融入主流 VLA 技术体系。
传统多模态融合方案习惯于直接拼接视觉画面与触觉信号,存在明显短板。触觉信号仅在物体接触瞬间产生高频信息,其余时段长期处于静默状态,极易被海量视觉 Token 覆盖。更为关键的是,传统触觉感知属于后置反馈,只能记录已经发生的动作状态,存在天然滞后性,很难支撑动态场景下机器人实时调整操作策略。

针对以上痛点,N₀-VTLA提出全新技术思路:跳出滞后的即时触觉感知,提前预判未来 50 步触觉状态变化趋势。模型将实时触觉信息编码为轻量化隐表征,结合视觉上下文预判滑移、受力波动等风险,提前调整动作方案。实测数据优势突出:插头装配任务成功率可达 85%,同期纯视觉方案仅 60%;拔钥匙任务成功率高达 99%,远高于视觉方案 35% 的水平。
区别于传统模仿学习仅依靠成功样本训练,N₀-VTLA 支持机器人从失败案例中持续迭代优化。研发团队结合设备部署数据与人机交互样本训练专属任务评估模型,使其能够区分任务推进阶段,甚至识别操作偏差、应急补救等复杂行为。结合离线强化学习优化后,毛巾折叠、书包收纳、纸箱折叠三类长程任务成功率实现大幅提升,分别由 50%、35%、20% 提升至 95%、80%、75%,真正实现从失败经验中持续进化。

演示视频直观呈现 N₀-VTLA 在各类精细操作任务中的真机作业效果。


如果将 N₀-VTLA 理解为机器人搭载的触觉预警系统,N₀-TWAM则完成机器人认知框架的底层革新。该模型将触觉原生纳入世界模型体系,让机器人在执行动作之前,先在虚拟空间完成完整推演,同步预判视觉画面、触觉反馈与动作轨迹。
当前主流世界模型大多仅聚焦未来视觉画面生成,部署实体机器人时存在严重物理感知断层。模型能够生成抓取物体的视觉画面,却无法判断夹持是否打滑;视觉层面插头完成对位,却无法预判后续是否卡滞,整个推演链路缺失触觉维度信息。
N₀-TWAM 实现视觉、触觉、动作三大耦合序列同步预测。模型采用混合专家架构,搭载视频、触觉、动作三类异步专家网络;视频专家依托预训练模型热启动优化,触觉、动作专家采用轻量化结构,整体参数量 72 亿,仅为全规格模型方案的一半。

仿真环境与真机测试充分验证方案价值:仿真场景平均任务成功率 84.5%,传统顶尖世界模型基线仅有 36%;真机 8 项标准任务平均成功率 46.3%,大幅超越 LingBot-VA 模型 21.9% 的水平。消融实验结果表明,移除未来触觉预测或是实时触觉条件,模型性能会显著下滑,证实触觉是世界模型架构中不可或缺的核心组成。


N₀系列三份技术报告,释放清晰的行业变革信号:N₀-Foundation 证实触觉模态具备和视觉相近的规模化缩放潜力;N₀-VTLA 打通触觉与现有 VLA 架构的融合通道;N₀-TWAM 重新定义世界模型顶层设计,让触觉获得与视觉平权的核心地位。
这预示机器人感知范式迎来重要转型,从单一视觉驱动,逐步迈向视触协同融合。机器人不再仅仅依靠视觉认知环境,能够像人类婴幼儿一样,依托主动触觉探索感知物理规则、验证环境假设、规划后续动作。“看见物体不等于抓稳物体,对齐插孔不代表顺利插接”,这条真实世界的基础物理规律,正式融入机器人底层智能逻辑。
距离实现仅凭触摸就能分辨重量、硬度的通用具身智能,行业依旧还有漫长探索之路。实景大规模数据采集成本、跨机器人本体泛化性能、推理实时性等工程难题仍待持续攻克。但 NeoteAI 联合复旦大学本次系列研究成果,成功推动触觉从小众科研方向,升级为支撑具身智能发展的核心基础设施。
展望具身智能下一阶段发展,行业目标不再局限于打造 “看得懂世界” 的机器人,而是研发能够真正 “摸透物理世界” 的智能体。
文章来源于网络
如有侵权,请联系删除