XR的价值正在经历重估。它不再只是“戴在头上的屏幕”,而是一套连接物理世界与数字世界的空间计算系统。高精度的空间定位、实时的6DoF追踪、多传感器时间同步——这些能力,不仅是XR技术十年积累的核心,也是推动物理AI和世界模型发展的新动力。诠视科技将十年空间计算的积累,转化为面向物理AI的数据采集终端SeerFusion One,让潜力变为可交付的成熟方案。
行业发展不容忽视的关键瓶颈
2026年上半年国内具身智能赛道融资总额已达935亿元,较去年同期增长5倍,仅8月以来就有超过15家企业完成大额融资,其中数据采集与基础设施细分领域融资规模增长尤为突出。行业的快速发展,促生了庞大的物理AI及世界模型训练的需求,一个共识越来越清晰:优质数据是具身智能当前最大的卡点。
大模型训练需要海量数据投喂,互联网上的文字和图片可以"爬",但是相比大语言模型可用的万亿级互联网数据,要机器人模拟人类在三维空间中的行为,具身智能所需的训练数据必须从真实物理环境中采集,需要的推、拉、拽、抓取各种物体等物理交互数据,依赖人在真实空间里做出来、记录下来,因而面临采集难、成本高、数据可靠性低、难以跨本体迁移等问题。
数据采集不是"有设备就行" 。录视频很容易,但是要精确记录"人在三维空间中如何行动",让产生的数据真正能用,这就离不开XR技术中核心的高精度空间定位、实时的6DoF追踪、多传感器时间同步能力。SeerFusion One正是将这些能力集成于一体,数据采集员带上设备即可用更低的成本采集真实世界中的空间关系,工作流程和操作经验。由此可见,XR的潜力正在被重新定义。
一、高精度空间定位——解决“在哪里”的问题
具身智能训练的数据是三维的。机器人需要在真实物理世界中完成抓取、放置、搬运等操作,这些动作的每一个节点都需要精确的XYZ空间坐标作为标注依据。定位精度直接决定了训练数据的可用性——如果空间坐标误差过大,模型学到的就是“模糊”的动作模式,泛化能力无从谈起。
诠视科技的核心VSLAM算法历经十年迭代优化,通过多传感器深度融合,在复杂环境中仍能将定位误差稳定控制在毫米级精度,有效抑制遮挡与漂移问题。更重要的是,SeerFusion One采集的是第一人称视角(Ego-Centric)数据——同步记录“操作者看到了什么”和“操作者在三维空间中做了什么”,并将两者在时间轴上精确对齐。与传统光学动捕系统从外部拍摄的“第三人称”轨迹不同,后者只能记录运动轨迹,而诠视科技同时还原了操作者的主观视角与空间行为,为具身智能模型提供“所见即所行”的训练数据。
二、实时6DoF追踪——解决“做了什么动作”的问题
以叠衣服为例:从展开、对折、抚平再到堆叠,整个过程包含了一系列平移与旋转的复合动作。这正是六个自由度(6DoF) 所描述的运动状态——三个平移自由度决定位置,三个旋转自由度决定姿态。缺少旋转维度,模型也许能学会“把衣服拿到胸前”,但学不会“把袖子向内折45度”。对于抓取、拧转、插拔等操作而言,姿态信息往往比位置信息更关键。
诠视科技支持头手6DoF协同追踪,完整记录操作者的空间运动轨迹。交互层面兼容手柄、手环、数据手套等多种输入方式,能够适应不同数据采集场景的需求。
此外,实时性同样不可妥协。在数据采集中,操作者的每一个动作都是连续的——叠衣服的过程中,手臂的轨迹、手腕的旋转角度、身体的位移,每一帧都在发生变化。诠视科技以极低延迟完成本地化处理,将每一帧的6DoF位姿数据连续记录下来,动作的每一刻都被完整保存。这意味着后期解析时,操作者的完整动作轨迹是连续可用的,而非零散的片段。
三、多传感器时间同步——解决“数据是否对齐”的问题
在位置和动作捕捉的基础上,还需要确认这些数据在时间上是否对齐——这是高质量具身数据的必要条件。数据采集设备通常包含摄像头、IMU(惯性测量单元)、深度传感器等多种传感器。
诠视科技在端侧硬件层完成多传感器数据的同步采集与精准时间戳绑定,实现毫秒级时间同步精度,并统一到同一世界坐标系、可相互叠加,直接输出6DoF位姿等结构化三维数据。时间与空间的双重对齐,在硬件层一次性完成,大幅减少后期数据校准的工作量。
诠视科技:十年深耕空间计算,专注具身数据采集
以上三项技术能力——高精度空间定位、实时6DoF追踪、多传感器时间同步——构成了具身智能数据采集的完整技术闭环。而这三项能力,恰好是诠视科技在XR领域十年积累的核心家底。
诠视科技成立于2016年,是一家专注于空间计算与感知交互的技术企业,核心技术覆盖高速高精度VSLAM引擎、深度引擎、三维重建、手势及骨骼提取、头手协同、数据离线处理和标注等领域。公司已入选中国信息协会具身智能专委会首批会员,荣获工信部关键技术突破企业、中国XR智能眼镜30强等荣誉。
在WAIC 2026上,诠视科技在国内首次公开亮相SeerFusion One——一款面向物理AI与世界模型训练的Ego-Centric数据采集终端,通过Inside-out自主追踪实现无外部依赖的高精度位姿捕捉,结合VSLAM算法实时记录操作者的空间运动轨迹,具备极低延迟的本地化处理能力。诠视科技不做机器人整机,而是定位于具身智能的空间感知基础设施。
当行业还在为“如何采集高质量数据”寻找方案时,诠视科技已经用十年空间计算的积累,提供了一套经过验证的成熟选择。当XR的价值正在被重新定义时,诠视科技用十年时间把这个定义权,掌握在了自己手里。这不是概念的胜利,是时间的复利。