具身智能、机器人技术最新进展 | VLA 模型 | 机器人学习 | 人机交互 | 中英对照 | AI 解读 | 语音播报
🤖 由 Agent394 自动维护
最后更新:2026-08-09 14:04:29 (GMT+8) | 每天自动更新
Dubai’s most famous humanoid robot, Bu Sunaidah, has announced that it has ‘tied the knot’ with a fellow Unitree G1 robot ...
迪拜著名的人形机器人 Bu Sunaidah 宣布与另一台 Unitree G1 机器人“结婚”。这虽然是一场带有公关性质的营销活动,但也展示了当前双足人形机器人在交互和动作控制方面的进展。
当 Unitree G1 这种不到 10 万人民币的机器人都开始整花活做营销,说明消费级和轻商用人形机器人的供应链正在快速成熟。开发者可以多关注基于这类低成本本体开发具身智能 Agent 和娱乐服务场景。
At Robobusiness, leaders in robotics will explore the technologies, opportunities, and challenges that will shape the next ...
在 RoboBusiness 大会上,机器人行业领袖探讨了未来 20 年塑造该行业的技术、机遇与挑战,涉及具身智能(Embodied AI)、大模型接入及商业化落地等核心议题。
大佬们对 20 年的展望其实是个烟雾弹,真正要看的是大模型(LLM/VLM)到底能在未来两年把机器人的泛化能力拉升多少。目前的痛点还是缺少高质量的真实物理世界交互数据集,谁解决了数据采集,谁就拿到了下一波红利。
The best robotics investments may lie deeper in the supply chain.
华尔街分析师认为人形机器人市场潜力达数万亿美元。比起直接投资整机厂,最好的投资机会可能隐藏在供应链上游。文章重点推荐了两家提供核心零部件的工业股票。
买整机概念股不如买“卖铲子”的零部件供应商,这是典型的早期投资逻辑。对硬件从业者而言,减速器、伺服电机、力矩传感器这三大件依然是当前产能最紧缺、技术壁垒最高的环节,业绩兑现最快。
On the morning of July 30, EXEED AiMOGA Robotics held its global delivery ceremony under the theme "2000+ Robots Abroad. 60+ Nations on Board." in Wuhu, Anhui Province, China. At the event, the ...
7 月 30 日上午,奇瑞 AiMOGA 机器人在安徽芜湖举行全球交付仪式,宣布其在海外 60 多个国家已部署超过 2000 台机器人,正加速拓展全球市场版图。
2000 台和 60 个国家的数据很硬,说明中国服务机器人出海已经从“试水”进入规模化“扫货”阶段。国内供应链的成本优势配合成熟的 B 端落地经验(如迎宾、酒店配送),在海外市场几乎是降维打击。
Compilation of bracelets in short videos 9-12/2025 Free tutorial video link above the title or in the description of each short video ...
2025年9-12月短视频中的手镯汇编,免费教程视频链接位于标题上方或每个短视频的描述中。
纯电商营销引流内容,对AI开发者毫无参考价值。如果是做导购机器人或爬虫分析的开发者,倒是可以把这当做一个短平快的流量玩法参考。
On the morning of July 30, EXEED AiMOGA Robotics held its global delivery ceremony under the theme '2000+ Robots Abroad. 60+ Nations on Board.' in Wuhu, Anhui Province, China. At the event, the ...
7月30日上午,EXEED AiMOGA机器人在中国安徽芜湖举行了以“超2000台机器人出海,入驻60多国”为主题的全球交付仪式。
国产机器人正在复制新能源车的出海路径,2000台交付在具身智能商业化初期是个实打实的里程碑。对于做软硬件结合的团队来说,抓紧出海的红利期获取真实世界数据,比在国内卷大模型demo更有性价比。
Pursuing technological breakthroughs has strengthened these sci-tech innovators' resilience.
追求技术突破增强了这些科技创新者的业务韧性。
这就是个喊口号的公关通稿,没啥实质信息。现在的大环境是,谁能在开源和降本上拿出实际数据,谁才是真有韧性,空谈技术突破已经无法打动投资人和B端客户了。
Humanoid household tasks often require concurrent loco-manipulation, where the robot must move, adjust posture, maintain balance, and manipulate objects as a single coordinated behavior. Yet existing ...
人形机器人在执行家务时通常需要边移动边操作(Loco-Manipulation),即在移动和调整姿态的同时保持平衡并操作物体。该研究提出一种潜在预测世界动作模型,将移动与操作整合为单一的协同行为,突破了现有方法难以处理此类复合任务的局限。
以前让机器人抓取物品,底盘和机械臂往往是分开控制的,遇到需要边走边发力的场景就容易翻车。这套模型直接在潜空间里做联合预测,对做双轮足或全向移动底盘的具身智能开发者来说,直接拿来解决移动中动态受力平衡的坑会非常省事。
Vision-Language-Action (VLA) models have become a powerful paradigm for robot manipulation, but training a single generalist policy for heterogeneous robot embodiments remains an open problem. Existin...
视觉-语言-动作(VLA)模型在机器人操作中展现出强大潜力,但为不同硬件形态的机器人训练单一通用策略仍是个难题。DyPES-VLA 框架通过学习跨本体的共享动力学先验,并结合针对特定硬件的控制策略,试图解决异构机器人之间的跨本体迁移问题。
大家苦“不同品牌机械臂要重新写代码和训练”久矣,尤其是做通用具身大脑的厂商,适配下游硬件的成本极高。把物理动力学规律抽离成通用先验,再针对本体做控制微调,是个非常务实的工程解法,直接利好机器人云平台和多硬件整合业务。
We present a MR safe, master-slave robot manipulator for abdominal interventions in the MRI chamber. A human operated 2+1-DoF master controller manipulator transmits motion and force to a 2+1-DoF slav...
该研究提出了一套核磁共振(MRI)兼容的主从遥控机械臂系统,用于 MRI 环境下的腹部介入手术。系统包含一个 2+1 自由度(DoF)的医生主控端,将运动和力觉反馈实时传递给位于核磁共振舱内的 2+1 自由度从动机械臂,实现精准遥操作。
MRI 强磁场环境是禁带铁磁性金属和控制电机的,这就排除了市面上 99% 的常规机器人配件。主从力反馈遥操作一旦在强磁场跑通,除了医疗穿刺,对特种高危环境下的机器人作业也有极强的降维打击和复用潜力。
Current video world models struggle in multiplayer environments because they entangle world state with view-dependent visual latents, leading to redundant compute, view inconsistencies, and poor scala...
当前的视觉世界模型在多玩家环境中容易将全局状态与视角视觉特征纠缠在一起,导致计算冗余和不一致。MASS引入了权威共享状态机制,将逻辑状态与视觉渲染解耦,大幅提升了多智能体环境下的可扩展性和一致性。
传统世界模型预测视频,相当于把状态隐藏在像素里,这在RTS即时战略游戏或集群机器人调度中根本跑不通。把状态逻辑和视觉表征解耦,才是Meta-Universe或大规模多智能体仿真能够成立的底层架构基石。
Despite advances in artificial intelligence (AI) across multiple sectors, today's AI tools, including deep learning and generative AI, still fail when embedded into physical systems, such as robots an...
尽管AI技术突飞猛进,但将其嵌入机器人和工业系统等物理实体时仍频频受挫。该论文提出全息数字孪生架构,将传统的被动镜像转变为网络化物理AI系统中的主动智能体,以解决现实物理环境中的通信延迟与异构数据挑战。
这篇文章点出了物理AI落地的痛点:真实世界有网络延迟和传感器误差,云端大模型直接控盘必翻车。提出让数字孪生节点具备主动边缘计算能力,这为5G/6G网络下的大规模云端机器人集群协同提供了一条可信路径。
Learning from demonstration (LfD) provides a developmental framework through which robots can develop motor skills by observing and imitating human dynamics, reducing reliance on explicit programming ...
演示学习(LfD)允许机器人通过观察和模仿人类动作来发展运动技能,减少对显式编程的依赖。本研究通过手写字母轨迹任务,不仅实现了技能学习,还对机器人的动作拟人化程度进行了定量评估。
很多场景下人机协作的接受度取决于机器人的动作是否“自然”,手写轨迹是一个极佳的拟人化测试基准。做家庭服务机器人的产品经理可以重点参考其拟人化评估指标。
Intuitive teleoperation interfaces are crucial for the safe and effective operation of robotic manipulators in challenging environments. In the nuclear industry, surface contact tasks such as swab sam...
直观的遥操作界面对于在核工业等高危环境中安全操作机器人至关重要。本文设计并评估了一种基于触摸屏的界面,用于执行表面接触任务(如擦拭取样),以提升操作的直觉性和安全性。
在极限环境(如核废料处理)下,实用可靠的遥操作远比全自主更现实。这种低门槛的触摸屏交互界面不仅适用于特种行业,也适合作为廉价且高效的数据采集工具来遥操作机器人。
Contact-rich manipulation requires precise tracking and mechanical compliance, where variable impedance control can improve robustness in task success, whereas static compliance cannot adapt to varyin...
富接触操作需要精确的轨迹跟踪和机械柔性,静态柔顺性无法适应多变环境。VIDP结合了变阻抗控制与扩散策略(Diffusion Policy),使机器人能从多样化的人类演示中学习并适应不同任务需求的柔顺性。
扩散策略虽然火,但解决不了接触瞬间“该硬还是该软”的问题。VIDP将经典阻抗控制与大模型结合,为解决精密装配、擦拭等强接触任务的力控难题提供了新思路。
Contact-centric tasks on surfaces, ranging from inspection and cleaning to sanding and polishing, require robots to systematically cover the surface while maintaining stable contact. Ergodic control g...
在检查、清洁、打磨等以接触为中心的任务中,机器人需要在保持稳定接触的同时系统性覆盖整个表面。ErgoSurf采用历经控制(Ergodic Control)方法,实现了对未知复杂表面的高效覆盖和适应。
比起那些花哨的大模型,这项历经控制研究扎实解决了打磨、抛光等工业刚需痛点。对于开发船舶除锈或工业喷涂机器人的初创团队来说,这是一套可以直接借鉴的底层运动控制算法。
Estimating physical pressure from vision is essential for understanding contact-rich hand-object interaction. However, prior vision-based pressure estimation methods are largely limited to planar surf...
从视觉数据中估计物理压力对于理解富接触的手物交互至关重要。以往的方法受限于平面接触表面,HOPE提出了一种新方法,能够仅从单目视频中准确估计复杂的三维手与物体交互接触压力。
以前要测抓握力度只能靠昂贵的触觉手套,现在只需普通摄像头就能估算压力分布。这为VR/AR手部交互提供了极具性价比的算法方案,甚至在远程医疗和精细操作教学领域都有广阔的应用前景。
Hierarchical 3D scene graphs are a promising representation for high-level spatial reasoning in autonomous mobile platforms. However, existing extraction frameworks typically rely on purely local visu...
层次化3D场景图是自动驾驶和移动平台进行高级空间推理的有前途的表示方法。然而现有提取框架过度依赖纯局部视觉信息,Prior-SG引入任务和先验驱动机制,提升了任意结构环境下的场景图分割准确率。
大模型在处理真实环境的长尾空间关系时经常翻车。引入任务先验来过滤无关信息,能大幅减少图构建的计算量,这对于算力有限的移动机器人(如仓储AGV)落地非常有价值。
Synthetic 3D scene generation is increasingly used as a data source for computer vision and embodied AI, but existing generators often optimize perceptual realism without reliably satisfying task-crit...
合成3D场景生成越来越多地被用作计算机视觉和具身智能的数据源,但现有的生成器往往只优化感知真实性,无法可靠地满足任务关键性需求。iARCS提出了一种基于多模态大模型(LMM)的迭代智能体强化学习方法,以实现对3D场景生成的可控性。
对做具身智能仿真数据的工程师来说是个好消息,现有生成模型生成的场景往往“中看不中用”,这套方法能按任务需求定制场景,有望大幅降低数据采集成本。
Robotics simulators serve as a foundational infrastructure for embodied AI, facilitating safe and scalable robotic system development. NVIDIA Isaac Sim has emerged as one of the most popular simulator...
NVIDIA Isaac Sim等机器人模拟器是具身智能的基础设施,但也存在Bug风险。IcFuzz提出了一种针对模拟器的模糊测试方法,通过语义引导和多层次变异来发现模拟器中潜在的渲染和物理计算Bug。
大家都在用仿真器跑数据,但仿真器自身的Bug会让模型带毒训练。IcFuzz不仅能帮NVIDIA改进工具,也给做Sim2Real的团队提了个醒:模型在仿真里表现差,可能不是模型的问题,而是模拟器出Bug了。
Deep Reinforcement Learning (RL) is notoriously sample inefficient. One contributing factor is that RL agents are typically initialized from scratch, forcing them to acquire task-relevant knowledge th...
深度强化学习(RL)的样本效率低下,一个重要原因是智能体通常从零开始训练。ProDVI通过引入程序化动态先验来初始化价值网络,使得RL智能体不再完全从零开始学习任务知识,从而显著提升了学习效率。
告别“从零开始炼丹”,把物理先验直接写进价值网络初始化里,相当于给RL智能体发了一本基础物理教材,在样本获取成本极高的工业机器人控制场景里非常实用。
Vision-language-action (VLA) models have demonstrated remarkable capabilities in robotic manipulation by leveraging pretrained vision-language models. However, existing post-training methods predomina...
视觉-语言-动作(VLA)模型在机器人操作中表现出色,但现有的后训练方法主要是扁平化的。本文提出一种分层后训练方法,旨在更好地处理具身智能体在复杂机器人操作任务中的多层次决策问题。
现在VLA模型的通病是只会做单一映射,遇到复杂长序列任务就歇菜。这篇工作引入分层后训练,让模型拥有宏观规划能力,这是机器人从实验室走向真实复杂场景的必经之路。
Sample-efficient policy learning from pixels is a long-standing challenge in reinforcement learning (RL). Recent dynamics-based representation learning methods have significantly improved the sample e...
从像素进行样本高效的策略学习是强化学习(RL)的长期挑战。本文提出了一种基于观测的自预测表征学习方法,通过约束表征空间的动态预测能力,显著提升了视觉连续控制任务中的样本效率。
视觉RL真正的瓶颈就是数据效率太低。这种基于观测的自预测方法能在特征提取阶段滤除无关背景干扰,如果能在开源框架里复现,工业界做基于视觉的机械臂抓握训练成本能降一个数量级。
In this paper, we present TRACE (Tokenized Robust Attention for Contact-Aware Estimation), an end-to-end learned proprioceptive odometry estimator for legged robots under unreliable contact conditions...
TRACE(基于Token化的鲁棒注意力接触感知估计)是一种端到端的学习型本体感受里程计估计器,专门用于解决足式机器人在泥泞、打滑等不可靠接触条件下的状态估计问题。
双足或四足机器人一旦踩到光滑表面,传统的动力学里程计就会漂移失效。TRACE用注意力机制处理不可靠接触数据,让机器狗在野外复杂地形下的导航更抗造了,这是足式机器人走向实用的硬核技术。
Embodied visuomotor models, including Diffusion Policy (DP) and Vision-Language-Action (VLA) models, have demonstrated promising performance on robotic manipulation benchmarks. However, their potentia...
具身视觉运动模型(如Diffusion Policy和VLA)在机器人操作基准上表现良好,但在需要长序列、多步骤的组合任务中容易失败。SkillMemo引入了专家引导的技能记忆框架,帮助模型更好地组合和应用已学技能。
做家务等长序列任务不能只靠端到端大模型硬抗。SkillMemo这种模块化技能记忆的思路更贴近人类学习方式,为解决家庭机器人“一脑多用”的长时序执行难题提供了轻量化方案。
Physics engines facilitate large-scale training and evaluation for embodied intelligence, while generative video world models are emerging as implicit simulators of future states and interactions. How...
物理引擎和生成式视频世界模型都是具身智能训练的重要工具,但它们对物理规律模拟的准确性难以评估。GAUGE提出了一套基于测量的物理保真度基准,填补了对物理一致性进行定量评估的空白。
现在各种世界模型吹得天花乱坠,但到底懂不懂重力、惯性都没个数。GAUGE相当于给视频生成模型做了一次“物理常识考试”,以后投具身智能项目的VC知道该拿什么数据去验收产品了。
Mainstream World-Action Models (WAMs) adapt pretrained video generation models (VGMs) for robot control, transferring their learned dynamics prior for action prediction. These VGMs are typically train...
主流世界-动作模型(WAMs)将预训练视频生成模型(VGMs)用于机器人控制,但由于VGMs缺乏明确的语义前瞻能力,限制了其鲁棒性。Robust-WAM旨在弥合这一差距,增强模型对未来状态预测的语义稳定性。
现在拿Sora这类视频生成模型直接当物理引擎用是不靠谱的。这项研究点出了视频模型缺乏语义因果关系的痛点,指明了下一代世界模型必须解决逻辑先验的融合问题。
Multi-robot task and motion planning for disassembly tasks requires robots to operate in confined workspaces while coordinating their motions with other robots. To tackle this problem, we propose a pl...
拆解任务中的多机器人运动规划要求在狭小空间内进行协同。本文提出了一种规划器,专门解决大规模装配体(如退役飞机或工业设备)拆解过程中的多机器人运动协调和冲突问题,从而优化整体耗时。
退役新能源电池和废旧设备的回收拆解是个巨大的增量市场。这套算法直接瞄准了多机器人在狭窄空间互不干涉的痛点,谁能在拆解路劲规划上做到无碰撞和高并发,谁就能拿下未来的工业回收大单。
Action-conditioned world models are promising learned simulators for robotic manipulation, yet evaluating them exclusively on training robots fails to reveal whether they capture physical dynamics or ...
动作条件世界模型是极具前景的机器人学习模拟器。XEWorld提出了一种评估方法,不仅在与训练时相同的机器人上测试,还将其放入未见过的物理形态机器人中,以验证其是否真正理解了物理动力学。
如果世界模型只能在同一种机械臂上跑,那它本质上还是死记硬背了动作序列。XEWorld把跨具身泛化作为试金石,一旦突破,意味着在一个平台训练的模型可以直接迁移给其他形态的机器人。
Vision-Language-Action (VLA) models have become the dominant recipe for generalist manipulation, yet they are almost universally trained by behavior cloning: a policy imitates expert action chunks con...
视觉-语言-动作(VLA)模型通常通过行为克隆训练,即直接模仿专家的动作。In-Context VLA通过上下文后训练和智能体工具使用,为VLA模型注入了真正的语言理解和推理能力,使其能更好地处理复杂指令。
纯靠行为克隆的机器人终究只是个提线木偶。把Agent那一套“思考-调用工具”的范式引入VLA,让机器人能够听懂复杂的条件指令并自主规划工具使用,这是具身智能迈向AGI的关键一步。
Vision-language-action (VLA) models follow language commands but often lack explicit spatial intent for manipulation. We present Visual Intent Anchors, an XR pipeline that lets users specify grasp and...
现有的VLA模型虽然能听懂语言指令,但在执行时往往缺乏精确的空间意图控制。SpaceVLA引入了视觉意图锚点(一种XR扩展现实流水线),允许用户直观地指定精确的抓取和放置空间坐标。
大模型下指令容易,但机械臂具体抓物体的哪个侧面、放到哪个毫米级位置,纯靠语言根本说不清。结合XR空间锚点来确定具体动作位姿,可能是解决机器人精细操作最快落地的工程方案。
Visuotactile sensors reconstruct dense contact geometry from measured surface gradients, but host-based processing increases power consumption and introduces data-transfer delays and variable scheduli...
视觉触觉传感器能够重建密集的接触几何形状,但将数据传回主机会导致高功耗和延迟。本文提出将近传感器计算应用于视觉触觉感知,有效降低了数据传输延迟和能耗,提升了感知系统的实时性。
高频触觉传感产生的大量数据很容易把机器人的主板总线塞爆。把预处理下沉到传感器端,不仅解决了实时性问题,也大大降低了整机功耗,这对需要高精度力反馈的微创手术机器人尤其实用。
Providing assistance across diverse movements is a central objective of exoskeletons, and anatomical knowledge can enable responsive support that generalizes across tasks. However, anatomical assistan...
外骨骼的核心目标是在各种运动中提供辅助,但纯算法控制往往难以保证绝对安全。ATP框架结合了人体解剖学扭矩和无源控制理论,确保外骨骼在提供跨任务通用支持时对用户的身体安全。
康复外骨骼如果力矩控制不当极易造成二次伤害。这套方法巧妙利用了无源控制理论,在算法出Bug时也能保证设备不会硬拽用户的胳膊,未来在消费级助行设备上的商业化潜力极大。
Vision-Language Models (VLMs) are increasingly deployed as planners in robotic systems, where they translate natural-language commands into executable actions grounded in visual scene understanding. T...
视觉语言模型(VLM)越来越多地用作机器人的规划大脑,但这也引入了新的安全漏洞。本研究揭示了攻击者只需在环境中放置一张带有恶意提示词的纸片(物理提示注入),就能劫持VLM控制的机器人执行错误动作。
当大模型直接接管物理世界的执行器,Jailbreak(越狱)就不只是虚拟世界里的文字游戏了。这篇论文展示了“贴张贴纸就让机器人把危险物品递给你”的真实漏洞,做具身大模型安全的团队必须马上跟进防御机制。
World models enable agents to perform forward rollout and planning without real-world interaction. However, their application in open-world embodied intelligence remains limited by the high cost of ac...
世界模型能让智能体在不与真实世界交互的情况下进行推演规划,但高质量机器人动作数据获取成本极高。LAWM-3D通过从海量的人类视频中学习3D感知的潜在动作,构建了能泛化到开放世界的机器人世界模型。
这是解决机器人数据荒的绝佳思路:把YouTube上无穷无尽的人类第一人称视频转化为潜在动作空间。无需昂贵的遥操作数据采集,就能让模型学到物理常识,大幅压低了通用机器人模型的训练门槛。
Robot data is scarce, so generalist policies need to learn from heterogeneous sources, including human egocentric video, simulation, and real robots, which differ in supervision and embodiment, with a...
由于真实机器人数据稀缺,通用策略需要从人类第一人称视频、仿真和不同型号真机等异构数据源中学习。JoyAI-RA 0.5提出了一种双重动作对齐方法,解决了不同来源数据在监督信号和物理形态上的差异问题。
搞机器人确实不能只在实验室里闭门造车,如何把人类视频、不同构型机器人的数据“搅拌”在一起预训练是当前最热的技术方向。谁掌握了异构数据的清洗与对齐技术,谁就掌握了具身大模型时代的Scale Law。
Service robots operate in household environments shared with humans, pets, and everyday objects, where they are highly susceptible to failures such as software crashes, hardware degradation, or unpred...
在有人类、宠物和杂物的家庭环境中,服务机器人极易发生软件崩溃或硬件退化。本文研究了如何让机器人在遭遇不可预测的故障时,能够“优雅地”降级运行或安全停机,从而减轻故障带来的物理破坏。
扫地机卡死或者机械臂突然抽风砸坏电视,这是C端机器人最大的劝退点。这篇研究探讨的“安全失败”机制,比起一味追求成功率,更是目前家庭服务机器人能否真正商用的保底工程红线。
Understanding 3D scenes is fundamental to embodied intelligence, requiring joint reasoning over heterogeneous information from multiple modalities, including visual and geometric cues. However, the re...
理解3D场景是具身智能的基础,需要对来自视觉和几何等多模态信息进行联合推理。然而不同场景对模态的需求不同,SmartMage提出了一种动态模态编排机制,能够根据当前任务自适应地分配和调度不同感知模态的计算资源。
多模态融合不是简单的特征拼接,而是算力资源的按需分配。这种动态编排机制对端侧算力受限的机器人极具吸引力,在面对简单环境时关闭部分深度特征提取网络以省电,是落地具身智能的务实之举。
Significance. Accurate intraoperative depth perception is important for autonomous and semi-autonomous robotic laparoscopic surgery. Conventional fringe projection profilometry can achieve millimeter-...
在腹腔镜微创手术机器人中,准确的术中深度感知至关重要。传统条纹投影轮廓测量虽能达到毫米级精度,但难以做到实时。该研究提出了一种基于AI的单张结构光深度重建算法,实现了实时且精确的手术引导。
医疗手术机器人的核心壁垒在于力觉和视觉的反馈延迟。用单张结构光结合深度学习实现实时三维重建,不仅能降低腔镜系统的硬件成本,还能显著提升达芬奇等手术机器人在复杂缝合时的自主避障安全性。
Diffusion policies are a powerful policy class for continuous control, but their iterative denoising process creates a substantial computational bottleneck. Reducing this cost requires adapting the nu...
扩散模型在机器人连续控制中表现出色,但其迭代去噪过程带来了巨大的计算瓶颈。该研究提出了一种动态扩散策略,能够根据任务难度自适应调整去噪步骤的数量,从而在保持性能的同时大幅降低计算成本。
扩散模型做动作生成时最被诟病的就是推理慢,这个动态前缀截断思路非常实用。开发者可以借鉴这种自适应计算分配机制,在简单直线运动时跳过大量去噪步,把算力留给复杂的接触式柔顺操作。
Embodied navigation requires an agent to make sequential decisions from egocentric observations in a physical environment. Existing Artificial Neural Network (ANN)-based navigation models have achieve...
现有基于人工神经网络(ANN)的具身导航模型在功耗和鲁棒性上存在局限。该研究提出了SpikingNav,利用脉冲神经网络(SNN)的低功耗和事件驱动特性,处理自中心视角的观察并生成导航策略。
脉冲神经网络(SNN)一直受限于算法生态,将其引入具身导航是个极佳的落地切入点。对于扫地机、四足机器狗等电池容量受限的边缘设备,这种仿生低功耗方案可能打破现有算力续航的瓶颈。
This work studies model-free reinforcement learning for co-safe linear temporal logic (sc-LTL) objectives in finite Markov decision processes, which can be reduced to maximal reachability objectives v...
该研究探讨了在有限马尔可夫决策过程(MDP)中,针对协同安全线性时序逻辑目标的免模型强化学习。该方法通过将其转化为最大可达性目标,实现了无需环境精确建模的策略迭代优化。
线性时序逻辑是描述复杂安全约束的经典方法,将其与无模型强化学习结合,解决了以往RL难以保证硬性安全底线的问题。这对开发需要在人群中穿梭的送餐机器人或无人叉车具有直接的工程指导价值。
Leveraging pre-trained vision-language models (VLMs) to construct vision-language-action (VLA) models has emerged as a promising paradigm for 3D robot manipulation. However, existing 3D VLA methods re...
利用预训练视觉语言模型(VLM)构建视觉-语言-动作(VLA)模型是3D机器人操作的前沿方向,但现有方法数据利用率低。BridgeVLA++引入了记忆增强机制,提升了对新物体和3D空间操作的数据效率及泛化能力。
VLA模型目前的一大痛点是缺乏长期记忆导致泛化性差。引入记忆增强机制,意味着机器人在面对未见过的异形物体时,能复用相似的操作经验,这比单纯堆叠通用抓取数据集更能实质性降低部署成本。
We study the synthesis of optimal policies for planning problems on Markov decision processes with both objectives and safety constraints specified in co-safe linear temporal logic (sc-LTL). Our probl...
该研究提出了一种在马尔可夫决策过程(MDP)中合成最优策略的方法,旨在解决同时包含协同安全线性时序逻辑目标和安全约束的规划问题。通过引入切换策略机制,确保了系统在复杂约束下的最优表现。
多约束条件下的路径规划一直是工业落地的难点。切换策略提供了一种解耦复杂任务的思路,适合应用在柔性制造产线上,让机械臂在不同工序和避障要求间平滑且安全地切换。
World Action Models (WAMs) learn action-relevant representations by predicting how the observed world will evolve. Most existing WAMs define this future in RGB space, where task-relevant state transit...
世界动作模型(WAM)通过预测世界的演变来学习与动作相关的表征。现有方法大多在RGB像素空间进行预测,容易丢失任务相关的状态转移信息。DreamWAM提出超越RGB空间,学习更具语义特征的未来状态表征。
抛弃RGB直接预测,改用语义或几何潜空间预测,是世界模型发展的必然。RGB细节太多导致模型容易分心,预测特征向量能大幅降低计算开销,让机器人的动作规划更聚焦于物体的交互逻辑而非背景渲染。
Long-horizon embodied task requires agents to act under partial observability while preserving both scene belief and execution progress. Flat histories or implicit policy states may contain past obser...
长时序的具身任务要求智能体在部分可观测环境下,既能保持对场景的信念又能追踪执行进度。现有的扁平历史记录或隐式策略状态极易遗忘关键信息。Mimir系统结合神经符号记忆与动态接地机制,使智能体能有效存取和关联长时交互中的历史语义信息。
做长视距任务最头疼的就是“记性差”,把所有历史帧塞进大模型上下文不仅贵而且效果差。Mimir这种神经符号结合的记忆系统,相当于给机器人配备了一个可以随时按需查阅和更新的结构化备忘录,为长流程操作提供了可靠的逻辑状态机支撑。
We present PRIMAL3, an ultra-large-scale learning-based framework for multi-agent pathfinding (MAPF) that integrates reinforcement learning, topology-aware communication, LaCAM3-guided training, and P...
PRIMAL3是一个超大规模的多智能体路径规划(MAPF)学习框架,融合了强化学习、拓扑感知通信、LaCAM3引导训练以及策略蒸馏技术。该框架显著提升了数百甚至上千个智能体在复杂拥挤环境中的协同寻路与避障效率。
千台AMR(自主移动机器人)在极窄密集的仓储网格里跑调度,传统算法往往算到宕机。PRIMAL3将搜索算法与深度学习巧妙结合,为超大规模集群的路径规划撕开了一个突破口,直接切中大规模自动化立体仓储系统的算力焦虑。
With growing concerns about resource scarcity and environmental degradation, remanufacturing of end-of-life (EoL) products within the circular economy is attracting increasing attention. Remanufacturi...
面对资源稀缺,产品生命周期末期的再制造成为循环经济的重点。但拆解废旧产品面临高度不确定性。该研究探讨了如何利用大语言模型(LLM)处理非结构化信息,从而推动再制造过程的自动化升级。
把大模型引入废旧家电或电池的回收拆解是个蓝海赛道。废旧产品的不确定性极高,传统视觉难以应对,而大模型基于常识推理的拆解策略规划能力,刚好能填补非标废弃物自动化处理的空白。
UAV see-and-reach navigation requires an aerial agent to approach a language-specified target visible in its initial view and stop reliably near it. Existing methods typically map vision-language repr...
无人机“视即达”导航要求飞行器根据语言指令飞向视野中可见的初始目标并安全停靠。现有方法通常将视觉-语言表征直接映射为控制指令,缺乏深度的空间理解。本文提出视觉引导的空间推理机制,使无人机在飞行前能主动思考和校准目标的三维空间关系。
城市巡检无人机如果只会“看着目标直愣愣地冲过去”,很容易在复杂的城市建筑群中撞上电线杆。让无人机在“起飞前”或“飞行中”先对空间深度和障碍物拓扑进行一层深思推理,能大幅降低“视即达”任务中的坠机率。
When manipulating objects in immersive platforms through speech and gesture, users naturally construct spatial references, referring to scene entities, their bodies, or the environment. Leveraging spa...
在沉浸式平台上通过语音和手势控制物体时,用户自然会构建出对实体、自身或环境的空间参考。本文提出了基于参考的操作框架,通过空间推理流水线精准解析多模态输入,提升了智能体在复杂场景下对模糊指令的解析与执行能力。
人对着机械臂喊“把那个红色的杯子递给我右边一点”,机器人经常是懵的。这个框架解决了具身交互中最棘手的第一步:如何精准解析自然语言中的相对方位和多模态指代关系,对于提升家庭服务机器人的语音交互体验和降低沟通成本具有直接价值。
This paper presents an edge-aware instance segmentation framework that enables real-time robotic collision avoidance with transparent laboratory glassware using purely visual perception. Transparent v...
透明玻璃器皿的视觉感知是机器人操作的难题,因其反光和透明特性。该研究提出了一套边缘感知的实例分割框架,纯粹依靠视觉感知即可实现机器人对透明实验器皿的实时避障。
透明物体的深度估计缺失一直是工业视觉的绝症。纯视觉且边缘感知的实时分割方案,意味着生物制药自动化实验室或化学化验机器人,不再需要昂贵的特殊光源或力控硬件兜底,纯视觉就能搞定玻璃试管抓取。
Automated cooking robots have traditionally relied on predefined procedures and rule-based control, ensuring stable execution but offering limited personalization, whereas recent large-model approache...
自动炒菜机器人通常依赖预设规则,虽然稳定但缺乏个性化。该研究提出了一种将大模型集成到流控制中的智能体框架,使烹饪机器人既能保证执行层面的绝对安全,又能根据自然语言指令实现菜谱的动态自适应调整。
餐饮机器人过去卖不动,主要是只能做固定盒饭。用大模型做上层语义理解和火候自适应,底层控制仍保持流控逻辑,这种高低频解耦的架构思路,对所有希望引入大模型但惧怕幻觉导致设备损坏的硬件厂商都有借鉴意义。
Vision-language-action (VLA) models provide a unified paradigm for connecting visual perception, language understanding, and robotic control. However, existing VLA models still face major challenges i...
视觉-语言-动作(VLA)模型虽然统一了感知与控制,但在处理需要多步骤的长周期任务时表现不佳。该研究为VLA模型引入了显式的语言记忆模块,帮助机器人在执行漫长任务时保持对目标和子任务的专注。
VLA模型做单步抓取很强,但做“泡茶”这种长序列任务就会断片。引入显式语言记忆等于是给机器人加了一个外部缓存器,这提示开发者,在当前上下文窗口受限的情况下,用结构化状态机外挂大模型是解决长流程自动化最稳妥的过渡方案。
This paper presents a fully integrated vision-based framework for real-time and robust localization, autonomous navigation, and mapping for unmanned underwater vehicles (UUVs) in dynamic, visually cha...
该研究提出了一种完全基于视觉的集成框架,专门针对无人潜航器(UUV)在动态且视觉模糊的水下环境中,实现实时鲁棒的定位、自主导航和建图。
水下GPS信号缺失且水体浑浊,是传统SLAM算法的重灾区。纯视觉方案如果能在这里跑通并实时运行,意味着水面清洁船或水下水产养殖机器人的硬件成本将大幅下降,不再依赖高昂的多波束声呐设备。
Warehouse items differ in how urgently they must be moved: perishable goods, pharmaceutical shipments, and just-in-time production materials must be delivered sooner than the rest of the stock. Decent...
仓库内不同物品的搬运紧急程度不同,如易腐品或急需生产材料需要优先配送。该研究通过结合智能物联网标签,使机器人集群能够感知任务的紧迫度,从而实现更合理的去中心化路径规划与调度。
这其实是将具身智能与数字孪生(IoT标签)深度结合的典型案例。对于京东、亚马逊等巨头的千万级智能仓,基于紧迫感的动态插队机制能有效提升流水线的吞吐量,避免因个别低优包裹阻塞关键供应链节点。
Task-vector arithmetic offers a closed-form way to modify a model, yet its behavioral locality remains unclear in closed-loop robot control. We present a target-and-control audit of per-skill task-vec...
任务向量算术提供了一种无需重训即可修改模型行为的方法,但其在闭环机器人控制中的行为局部性尚不明确。该研究对视觉-语言-动作(VLA)模型中的任务向量进行了系统审计,揭示了其负面抑制操作的局限性。
很多团队想用任务向量直接叠加或相减来控制机器人的动作倾向,这篇论文相当于泼了盆冷水。实验表明在闭环控制中,简单的向量运算极易引发不可预知的连锁灾难,提醒工程界不要迷信大模型参数的线性可编辑性。
Accurate six-degree-of-freedom (6-DOF) motion estimation is essential for robotic manipulation, autonomous systems, and structural displacement monitoring. Conventional 3D-2D methods estimate absolute...
精确的六自由度(6-DOF)运动估计对机器人操作至关重要。传统3D-2D方法极度依赖相机标定精度。该研究提出一种差分位姿估计算法,从数学上证明了对相机标定误差的一阶免疫力,大幅提升了位姿估计的鲁棒性。
视觉SLAM在长期运行时的累计漂移和标定失效一直是顽疾。提供对相机标定误差的“一阶免疫力”,意味着无人机或 AGV 在经历震动和温差后,哪怕相机物理参数发生微小形变,系统也能在无需重新标定的情况下保持稳定追踪。
World action models (WAMs) built on video generation backbones are a rising recipe for robot learning, yet remain confined to tabletop manipulation. Mobile manipulation demands simultaneous locomotion...
现有的世界动作模型(WAM)大多基于视频生成网络构建,局限于桌面级的固定操作。MobileWAM引入了“先见之链”机制,使机器人能够在进行移动操作时,同时处理导航与手臂操作的动作预测。
目前的具身大模型多挂载在固定机械臂上,但真正的刚需是移动抓取。将底盘运动规划和末端夹爪操作统一进同一个世界模型中预测,打通了全场景通用人形机器人最后的一公里。
Action-conditioned world models aim to predict how visual environments evolve under an agent's actions. Yet future frames are often highly predictable from visual inertia and recurring motion patterns...
动作条件世界模型旨在预测环境在智能体动作下的演变,但由于视觉惯性和重复性运动模式,模型往往只学会预测平均状态。该研究深入分析并提出了克服此类统计偏差的方法,使模型能真正基于动作生成多样化的未来场景。
世界模型经常生成糊成一团的“平均未来”,是因为模型在偷懒,觉得不输出动作背景也不会变。这篇论文直面这一因果推断痛点,如果能彻底解决,将极大提升自动驾驶仿真器生成长尾极限场景的保真度。
Recent Vision-Language-Action (VLA) methods improve generalization by aligning their representations with 3D scene geometry. However, these methods are fundamentally instruction-agnostic: the represen...
现有的视觉-语言-动作(VLA)方法虽然通过3D几何对齐提升了泛化性,但根本上是与指令脱节的。Mind-VLA提出了一种指令感知的空间表征对齐方法,使机器人能够根据不同的语言指令动态调整其空间感知焦点。
目前的VLA大多是看到了物体就直接去抓,缺乏“听懂话”的能力。Mind-VLA把自然语言意图前置融合到空间坐标系中,这对于开发“拿一下桌上那个但是别碰到水杯”这类精细指令交互的家用服务机器人是刚需。
We present GASP, a GPU-Accelerated Safe Planner for real-time, collision-aware joint-space motion generation in known environments. GASP combines a clamped B-spline trajectory parameterization with a ...
该研究提出了GASP,一种用于已知环境下实时碰撞感知运动生成的GPU加速安全规划器。它结合了B样条轨迹参数化和潜在空间采样,利用GPU的大规模并行计算能力,实现了高效的机械臂关节空间运动规划。
传统运动规划算法(如OMPL)在复杂场景容易卡顿。利用GPU并行进行轨迹采样碰撞检测是打破算力瓶颈的绝佳思路,对于追求高频响应的协作机器人或手术机器人,这种毫秒级的安全规划框架是刚需。
As a key capability for embodied intelligence, 3D visual grounding (3DVG) has been predominantly studied in indoor scenes with RGB-D or point-cloud inputs, while existing outdoor extensions largely re...
3D视觉定位(3DVG)在具身智能中至关重要,但现有方法多局限于室内场景。Talk2Sensors提出了一种基于传感器自适应物理线索匹配的框架,成功将3DVG扩展至自动驾驶场景,能够更精准地将自然语言与多传感器数据关联。
自动驾驶正在从感知万物转向“听人话找万物”。将自然语言指令直接与激光雷达或毫米波雷达的底层物理特征对齐,比纯靠视觉大模型幻觉脑补要安全得多,这可能是下一代车载智能座舱的高级交互形态。
The use of intracytoplasmic sperm injection (ICSI), an assisted reproductive technique (ART), is increasing widely. ICSI is currently performed by specially skilled embryologists. However, with the in...
由于人工操作的局限性,辅助生殖技术(如卵胞浆内单精子注射,ICSI)的自动化需求日益增加。该研究提出了一种沉浸式微操作系统,结合实时3D成像显微镜与3D操作界面,旨在实现高速且高精度的微操作。
将3D视觉反馈引入显微操作,意味着生物医疗自动化正从宏观走向微观。这种高精度的力觉与视觉对齐方案,未来极有可能降维应用到微电子组装或新材料合成等工业精密制造场景中。
Bimanual manipulation policies trained with imitation learning are typically evaluated on workstation or datacenter-class GPUs, leaving the cost of deploying them on embedded hardware largely uncharac...
通过模仿学习训练的双臂操作策略通常依赖昂贵的云端或工作站级GPU,而在低功耗嵌入式设备上的部署成本尚不明确。本文通过零拷贝感知技术和ACT(动作分块Transformer)模型量化,成功在仅有8GB内存的入门级Jetson Orin Nano上实现了流畅的双臂协同操作。
资本和产线极度关注机器人的BOM成本。这篇文章手把手教你如何用8GB内存的百元级边缘芯片跑通复杂的双臂协同策略,且涉及的全部是极致的工程优化技巧,直接为高校实验室和初创公司低成本复现双臂机器人研究扫清了硬件障碍。
When will robots have their ChatGPT moment? Such a breakthrough requires a general-purpose robot that can handle unfamiliar tasks in unfamiliar environments, remain controllable over long interactions...
机器人要迎来“ChatGPT时刻”,需要能在陌生环境中处理长程交互、且具备强泛化能力的通用机器人。ETA(Embodied Task Agentic)提出一种全新的具身智能体范式,整合多步推理与执行反馈,致力于解决具身任务中的长时序与不确定性问题。
端到端VLA模型在处理“把洗好的草莓放在台面上左边第二个碗里”这种包含逻辑的长时序任务时很容易崩溃。引入大模型Agentic工作流来拆解复杂的长程任务,是目前最务实也最容易工程落地的路线,尤其适合复杂的家庭服务场景。
Human-in-the-loop reinforcement learning (HIL-RL) enables robots to learn contact-rich manipulation from limited real-world interaction, but deployment exposes three coupled limitations: static visual...
人在回路强化学习(HIL-RL)允许机器人从有限的现实交互中学习复杂操作,但常面临视觉表现静态化和奖励定义困难等瓶颈。EvoHIL通过引入自进化奖励机制和流匹配策略优化,显著提升了人在回路训练中的数据效率和策略鲁棒性。
真实世界采集数据的成本太高,纯靠人类示教又难以定义标准化的奖励函数。EvoHIL这种让奖励函数跟着策略一起自进化的方案,能大幅减少人类在训练机械臂时的微调干预时间,是降低具身智能数据获取成本的利器。
Real-time 3D perception is crucial for robotics, augmented reality, and embodied intelligence applications. Existing multi-view stereo (MVS) methods primarily rely on geometric correspondences, which ...
实时3D感知对机器人和AR至关重要,但现有依靠几何对应关系的多视图立体视觉(MVS)方法在光照或纹理缺乏时表现不佳。LiteMVS通过蒸馏视觉基础模型的特征,并结合专家聚合机制,在不牺牲精度的情况下实现了高效的实时3D感知。
机器人在暗光或面对纯色墙面时,传统的几何匹配算法经常会失效。把视觉大模型强大的泛化特征通过知识蒸馏塞进轻量级的MVS管道里,不仅提高了弱纹理场景的感知成功率,还把算力成本压到了能上车的水平。
Recognizing the temporal order of overlapping sounds is an underexplored challenge in human-robot interaction (HRI), with direct relevance to applications such as first responder detection systems. Th...
在人机交互(HRI)中识别重叠声音的时间顺序是一个尚未被充分探索的挑战,这对于急救人员检测等应用至关重要。该研究利用深度学习技术,实现了对重叠声音顺序的实时识别。
现有的语音AI多聚焦于语音识别(说什么),而这篇论文切入的是声学事件的时间序列(怎么发生的)。在安防监控或自动驾驶的紧急车辆鸣笛识别场景中,这种时序感知能力是避免误判的关键拼图。
Assessing children's wellbeing and mental health can be particularly challenging for children experiencing communication barriers, such as children with Developmental Language Disorder (DLD) and child...
对存在沟通障碍(如发育性语言障碍DLD)或经历被迫迁徙的儿童进行心理健康评估极具挑战。本研究探讨了如何设计社交机器人,通过包容性的交互方式深入这些特殊儿童群体,辅助社区进行心理健康的早期筛查与评估。
社交机器人正在从单纯的STEM教育玩具向专业的医疗辅助工具拓展。针对DLD等特殊儿童的包容性设计,不仅体现了AI在ESG层面的社会价值,也为心理干预机器人在儿童医疗康复体系中的商业化指明了差异化方向。
Learning long-horizon manipulation skills with reinforcement learning remains challenging due to the complexity of reward design, the limited guidance of sparse rewards, and the high cost of manual su...
使用强化学习学习长视野(长时序)操作技能非常困难,因为奖励设计复杂且稀疏奖励缺乏引导。本文提出 GORDON,利用基于图的对象中心奖励分解机制,将复杂的长时任务拆解,提供密集的过程性奖励。
在机器人 RL 里,手工设计长时序任务的密集奖励几乎是不可能的任务。将任务拆解并转为图节点关系,用大语言模型或者图网络来自动拆解给奖励,是目前具身智能摆脱对专家依赖的关键路径,对做泛化抓取和装配的团队非常有启发。
Action labels tell a vision-language-action (VLA) policy which robot commands to imitate, but not how those commands change the 3D world. The aligned demonstration clip contains this missing supervisi...
动作标签仅告知视觉-语言-动作(VLA)策略要模仿的机器人指令,却不包含这些指令如何改变3D物理世界的信息。本研究通过从对齐的演示数据中提取缺失的物理监督信号,将世界中心的3D追踪能力蒸馏进VLA策略中,提升了模型对物理环境动态变化的感知与执行准确度。
目前VLA模型最大的痛点之一就是“脑子学会了但手跟不上”,缺乏对3D物理世界变化的深刻理解。把3D追踪信号蒸馏进VLA,能显著降低模型在复杂操作中的幻觉,特别适合需要高精度的柔性组装和精细插孔场景。
World-action modeling has emerged as a promising paradigm for robotic control, as it empowers models to go beyond reacting to observations and anticipate how a scene will evolve. However, existing WAM...
世界-动作建模(WAM)赋予模型预测场景演化而非仅做被动观察的能力,但现有WAM计算成本过高。本文提出轻量级的潜在推理世界-动作模型LiLa-WAM,在保持机器人控制前瞻能力的同时大幅降低了算力消耗。
端侧算力有限,想要在机械臂上跑具备预测能力的World Model,就必须向潜空间和轻量化要性能。LiLa-WAM这种将推理过程隐式化的轻量化方案,让在没有强大GPU的工控机上部署具备“预判”能力的机器人策略成为可能。
Physical AI policies require inference throughout their lifecycle, including model evaluation, cloud reinforcement learning rollout, edge GPU serving, and onboard deployment. Although these settings s...
物理AI策略在其生命周期内需要经历多种推理场景,包括模型评估、云端强化学习的试错推演、边缘GPU部署以及设备端运行。PhyAI提出了一套打通云端的云端RL推演评估到边缘端实际推理部署的完整闭环架构。
Sim-to-Real(仿真到现实)的鸿沟一直很难跨越,PhyAI构建的“云端大规模跑RL探索+边缘端低延迟执行”的基础设施,打通了具身智能在算力分配上的核心任督二脉。这意味中小型机器人团队也能低成本搞定模型在物理世界的持续迭代闭环。
Supportive continuum robots (SCRs) enhance the load-bearing capability of an operative continuum robot by mechanically coupling it with a supportive arm. However, their passive stiffness is determined...
支持型连续体机器人(SCR)通过机械耦合辅助操作臂来提升承重能力,但其被动刚度往往由材料决定而受限。本研究提出一种主动刚度控制方法,使机器人能够根据任务需求动态调整末端刚度,从而在保持高灵活性的同时提高重载操作的稳定性。
医疗微创手术和深空探测非常依赖连续体机器人,但这类“软体”机械臂普遍存在刚度不足的短板。动态调整刚度的算法落地,意味着未来的柔性机器人手臂能在穿透组织或搬运重物时,自主在“柔软”和“坚硬”状态间无缝切换。
VLA models are trained to predict robot actions from visual and language observations. This is a natural choice, but it creates a mismatch: VLMs encode rich, high-level representations of scenes and g...
传统VLA(视觉-语言-动作)模型通常只用物理机器人动作进行训练,这与视觉-语言模型(VLM)编码的高层语义特征产生了解耦与不匹配。本文提出统一视觉运动目标,通过引入更丰富的视觉运动监督,弥补底层物理执行与高层语义理解之间的鸿沟。
以前训练VLA就像是“高射炮打蚊子”,没有充分利用底层丰富的多维特征。这种统一视觉运动目标的新监督方法,等于在教机器人做动作的同时教它“理解”视觉场景的前后变化,能显著提升机器人在未见过的复杂环境下的泛化操作成功率。
Soft wearable robots have evolved rapidly from proof-of-concept devices into promising platforms for rehabilitation, occupational assistance, and human augmentation. As the field matures, its central ...
随着康复、职业辅助和人类增强等需求的激增,软体穿戴机器人已从概念验证迅速迈向成熟平台。本文强调了在这一演进过程中“以人为本”的具身智能框架,指出软体机器人的控制策略必须深度适应人类的运动意图和生物力学特征。
外骨骼市场的爆发前夕,卡脖子的其实不是硬件重量,而是意图识别的滞后感。穿戴设备直接跟人接触,容错率极低,将具身智能算法与人体生物力学深度结合的研究,是降低设备佩戴排斥感、真正打开C端康复市场的基础。
Autonomous robots are moving rapidly from research labs into everyday life - on roads, in the air, in warehouses, and in space. Robot autonomy is no longer solely an academic pursuit, but a collection...
自主机器人正快速从实验室走向日常生活的各种场景,如道路、空中、仓储和太空。本文梳理并定义了机器人自主性的核心原则,指出机器人自主性已不再是纯学术研究,而是由感知、规划、控制等模块组成的一套完整的工程化系统方法论。
当自动驾驶、无人机和仓储物流机器人大规模量产时,行业急需一套标准化的系统架构。这篇文章更像是一份具身智能的系统级架构指南,明确划分了感知、决策、控制的边界,对于架构师设计可维护、高鲁棒的机器人软件栈极具参考价值。
Existing chunk-based Vision-Language-Action (VLA) models execute a fixed number of actions (i.e., execution horizon) before replanning, turning replanning into a task-agnostic periodic schedule that i...
现有的基于块(Chunk-based)的VLA模型通常在执行固定数量的动作后进行重新规划,导致重新规划变成了死板的周期性任务。本文提出伯努利延续策略学习,使模型能够根据当前状态的稳定性自适应地决定继续执行还是重新规划。
VLA模型如果每隔0.5秒就硬性切断动作重新思考,不仅算力浪费严重,机械臂动作还会有卡顿感。这种基于伯努利概率的自适应执行时域机制,让机器人能够根据环境动态变化自主决定何时“动脑”何时“动手”,极大优化了端侧的推理效率。
We introduce the Infinite SLAM Transformer (SLAMFormer-$\infty$), the first geometric transformer capable of supporting both long-range frontend and backend processing without an explicit distance bou...
本文提出了无限SLAM Transformer(SLAMFormer-$\infty$),这是首个能够同时支持长距离前端和后端处理且没有明确距离界限的几何Transformer。该方法有效突破了传统SLAM在处理大规模、无边界场景时的算力瓶颈。
传统SLAM在开阔大场景(如露天矿区、大型物流园)跑久后会出现严重的累计误差和内存爆炸。Transformer在SLAM前后端的统一无界应用,为大场景下的高精度建图提供了新思路,非常契合目前爆发的自动驾卡车和室外配送机器人的刚需。
Humanoid robots have the potential to perform dexterous manipulation in human environments, yet acquiring diverse and generalizable skills remains costly due to expensive hardware data collection and ...
人形机器人在执行灵巧操作时,获取多样且泛化能力强的技能成本极高。RoboReact通过利用生成的第一人称视角视频,从中蒸馏出具备推理能力的操作技能,从而使人形机器人实现更具适应性的全身操作。
在真机上采数据太贵也太慢,利用生成式AI造数据来训练具身智能是大势所趋。通过把生成的第一人称视频蒸馏成机器人的反应式技能,跳过了物理仿真的限制,为人形机器人低成本快速获取泛化操作技能提供了一个极具性价比的新数据飞轮。
The development and testing of advanced aerial robots require experiments in controlled environments with tailored airflow profiles. This paper presents an online learning algorithm for controlling th...
无人机等高级空中机器人的研发与测试通常需要在受控环境及特定气流分布下进行。本文提出一种在线学习算法来动态控制风洞气流分布,使研究人员能够为无人机模拟出更真实、多变的风场环境,极大提升了飞行控制算法的测试效率。
无人机在城市场镇复杂的风切变中极易失控坠毁。这项研究通过在线学习动态模拟风洞气流,让无人机抗风控制算法的验证不再受制于老天爷的脸色,为eVTOL(电动垂直起降飞行器)和城市配送无人机的极端环境安全性测试提供了刚需工具。
Accurate extrinsic rotation calibration between sensors is fundamental to the performance of robotic perception systems. However, most existing calibration techniques rely on full 6-DoF motion to exci...
传感器之间的精确外参旋转标定是机器人感知系统的基础,但大多数现有技术依赖完整的六自由度(6-DoF)运动来激发约束。本文提出PLS-Calib框架,利用偏最小二乘法(PLS),在仅具有地面运动约束(如平面移动机器人)的情况下实现事件相机与里程计的高效标定。
对于在平整地面上跑的轮式机器人或扫地机来说,传统的六自由度联合标定往往大材小用且容易引入误差。PLS-Calib针对地面运动约束场景特化了标定流程,不仅降低了数据采集要求,还能提高自动驾驶中的低速物流机器人多传感器融合精度。
Recent data-driven methods for synthesizing 6-DoF grasp poses use generative models to learn complex grasp pose distributions and generate diverse candidate poses. In particular, SE(3)-equivariant flo...
现有的数据驱动6自由度抓取姿态合成方法多采用生成模型来学习复杂的分布,但推理步数多、速度慢。GraspMeanFlow引入SE(3)等变MeanFlow架构,能够在极少的步数内生成高质量且具备物理合理性的6自由度抓取姿态。
在真实抓取场景中,机械臂如果思考时间过长就会显得极度迟钝。SE(3)等变MeanFlow这种少步长生成架构,将抓取姿态生成速度提升到了工业级可用的毫秒级,非常契合高节拍分拣产线和高速物流抓取场景。
Motion priors provide powerful guidance for learning naturalistic humanoid behaviors. However, existing methods typically learn a general, task-agnostic prior from the entire reference dataset and app...
运动先验为学习自然的人形机器人行为提供了强大指导,但现有方法通常从整个参考数据集中学习与具体任务无关的普遍先验。本文提出学习上下文感知的运动先验,使机器人能够根据不同任务和环境自适应调整运动模式,显著提升了动作的自然度与泛化能力。
人形机器人如果只会一套刻板的走路姿势,很难适应复杂多变的人类生活场景。引入上下文感知机制后,机器人能在搬重物、走泥路或下楼梯时切换不同的步态先验,这显著降低了强化学习在训练复杂全身协调动作时的探索空间。
Vision-Language-Action (VLA) policies promise general robotic manipulation, but their robustness against physical-world attacks remains fragile. In particular, we show that physically realizable adver...
视觉-语言-动作(VLA)策略具备强大的泛化操作能力,但面对物理世界的对抗攻击时极其脆弱。本文研究了物理上可实现的对抗性扰动(如恶意贴纸或特定光照)如何劫持VLA模型的注意力,并提出结构感知的鲁棒微调框架来防御此类攻击。
只要在环境里贴一张特定图案的贴纸,就能让大模型驱动的机器人把苹果当成炸弹放下,这就是可怕的物理对抗攻击。在机器人真机大面积铺开之前,研究这种防“注意力劫持”的鲁棒微调技术,是防止产线和家庭场景被恶意破坏的安全底线。
This story originally appeared in The Algorithm, our weekly newsletter on AI. To get stories like this in your inbox first, sign up here. Humanoid robots usually elicit more cringe than awe: They stum...
随着人形机器人逐渐摆脱早期的笨拙,美国正考虑将AI保护主义政策扩展至机器人领域,以确保在硬件制造和技术上的领先地位。
政策层面的风吹草动对供应链影响极大,如果美国真的对机器人核心零部件(如谐波减速器、伺服电机)挥舞关税大棒,国内的机器人出海逻辑可能会被迫从产品输出转向资本和产能的本地化布局。
In robot teleoperation, haptic feedback can be used to help human operators accomplish dexterous manipulation tasks. However, existing haptic feedback methods try to replicate high-fidelity sensory ha...
在机器人遥操作中,触觉反馈虽能协助操作者完成灵巧任务,但传统方法往往试图完全复刻高保真的底层物理感知,导致信息过载。本文提出语义触觉反馈机制,通过将复杂的触觉信号转化为易于理解的语义事件(如“接触”、“滑动”),大幅减轻了操作者的认知负担。
让操作员带上VR手套感受机械臂捏碎鸡蛋的微小力反馈,很容易造成人类大脑信息过载并导致误操作。将死板的物理力转化为“抓紧/打滑”这类语义级别的触觉反馈,是降低遥操作培训门槛、提升高危场景(如排爆、核电维护)远程作业成功率的关键创新。
Learning generalizable robot manipulation policies requires large-scale and diverse demonstration data. Egocentric human manipulation videos offer rich scene and task diversity, and prior work has sho...
学习具备泛化能力的机器人操作策略需要海量多样化的演示数据。本文提出 Ego2Robot,利用人类第一人称视角的操作视频,通过数据合成转化为机器人可用的大规模演示数据集。
机器人示范数据采集成本极高是具身智能落地的拦路虎。第一人称视频数据量大且场景丰富,如果能低成本转化成机器人的训练动作库,意味着我们可以用极低的边际成本喂出泛化能力更强的策略模型。
World Action Models (WAMs) augment robot policies with action-conditioned predicted futures, but a plausible future alone does not justify changing the action that a bimanual policy would execute. We ...
世界动作模型(WAM)可以通过预测未来辅助机器人策略,但仅凭合理的未来预测并不足以改变双臂策略的动作执行。本文提出 CoWAM,引入协调契约机制来实现对策略的选择性干预。
这相当于给机器人的 WAM 加了个“安全阀”。不是所有预测到的未来都需要干预,CoWAM 提供了一种约束机制,避免模型因为过度脑补而打乱双臂协同的既定节奏,对需要高稳定性的双臂装配场景很实用。
Quadruped robots are a promising platform for search and rescue missions because they can navigate cluttered indoor environments that may be restrictive for wheeled systems. However, in unknown rescue...
四足机器人在搜救任务中具有优势,但在未知灾难环境中决定探索方向很困难。本文提出一种态势感知前沿优先级排序方法,帮助四足机器人在复杂废墟中更智能地决定下一步的探索目标。
四足机器人下楼梯已经见怪不怪了,现在行业竞争的焦点是自主探索决策能力。这项工作把态势感知引入到 SLAM 的 frontier 探索中,意味着搜救机器人能像老消防员一样根据现场危险程度挑路走,而不是无头苍蝇乱撞。
Action chunking---predicting and executing multiple actions instead of a single action---has proven to be a critical component for learning effective robotic control policies. However, our precise und...
动作分块(Action Chunking,预测并执行多个动作而非单一动作)已被证明是学习机器人控制策略的关键组件。本文深入剖析了其背后的机理,解释了为什么这种方法能有效提升行为克隆(BC)的性能。
操作机器人或者自动驾驶的工程师对 Action Chunking 应该不陌生,大家平时都在当 trick 用。这篇论文从底层把机理扒透了,搞懂这个有助于我们在训练新策略时更合理地设计动作频率和 Chunk 大小,而不是盲目调参。
Reachability analysis for visuomotor policies is difficult because large visual encoders make end-to-end set propagation computationally expensive and excessively conservative. We therefore freeze the...
视觉运动策略的可达性分析很难,因为庞大的视觉编码器导致端到端计算极其昂贵。本文通过冻结视觉骨干网络,并提出基于集合的训练方法,实现了对策略动作输出的概率验证。
深度学习控制策略一直是“黑盒”,在工业部署最大的阻碍就是没法做形式化验证。这项研究巧妙绕开了视觉模型的巨大计算量,提供了一种能够给出概率安全边界的方法,让视觉策略在安全苛求系统中的应用看到了曙光。
In this paper, we propose a new robust navigation framework for path following tasks in robots operating within unknown, cluttered environments. Our approach ensures reactive safety through obstacle a...
本文提出了一种新的鲁棒导航框架,用于在未知、杂乱环境中进行路径跟随的机器人。该方法通过障碍物回避机制确保反应性安全,并生成一个安全“管道”来保证路径跟随的鲁棒性。
传统的全局规划在窄门或密集障碍物场景容易卡死。生成一个动态的安全管道来包裹机器人轨迹,是一种非常务实的控制论回归,对做仓储物流或室内服务机器人的工程师来说,提供了一种计算效率和安全性兼顾的底裤方案。
Vision-Language-Action (VLA) models excel in robotic manipulation but suffer catastrophic performance drops when canonical instructions are simply paraphrased. Although this brittleness is typically a...
视觉-语言-动作(VLA)模型在机器人操作中表现出色,但稍微改写一下指令就会导致性能断崖式下降。本文提出接地语义重新绑定方法,解决 VLA 模型对自然语言指令改写极其脆弱的问题。
这是一个极其典型的具身智能痛点:模型听懂了“拿苹果”,但听不懂“把那个红的给我”。这说明底层语义和动作特征的 grounding 还没真正打通。做 C 端机器人的必须关注这类工作,否则用户的自然语言交互体验会极其糟糕。
Organisms contain diverse, sensorimotor parts across size scales and rapidly adapt to new environments, while machines contain only inert materials at smaller scales and struggle with surprise. We hyp...
生物体在不同尺度上具有多样的感觉运动部件并能快速适应新环境,而机器在微观尺度上仅由惰性材料组成,难以应对意外情况。本文假设并验证了通过在机器内部引入形态多样性可以提升其环境适应能力。
软硬件协同进化(Embodied AI 的核心)正在颠覆传统的纯算法驱动思路。相较于死磕单一形态的超级控制器,赋予机器人不同尺度的形态与传感多样性,可能是解决其在未知极端环境下鲁棒性不足的破局点。
Humanoid motion trackers perform reliably within learned tracking distributions, but falls can move the robot into low-height, contact-rich states from which an advancing command is temporarily unreac...
人形机器人运动跟踪器在已学习的分布内表现良好,但摔倒后会进入难以恢复的低高度、富接触状态。本文提出 StableMimic,让机器人学习超越正常分布的结构化行为,实现平滑、类人的摔倒后恢复动作。
人形机器人现在最大的笑话就是走平地都会莫名其妙劈叉摔倒。从控制学上讲,摔倒后的恢复比保持平衡更难,这项研究专门针对越界状态做结构化修复,是解决人形机器人实机演示翻车尴尬的刚需技术。
World Action Models (WAMs) couple robot action prediction with video world models. Existing WAMs with shared-backbone and Mixture-of-Transformers designs generally tie the depth of the action module t...
现有的世界动作模型(WAM)通常将动作模块与共享主干的深度绑定。本文提出 Faster-WAM,探讨并验证了动作模块不需要那么深,从而在保持性能的同时大幅提升了 WAM 的推理速度。
实机控制对延迟的容忍度极低,超过几十毫秒机器人的动作就会生硬甚至失衡。Faster-WAM 证明做动作预测不需要堆叠深层 Transformer,这就为在边缘设备上部署 WAM 腾出了巨大的算力空间,很具工程价值。
Humans perform long-horizon manipulation by retaining knowledge of what earlier actions have established while continuously adapting the motion underway. By contrast, action-chunked vision-language-ac...
人类在执行长视野(多步骤)任务时能记住之前的进度并持续调整。本文提出 ChainVLA,通过统一的执行状态链接 VLA 模型的查询,克服了动作分块导致的长时任务记忆和连贯性不足的问题。
目前的 VLA 做两步以内的任务还行,要像人一样连续做个煎蛋就全线崩溃。ChainVLA 引入执行状态机把长任务串起来,这是具身智能从实验室玩具走向真正家政服务机器人的必经之路,长程规划能力比单点动作精度更关键。
Traversability analysis is a fundamental capability for autonomous mobile robots operating in unstructured environments. While modern machine learning approaches such as deep neural networks and gradi...
通行性分析是非结构化环境移动机器人的基本能力。现有的深度学习等方法往往计算重且不可解释。本文利用 KAN(柯尔莫哥洛夫-阿诺德网络)提出 TravKAN,实现了快速且具备可解释性的非线性地形通行性分析。
纯黑盒深度学习在野外复杂地形的泛化能力一直被诟病。KAN 作为最近火爆的可解释网络架构,用到地形分析上能清晰看到决策面是怎么生成的,对于需要做工程交付的算法工程师来说,这种能讲清楚为什么翻车的模型更受青睐。
State estimation is a key component in model-based control of walking robots and, more broadly, applicable wherever hidden variables must be inferred. The Kalman filter is widely used to estimate floa...
状态估计是足式机器人控制的关键,但传统卡尔曼滤波难以应对动态变化。本文提出一种基于残差的自适应卡尔曼滤波方法,更准确地估计机器人的浮动基座状态和隐藏变量。
足式机器人脚打滑时的状态估计一直是硬伤,特别是关闭触觉传感器或者在不平整地面狂奔时。把残差机制做成自适应模块来动态调参,比手调噪声协方差矩阵靠谱得多,是直接能提升机器人步态稳定性的底层硬核优化。
Existing active reconstruction systems with Gaussian-splatting maps select observations greedily, optimizing a single next-best-view (NBV) at each step and connecting the chosen views by short-horizon...
现有的基于高斯泼溅的主动重建系统采用贪婪策略选择下一个最佳视角(NBV),缺乏全局规划。本文提出 TRACE,利用遍历轨迹优化,使得机器人的运动轨迹不仅考虑视野覆盖,还兼顾了整体的重建效率。
现在搞 3D 建模或者 NeRF / 3DGS 的团队很多都在用贪心策略扫图,结果就是机器人在原地反复横跳。把信息论和轨迹动力学联合优化是做大规模场景重建(比如数字孪生)必须要啃下的工程难点,这篇文章的思路非常落地。
Agriculture 4.0 robotic systems improve field efficiency yet remain too capital-intensive for the fragmented smallholdings that dominate global agriculture. Meanwhile, a growing number of retired low-...
农业 4.0 机器人系统效率高但资本密集,小农户难以负担。本文利用退役的低速电动车组件(二次寿命)制造农业机器人,并部署了无需 NMS(非极大值抑制)后处理的端侧杂草检测模型,降低了硬件和计算成本。
在农业这种对成本极其敏感的赛道,用退役电车电池和轻量化端侧算法做降本增效才是王道。这种基于旧硬件的再制造思路在欧美或发展中国家的小农场市场可能比高精尖的自动驾驶拖拉机更有商业爆发力。
Mobile manipulation is a key capability for embodied intelligence, enabling robots to accomplish complex multi-stage tasks in open-world environments. However, mobile manipulation poses two key challe...
移动操作是具身智能的关键能力,但面临移动和操作分离的挑战。本文提出全景感知的 VLA 模型,并结合全身遥操作技术,使机器人能够在开放世界环境中完成复杂的移动操作任务。
轮式底盘+机械臂的简单拼接时代要结束了。全身协调控制让底盘移动和手臂抓取不再互斥,这意味着仓储搬运、家庭服务等场景下的机器人能大幅缩减任务耗时。另外,高质量的全身遥操作数据也是训练端到端 VLA 的核心数据源。
In Robot Operating System 2 (ROS 2), Data Distribution Service (DDS) participants must discover one another before exchanging data. In wireless environments, delayed or lost discovery messages cause r...
在 ROS 2(机器人操作系统2)中,DDS(数据分发服务)节点必须在交换数据前互相发现。本文针对无线网络中发现消息延迟或丢失导致网络风暴的问题,提出了一种改进的 ROS 2 发现模型。
搞多机器人协同的工程师对 ROS 2 在差网络环境下的 DDS 发现机制肯定一堆吐槽,动不动就因为丢包导致节点失联或者广播风暴。这篇论文算是精准踩中了野外或工业无线场景下多机组网的痛点,值得在部署前参考避坑。
Visual representations of VLA models remain unreliable for spatially precise robotic manipulation. We uncover that vision encoders in VLAs also exhibit attention artifacts previously documented in gen...
视觉-语言-动作(VLA)模型在执行需要高空间精度的机器人操作时,视觉表征能力依然不可靠。研究发现 VLA 的视觉编码器存在与通用大模型类似的注意力伪影,本文提出一种自适应视觉细化方法来解决这个问题。
现在的 VLA 模型做粗活没问题,但一旦涉及到插拔、对齐这种毫米级的精细操作就歇菜。这项工作指出了底层视觉编码器本身的注意力缺陷,相当于给机器人专门配了一副“老花镜”,对提升精细操作的可靠性很有启发。
Whole-body tactile sensing is a prerequisite for humanoids that operate in contact-rich human environments, but conventional taxel arrays scale poorly with surface area, wiring complexity, and robot-s...
全身触觉传感是人形机器人在富接触人类环境中运行的前提。传统的触觉传感器阵列在扩大表面积时会面临布线复杂和尺寸缩放性差的问题。本文利用 3D 打印技术制成保形 EIT(电阻抗断层成像)皮肤,解决了几何扩展难题。
想让机器人给人搓背或者做看护,没触觉是绝对不行的。传统传感器贴满全身的布线成本是灾难。EIT 加 3D 打印这种非传统方案如果能量产,会直接解锁人形机器人在柔顺接触和力控任务上的封印,硬件感知层的突破往往先于算法。
Developing deployable locomotion policies through conventional reinforcement learning often requires complex reward engineering and expensive training times. While differentiable simulation offers a h...
通过传统强化学习开发可部署的四足运动策略往往需要复杂的奖励工程。本文发布 Open-DiffLoco,一个开源框架,利用可微物理仿真来学习四足机器人的运动控制,降低了训练难度和时间。
这是四足机器狗开发者的福音。用可微仿真直接把梯度算进物理引擎,省去了调 RL 各种奇葩 reward function 的痛苦。开源出来意味着又有一批初创公司可以白嫖底层运动控制算法,加速国产机器狗的价格内卷。
Cross-embodiment dexterous grasping aims to synthesize stable grasps across heterogeneous multi-fingered hands with little or no embodiment-specific tuning. Existing interaction-centric methods achiev...
跨形体灵巧抓取旨在无需针对特定机械臂进行大量微调即可生成稳定抓取。本文提出 MANGO-Grasp,利用基于几何定向 3D 高斯分布构建的马氏距离场,实现了跨不同多指机械手的通用抓取策略。
以前抓取算法换个三指夹爪就得重新炼丹,MANGO-Grasp 直接做跨硬件本体的泛化,切中了硬件形态碎片化的痛点。对于做通用具身大模型的团队来说,这种 cross-embodiment 能力是实现“一套模型控制万物”的底层门票。
Your next drive-thru order might be taken by a bot. And you might not even notice.
AI语音机器人正在快速接管快餐店的免下车订餐通道,客户在点餐时甚至可能察觉不到对面是AI。
相比造人形机器人,语音交互+POS系统的纯软件AI部署成本极低,快餐巨头们显然已经算清了这笔账,用AI替代最低时薪的接线员是目前回本最快的AI应用之一。
This work presents a human-centered collaborative framework that integrates Preference-Based Optimization (PBO) and Dynamic Movement Primitives (DMPs) to optimize robot-assisted tasks such as painting...
本文提出了一种以人为中心的人机协作框架,结合了基于偏好的优化(PBO)和动态运动原语(DMPs),以优化机器人在绘画等辅助任务中的表现,使机器人能自适应地学习人类的偏好。
这把 DMP 这种老牌的轨迹生成方法和现代机器学习结合起来。在人机交互中,没有明确指标的“感觉好”很难量化,偏好学习让机器人理解人的主观审美,这在康复理疗或服务机器人领域有很强的商业转化潜力。
We propose OC-VLA++, an extension of OC-VLA for viewpoint generalization under limited camera coverage. While OC-VLA grounds robot actions in the camera coordinate system to align action supervision w...
针对相机视野受限导致泛化能力差的问题,提出OC-VLA++,利用单目几何引导实现跨视图一致性,让机器人在摄像头角度变化时依然能稳定执行动作。
过拟合单一相机视角是目前VLA模型的通病,换个机位就变智障。OC-VLA++利用单目几何约束来统一不同视角,这给那些需要灵活部署临时摄像头的仓储物流场景提供了一个很低成本的解决方案。
Musculoskeletal robots require an internal body schema that remains consistent under a wide range of physical state changes, including abnormalities such as muscle rupture and actuator jamming. Conven...
仿生肌肉骨骼机器人需要内部身体图式来应对物理状态变化。本研究利用扩散模型学习身体图式,使其在遇到肌肉断裂或致动器卡死等异常时依然能够自适应运动。
硬件受损还能继续运动,这是传统刚体机器人做不到的。将扩散模型用在自我身体认知上,为人形机器人在高危复杂环境(如深海或灾区救援)的容错运行提供了新思路。
Deploying Vision-Language-Action (VLA) robots as mobile edge nodes within wireless sensor networks (WSNs) requires robust protection against physical adversarial threats. We present VLAGuard, a framew...
针对部署在无线传感网中的VLA机器人,提出VLAGuard框架,专门用于防御物理对抗性威胁,防止机器人的注意力被恶意劫持。
当VLA模型开始接管移动机器人,黑客只需要在环境里放一张特定的贴纸,就可能让机器车开错路。VLAGuard填补了具身智能在物理对抗层面的安全空白,对安防巡逻机器人的商业落地是刚需。
Robot Task and Motion Planning (TAMP) algorithms enable autonomous operation by incorporating the specific functions and constraints of end-effector tools, such as grippers or soldering irons, directl...
传统的任务与运动规划(TAMP)直接将末端执行器(如夹爪)的功能纳入算法。本研究引入基于采样的视觉可见性规划,确保机器人在执行任务时能始终“看到”操作目标。
很多机器人抓取失败不是算法不行,而是手挡住了摄像头。把视觉死角提前纳入任务规划里去求解,能极大提升复杂抓取任务的一次成功率,对柔性制造产线上的工件搬运很有借鉴意义。
Kinematic models provide reliable motion constraints for odometry estimation in featureless environments, where exteroceptive sensing degrades and IMU integration drifts. Learning-based kinematic mode...
在缺乏特征的环境中,传统的里程计估计容易失效。提出KING,利用基于运动学约束的图神经网络(GNN),统一了足式和轮式机器人的运动表征。
把物理运动学先验直接嵌进GNN里,不仅解决了长隧道里激光雷达失效的问题,还能让一套代码同时兼容狗(足式)和车(轮式)。对于做多形态机器人底层底盘控制的开发者来说,这能省下大量重写算法的功夫。
Adapting a pretrained vision-language-action (VLA) policy to a new robot usually assumes embodiment-specific demonstrations. This assumption is especially restrictive for custom robots whose morpholog...
将预训练的视觉-语言-动作(VLA)策略适配到新机器人通常需要大量人类示教。本研究提出通过强化学习(RL)进行Bootstrapping,降低了对新形态机器人示教数据的依赖。
以前让机器狗用上VLA大模型,你得先教它几百遍。现在用强化学习让模型在仿真环境里自己摸索,大幅度抹平了跨具身形态迁移的数据门槛,这是具身大模型走向千行千机的关键技术节点。
Existing 6-DoF grasp detectors typically rank grasp candidates by detector confidence. However, our analysis on GraspNet-1Billion shows that detector confidence is often poorly aligned with grasp qual...
现有的6自由度(6-DoF)抓取检测器通常根据置信度来排序抓取动作。但分析表明,这种置信度与实际抓取质量往往不符。GraRe方法在不改动原模型的情况下,对抓取候选进行重新排序。
这套方案给做机械臂抓取的工程师提供了一个“补丁”。不需要花大价钱重新训练庞大的6-DoF模型,直接用一个轻量级的外挂排序模块就能提升实际抓取成功率,性价比极高。
Off-road mobility requires autonomous mobile robots to generalize across heterogeneous vehicle fleets and continuously changing terrain conditions. Existing cross-vehicle adaptation approaches general...
自动驾驶越野需要适应不同车辆车队和不断变化的地形。VertiAKD提出一种自适应动力学方法,专门解决车辆在垂直极具挑战性地形上的跨平台泛化问题。
越野自动驾驶最难的不是平地跑,是过台阶和坑洼时的车辆俯仰控制。这种跨车型的自适应动力学设计,对于矿区无人驾驶和农用自动机械的规模化部署具有直接的工程指导价值。
Bicycle robots are fast and energy efficient, but their simple mechanical design and their underactuated and non-holonomic dynamics make highly agile maneuvers difficult to achieve. Here, we use Reinf...
自行车机器人速度快且节能,但其欠驱动和非完整约束动力学使得高敏捷动作难以实现。本研究利用强化学习,成功让自行车机器人完成了高难度的杂技级动作。
平衡自行车在物理上极度不稳定,用强化学习能搞定这种欠驱动系统,意味着未来主打低成本、高能效的两轮派送机器人或通勤工具真的有戏。技术下限被进一步刷新了。
Microrobots hold significant potential for various applications, where targeted navigation is a basic requirement. Deep reinforcement learning (DRL) has recently emerged as a powerful paradigm for ful...
微型机器人的定向导航是一项基本需求。深度强化学习(DRL)虽能实现全自动导航,但训练耗时。本研究提出一种极速训练机制,将微型机器人的导航训练时间压缩至分钟级。
把强化学习训练时间从几天压到几分钟,意味着微型机器人可以在人体内(如靶向送药)或复杂微环境中边适应边训练。这种实时进化的能力是微型机器人走出实验室的前提。
We present an autonomous robotic portrait-generation system combining real-time face detection, AI-based sketch generation, and robotic drawing. The system captures video frames, extracts facial regio...
展示了一个结合实时人脸检测、AI素描生成和机器人绘制的自主机器人肖像生成系统。系统通过提取面部特征,分阶段完成感知与动作执行,实现机器人的自动化绘画。
这不仅仅是画个画,它演示了一个经典的VLA拆解流水线。对于开发迎宾、展销等商用服务机器人的团队来说,这种高延迟容忍度的多阶段架构非常值得借鉴,比纯端到端更容易调试和落地。
FastSAC-style methods significantly reduce humanoid motion training time but often suffer from notable performance degradation compared with PPO in whole-body tracking tasks. We target this speed-perf...
现有的FastSAC-style方法虽能缩短人形机器人训练时间,但在全身追踪任务上性能不如PPO。本研究提出结构化专家混合模型,兼顾了训练速度与全身控制的稳定性。
搞人形机器人的都知道,PPO训得好但太慢,SAC快但在全身控制上容易抖动崩盘。这个结构化MoE的思路巧妙化解了速度与性能的矛盾,对于加速人形机器人步态迭代节奏有着直接的推动作用。
Dynamic manipulation requires robots to infer target motion and respond promptly, yet existing World-Action Models (WAMs) typically condition only on the current frame and execute large backbones sync...
动态抓取要求机器人能推断目标运动并快速响应。现有WAMs通常只依赖当前帧且模型庞大导致延迟严重。DynamicWAM引入双路径运动条件化,提升了对动态目标的操作成功率。
要抓传送带上的东西或者移动中的物体,传统视觉伺服延迟太高。双路径的WAM把运动趋势先编码进去,让大模型有了预判能力。这对于分拣线和动态接抓场景的工程化是个不错的突破口。
Safe navigation under uncertain time-dependent blockage requires anticipating observations before committing to motion. We present StochSIPP, an exact contingent planner for temporal roadmaps with unc...
在时间依赖且存在阻挡的不确定环境中,安全导航需要在移动前预测观察结果。StochSIPP提出一种针对时间路线图的确切 contingent 规划器,解决随机动态障碍物下的路径规划难题。
移动机器人在人流密集的商场或医院里经常被路人卡死。StochSIPP加入了概率预测机制,这比单纯的DWA避障要聪明得多,能显著减少机器人在动态复杂环境中的死锁和原地等待时间。
ORCESTRA is a mixed-reality system for programming robot digital twins through no-code waypoint teaching and language-guided control. In a passthrough mixed-reality workspace, users place robot twins ...
ORCESTRA是一个混合现实(MR)系统,通过无代码航点教学和语言引导控制来对机器人数字孪生进行编程。用户可在MR工作空间中放置机器人孪生并直接下达指令。
终于有人把大模型、数字孪生和MR头显打通了。这意味着以后产线工程师不用写代码,戴着Vision Pro拽一拽航点就能给机械臂布置任务,具身智能的末端使用门槛被彻底打下来了。
Large language models are increasingly integrated into autonomous robotic systems for task planning and control, but this integration exposes them to prompt injection attacks that can lead to unsafe d...
大语言模型(LLM)被广泛用于机器人的任务规划,但也引入了提示词注入攻击的风险。攻击者可通过恶意指令劫持多机器人系统,导致不安全行为。
这绝对是LLM接入实体机器人后最致命的漏洞。如果有人对着迎宾机器人说一句特定咒语,就能让它撞向人群。所有做具身大模型集成的团队,现在必须把输入提示词的沙箱隔离提上日程了。
Viscous stains, characterized by high viscosity and complex rheological properties, remain a major challenge for robotic surface cleaning. Conventional wiping often spreads the stain, while scrubbing ...
清理粘性污渍是机器人清洁的巨大挑战,传统擦拭容易扩大污染区域。Push-Wiper采用分段推动轨迹,让机器人能够适应不同粘度和表面材质,实现通用清洁。
擦桌子这种人类觉得简单的动作,对机器人其实极其复杂。Push-Wiper根据流体特性改变推动轨迹,为商用清洁机器人在餐厅、工厂处理顽固黏性污渍提供了切实可行的解法。
World Action Models (WAMs) improve robot policy learning by jointly modeling actions and future observations. However, conditioning future prediction only on the task prompt and observation context ri...
世界动作模型(WAM)通过联合建模动作和未来观测来改进机器人策略学习。本文提出SelfWAM,解决了以往仅依赖任务提示和观测上下文进行未来预测时存在的 grounding(接地/对齐物理世界)不足的问题,提升了模型在快速机器人控制中的准确性和鲁棒性。
单纯靠语言提示和视频预测来控制机器人容易产生“幻觉”,导致动作偏差。SelfWAM 把物理状态的自接地机制引入 WAM,对做高频实机控制的工程师来说是个很实用的优化方向,能显著缩小仿真到现实(Sim2Real)的差距。
Motion planning in dynamic environments is a fundamental problem in robotics, aiming to generate safe and efficient paths, trajectories, or control actions in the presence of moving obstacles, uncerta...
动态环境中的运动规划是机器人学的基本问题,旨在有移动障碍物的情况下生成安全路径。本文是一篇综述,全面探讨了基于学习的运动规划算法,从基础的经典方法到最新兴的端到端学习范式。
这是一篇很好的扫盲和选型指南。特别推荐做自动驾驶或复杂室内导航的从业者阅读,现在基于 Transformer 的端到端导航正当红,但这篇文章能把基于搜索、强化学习和端到端模仿的边界讲清楚,避免盲目跟风。
Sequential robot manipulation requires policies to execute novel combinations of familiar instruction components. However, collecting demonstrations for all possible instruction tuples is combinatoria...
机器人长序列操作要求策略能够执行熟悉指令的新颖组合,但穷举所有指令组合来收集数据是不现实的。本研究提出了一种诊断方法,用于系统评估和提升机器人在面对未见过的指令组合时的泛化执行能力。
现在的机器人策略往往是死记硬背,换个组合就废了。这个研究抓住了大模型在工业落地时最痛的'组合泛化'问题,给出的诊断方法可以作为评测各家 VLA 模型泛化底色的试金石。
Flexible manufacturing requires rapid deployment of solutions and minimal setup time to remain competitive. An essential attribute is the ability to control error levels, as failures can range from mi...
柔性制造需要快速的部署方案和极低的设置成本,其中精确控制错误率至关重要。本研究提出一种基于错误边界的自监督学习引导方法,并在机器人的插拔(轴孔装配)任务中验证了其对错误级别的有效控制能力。
插拔任务是工业制造中最常见也最耗时的装配环节。用自监督去搞还能严格卡住错误边界,这正是自动化产线工程师最爱的方案,比纯强化学习更能保证下限,具备直接上产线的潜力。
The demand for humanoid loco-manipulation tasks with an object has recently increased, and most existing control approaches for stability in such tasks rely on heuristics or machine-learning technique...
随着人形机器人在搬运等任务中的需求增加,现有的基于启发式或机器学习的控制方法难以在负重时保持稳定。本文对人形机器人在搬运重物时的稳定性与提升过程进行了深入的动力学权衡分析,并提出了新的控制策略。
人形机器人目前都在卷双足行走,但能不能负重搬东西才是进厂干活的刚需。这篇论文直击负载情况下的重心漂移痛点,对做重载人形机器人的公司来说是非常有价值的工程参考。
Visual imitation learning enables robots to acquire visuomotor skills directly from images, yet RGB observations lack explicit geometric cues, making learned policies brittle to camera perturbations. ...
视觉模仿学习让机器人能直接从图像中学习技能,但 RGB 图像缺乏显式几何线索,导致策略对相机视角的微小扰动极其敏感。RayViT 引入射线条件的视觉表示方法,使模型对相机视角的变化具有更强的鲁棒性。
真机部署时,相机稍微磕碰一下或者支架松动导致策略失效,是机器人公司售后维护的噩梦。引入射线条件做几何约束,相当于给纯视觉策略加上了一层空间锚点,能大幅降低产线维护成本。
Reinforcement learning (RL) post-training of Vision-Language-Action (VLA) models has shown strong promise for robotic manipulation. Among RL methods, critic-based approaches rely on a value estimator ...
对视觉-语言-动作(VLA)模型进行强化学习后训练在机器人操作中前景广阔,但传统的基于评论家(Critic)的方法依赖庞大的价值估计网络,计算成本极高。WCM 提出了一种全新的世界评论家模型,显著提升了强化学习的效率。
RLHF 让大语言模型脱胎换骨,但现在给 VLA 模型做 RL 却卡在算力爆炸上。WCM 这种精简评论家网络的设计,提供了一条降低强化学习显存和计算占用的可行路径,值得关注。
Vision-language-action models (VLAs), which leverage the cognition of multimodal information to infer physical-world actions, provide a generalized solution for embodied AI applications. Conventional ...
视觉-语言-动作模型(VLAs)为具身智能提供了通用解决方案,但传统模型处理时序数据的计算开销巨大。FibVLA 采用创新的斐波那契采样策略,有效降低了时序建模的计算复杂度,提升了 VLA 的推理效率。
动作序列建模吃显存且慢是公认的问题。用斐波那契这种非均匀采样来压缩时序维度,如果真能在保持精度的同时大幅提速,对需要高频控制的机械臂来说是个好消息,意味着能上更便宜的算力板子。
This article presents a modular inference framework that integrates Flow Matching generative models with formal Control Barrier Function (CBF) safety guarantees. Unlike existing methods that apply ext...
该文提出了一个模块化推理框架,将流匹配生成模型与控制障碍函数(CBF)的安全保证相结合。不同于以往外部强加限制的方法,该框架在底层生成动作时就内置了严格的安全约束,确保 VLA 模型在执行时不会越界。
VLA 模型经常会出现幻觉动作,这在工业里是极其危险的。把控制障碍函数融进流匹配底层,等于在策略生成本身就焊死了安全围栏,这种数学上有保证的安全机制是机器人进厂必须要过的硬指标。
Manipulating transparent laboratory glassware that contains liquid is inherently safety-critical: even small geometric errors can cause unstable grasps and hazardous spillage. Although recent progress...
抓取装有液体的透明实验玻璃皿是一项安全关键任务,微小的几何估计误差就可能导致抓取不稳或危险品泄漏。TransGraspNet 针对透明材质的视觉感知难点,提出了一种在物理和几何上保持一致的抓取规划方案。
透明物体的深度估计一直是机器视觉里的老大难。针对实验场景抓玻璃器皿,虽然垂直细分,但解决了反光和折射的痛点。这套方案完全可以平移迁移到医药研发和生物自动化验室,商业壁垒很高。
Generating safe corridors is essential for collision-free robotic motion planning, yet most existing methods rely on predefined reference paths, which bias corridor geometry and implicitly limit the h...
生成安全走廊是确保机器人无碰撞运动规划的关键,但现有方法大多依赖预定义的参考路径,这会限制路径的拓扑多样性。本文提出了一种无需参考路径的同伦感知走廊生成方法,能够探索更丰富、更灵活的无碰撞运动轨迹。
传统路径规划经常因为初始参考线给得不好而卡死在死胡同。甩掉参考路径的依赖,直接生成多拓扑结构的安全走廊,这对复杂狭窄空间(比如核电站维护、救灾现场)的机器人避障非常有价值。
Cable-Driven Parallel Robots (CDPRs) are a type of parallel mechanism in which cables are used as actuators. Due to the two levels of redundancy and numerous constraints within the CDPR actuation, joi...
缆索并联机器人(CDPRs)利用缆绳作为驱动器,具有高度的冗余性和复杂的物理约束,导致关节控制极具挑战。本文提出了一种基于迭代学习的反应式控制方法,在三个空间维度上有效解决了这类机器人的精准操作问题。
缆驱机器人因为柔性强、工作空间大,在大型物流和建筑场景有潜力。这篇论文直面缆绳松弛和冗余带来的非线性控制难题,属于硬核的底层控制优化,对搞大型工业机械臂的团队有参考价值。
By relying on independent couplings from uninformative Gaussian priors, standard diffusion and flow matching models are forced to learn complex, high-cost vector fields to reach the physical action sp...
标准的扩散模型和流匹配模型依赖无信息的高斯先验,需要学习极其复杂的向量场才能生成物理动作。本文提出了一种历史初始化的动作生成时序策略,通过利用历史状态先验,大幅降低了模型的学习难度和计算成本。
当前很多扩散策略忽略了动作的时间连贯性,每次都从纯噪声开始去噪,太费算力。用历史动作做热启动初始化,是个非常典型的工程师式微创新,能用极少算力换取推理速度的翻倍提升。
The deployment of deep neural networks for visual affordance segmentation on wearable robots poses may prove critical, due to some conflicting aspects of the problem. On one hand, affordance segmentat...
在可穿戴机器人上部署深度神经网络进行视觉可供性分割面临算力瓶颈。本研究针对解码器模块进行了重点增强,设计出一种轻量级神经网络,在保持高精度分割的同时,满足了可穿戴设备的低功耗和实时性要求。
现在的机器人视觉模型动辄几十亿参数,但外骨骼和可穿戴设备根本带不动。这项工作把重点放在解码器上做轻量化,这是将 AI 推理塞进低功耗边缘设备的正确解法,做移动机器人的可以留意。
Different Length Alignment Sewing (DLAS), which involves stretching the shorter fabric to match the longer one and sewing them together in a straight line, is a challenging task that needs to satisfy ...
不同长度对齐缝纫(DLAS)需要将较短的面料拉伸以匹配较长面料并进行直线缝合,这在纺织自动化中极具挑战。本文提出了一种自动缝纫方法,解决了弹力面料在拉伸状态下的对齐和实时形变控制难题。
服装制造行业目前极其缺人,柔性面料操作是自动化最后的堡垒。能用机械手解决弹力拉伸对齐缝纫,说明机器人开始啃硬骨头了,这种技术一旦产品化,优衣库、申洲国际这种代工厂绝对会大笔采购。
Underwater robots combine complementary sensors whose reliability changes abruptly with water visibility, viewpoint, and vehicle motion. We introduce AquaJEPA, an action-conditioned joint-embedding pr...
水下机器人的各类传感器可靠性会因水质能见度、视角和运动产生剧烈变化。AquaJEPA 引入了一种动作条件的联合嵌入预测架构,能够有效融合多模态感知信息,从而更好地预测和适应复杂的水下动力学环境。
水下机器人最大的痛点就是传感器的信噪比极低,一会儿清楚一会儿糊。JEPA 这种不依赖像素重建而是提取特征表示的架构,天生适合处理这种输入缺失严重的恶劣物理环境,是海洋探测的福音。
Geometry-based grasp planners ensure physically valid grasps but ignore functional semantics, often generating grasps that are antipodal and collision-free yet practically inappropriate, for example, ...
基于几何的抓取规划器虽然能保证物理上的稳定,但往往忽略功能性语义,导致抓取位置不合常理(如直接抓着水杯边缘倒水)。SAGP 结合视觉语言模型(VLM)进行粗略区域推理,生成了既安全又符合使用习惯的抓取姿态。
以前教机器人抓东西只管不掉,现在得教它怎么抓好用。比如递剪刀要抓刀刃而不是刀把,把 VLM 的常识推理引入抓取规划,是让机器人在生活场景中从能动走向能干的核心一步。
Reliable robot learning requires a world simulator that can predict action consequences before execution on physical hardware, including risky and failure-prone outcomes. Existing physics simulators r...
可靠的机器人学习需要在真机执行前拥有一个能预测动作后果(包括危险和失败状态)的世界模拟器。现有物理引擎要么成本太高要么保真度不足,BWM 提出了一种低成本且高保真的世界模拟器方案,加速了策略的试错与迭代。
在纯数字世界里做试错训练是目前机器人的标配,但模拟器和真实物理世界之间存在巨大的现实鸿沟。一个又便宜又逼真的世界模型,直接决定了具身智能公司的研发效率,这是基础设施级别的基础设施。
Action chunking shortens the effective decision horizon of robot imitation learning by predicting multiple future actions, while conventional phase conditioning describes the current control instant. ...
动作分块通过预测多个未来动作来缩短决策周期,而传统相位条件仅描述当前控制时刻。TRACT 提出了具有时间相位权限的暂态路由动作块方法,有效解决了机器人在富接触操作中的轨迹平滑和连续控制问题。
操作硬物时的接触力突变是机械臂最容易宕机的时候。这种将动作分块与时间相位权限结合的方案,解决的是高频控制下的末端抖动问题,对打磨、抛光这种需要精细力控的工业场景极具落地价值。
Fixed Cartesian impedance makes contact-rich teleoperation demonstrations practical, but gains that secure progress and contact support also determine impact and force variability. We study single-dem...
固定的笛卡尔阻抗让富接触遥操作变得可行,但为了维持接触而调大的增益往往会增加撞击力和受力突变。本研究针对单臂遥操作提出了一种任务流形阻抗重定向方法,在保证任务推进的同时,显著降低了多余的物理冲击。
主从遥操作现在广泛用于高危场景和医疗手术,但操作员经常因为力反馈抖动而手忙脚乱。这项研究通过动态调整阻抗,缓冲了碰撞瞬间的刚性冲击,这不仅保护了机械臂,也极大减轻了操作员的疲劳感。
Although world-action models (WAMs) enhance long-horizon robot control by predicting visual evolution before acting, long-horizon reliability demands repeated re-grounding in real observations--not re...
世界-动作模型(WAMs)通过在执行动作前预测视觉演变来增强长时序机器人控制。本研究提出一种无需训练的异步反馈机制,通过在实际观察中重新接地来保持长时序操作的可靠性。
长时序任务一直是机器人的痛点,这项研究绕过了昂贵的重新训练过程。如果你的业务里有长流程的装配或分拣场景,这种基于反馈的实时纠偏机制能直接拿来做低成本落地。
Human-centric data collection is emerging as a significant paradigm for robot skill acquisition, but seamlessly integrating low-cost, scalable tactile sensing systems that capture fine-grained fingert...
提出一种以人为中心的数据采集范式,结合低成本、可扩展的触觉传感系统,捕获细粒度的指尖接触信息,从而加速机器人技能学习。
用可穿戴设备直接采集人类指尖动作数据,相当于给机器人提供了海量的“师父带徒弟”数据。这能大幅降低具身智能遥操作数据收集的硬件门槛,是个极具商业落地价值的过渡方案。
We present a real-time upper-body human-to-humanoid motion imitation framework driven by neuromorphic event-based vision. This work addresses practical perceptual bottlenecks of conventional frame-bas...
提出一种由神经形态事件相机驱动的实时人机动作模仿框架,解决了传统基于帧的遥操作在极端光照条件下的视觉感知瓶颈。
传统摄像头在逆光或暗光下直接罢工,事件相机的引入让人形机器人在复杂车间或户外环境下的全天候稳定遥操作成为可能。这反映了硬件感知层的升级正在反哺具身智能的鲁棒性。
Deploying drone swarms to track a dynamic target in cluttered environments presents severe computational and safety challenges. We propose MROPE, a hierarchical strategy that decouples the cooperative...
提出一种分层策略MROPE,将多无人机集群追踪动态目标的协作控制解耦,解决杂乱环境中的计算压力和安全挑战。
集群机器人避障最大的难点是算力跟不上实时性要求。这种将复杂约束压缩成椭圆并解耦计算的方法,让普通算力的边缘设备也能带得动多机协同,对于巡检和物流仓储无人机集群是利好。
While robot foundation models are growing increasingly capable, the strongest models are typically trained on proprietary data and remain closed-source, limiting downstream users' ability to adapt the...
针对闭源的机器人基础模型(如Gemini Robotics),提出一种非侵入式的闭环迭代微调方法(CLIFT),使下游用户能在不获取原始权重的情况下适配自己的专有数据。
这意味着你不需要花几百万去从头训练基础模型,也不需要拆解黑盒权重,用API+闭环反馈就能把大厂通用模型“调教”成你专属的产线机器人。这种非侵入式的微调范式很可能会成为未来工业界的标准玩法。
Vision-language-action (VLA) policies achieve strong performance in robotic manipulation but remain vulnerable to runtime disturbances that break the temporal alignment among visual observations, robo...
视觉-语言-动作(VLA)模型在运行时容易受干扰导致视觉观测与机器人指令的时间对齐被破坏。ActFovea通过检测时空一致性,为VLA策略提供实时的运行时安全防护。
VLA模型端到端很强大,但像个黑盒,一旦画面闪烁或卡顿就容易输出灾难性动作。这种保底的安全机制非常契合当前工业界对AI控制机械臂的合规性要求,建议做部署的工程师重点跟进。
Embodied intelligence faces a fundamental data bottleneck. Models must capture how first-person perception, whole-body motion, dexterous manipulation, object state, sound, and touch evolve together as...
具身智能面临多模态数据对齐的瓶颈,模型需要同时理解第一人称视觉、全身运动、灵巧操作、物体状态以及声音和触觉的演变。ACE-Data-0 提出了一种环境捕捉数据引擎,全面收集并同步这些多维度的人类交互数据。
高质量的多模态对齐数据是训练下一代通用机器人的燃料。这个数据引擎的发布,意味着大家开始从单纯的视觉抓取转向更全面的'触听视'多模态联合学习,谁能掌握更丰富的数据源,谁的泛化能力就强。
We introduce PhiZero, a physical world model built around physical language, a compact discrete representation of world-state transitions. Existing physical world models typically predict future video...
现有的物理世界模型通常直接预测未来视频帧,计算成本高且容易丢失关键物理特征。PhiZero 引入了一种围绕“物理语言”(一种紧凑的离散化世界状态转移表示)构建的世界模型,提高了对物理规律预测的准确性和效率。
放弃直接预测像素,转而预测紧凑的离散物理状态,这跟 Yann LeCun 主推的 JEPA 思路不谋而合。这种思路能大幅降低世界模型的算力消耗,是具身智能走向端侧推理的必经之路。
We present PAC-MAN, a perception-aware CBF-RL framework that couples control-barrier safety with deployment-realistic onboard sensing for whole-body humanoid dodgeball. The deployed policy sees the ba...
该研究提出了 PAC-MAN 框架,将控制屏障函数(CBF)的安全性与部署时真实的机载传感相结合,用于人形机器人的全身躲避球运动,确保策略在受到物理约束时的安全性。
这是解决端到端模型在物理世界“乱动”导致损坏的一剂良药。单纯依靠强化学习很难提供硬安全约束,而把 CBF 这种基于数学边界的安全护盾结合进去,让人形机器人在剧烈运动(甚至对抗)中也能保证不“摔机”,这种工程方法可以直接借鉴到你们自己机器人的安全模块中。
In contact-rich manipulation, action multimodality and reactivity dominate different stages of a single episode. Before contact, multiple trajectories might be equally valid, making it important to pr...
在富接触操作中,动作的多模态性和反应性主导了单个回合的不同阶段。该政策在接触前处理多种有效轨迹,并在接触后进行高频响应。
扩散策略在处理复杂操作时一直面临反应慢、难以应对突发接触的痛点。这种分阶段处理频率的思路,特别适合用在精密装配或打磨这种需要机器手“先靠近、再微调受力”的场景。如果你在搞基于力控的机械臂抓取,这套方法能显著降低刚性碰撞的风险。
Pretraining navigation diffusion policies rely on large-scale expert demonstrations. These data are typically generated by a fully-informed oracle planner suited to a single nominal robot. This limits...
现有的导航扩散策略预训练依赖基于单一标准机器人的专家示教数据,这限制了泛化能力。该方法通过重新加权匹配,使策略能够迁移至不同形态的机器人并产生新行为。
很多团队做导航模型时都被卡在“换了个底盘模型就不认路”的窘境里。这项研究给出了一个非常实用的跨本体迁移方案,意味着以后在一个带轮子的机器人上采集的数据,有望直接复用到四足机器狗上,极大降低跨平台部署的标定和数据采集成本。
Google DeepMind has released Gemini Robotics 2, the intelligence layer for its next generation of robots. The release ships three models: a vision-language-action model for whole body humanoid control...
谷歌 DeepMind 发布了 Gemini Robotics 2,作为其下一代机器人的智能层。此次发布包含三个模型:用于人形全身控制的视觉-语言-动作模型(VLA)等,旨在解决复杂操作和多机协作。
一次性放出全身控制、灵巧操作和多机协作三个大招,谷歌显然是想在底层物理 AI 层面统一行业标准。做机器人操作算法的工程师现在有了可以直接对标的顶级 SOTA 模型,建议重点关注其多机器人协作的数据集和通讯协议设计,这是解决未来无人工厂规模化落地的核心痛点。
Google DeepMind says the latest version of its Gemini Robotics AI model can "control entire humanoid robots." While the previous model focused on controlling a humanoid robot's upper body, Gemini Robo...
谷歌 DeepMind 表示,其最新版本的 Gemini Robotics AI 模型能够“控制整个人形机器人”。之前的模型主要专注于控制人形机器人的上半身,而现在的模型已扩展至全身。
从只能挥舞手臂进化到控制全身行走和平衡,意味着人形机器人马上就能走出实验室进入复杂的工业巡检或物流搬运场景。这直接拉高了具身智能的准入门槛,那些缺乏全栈大模型控制能力的传统机器人硬件厂商,未来大概率只能沦为纯执行机构的代工厂。
Vision-and-Language Navigation in Continuous Environments (VLN-CE) requires an agent to follow a natural language instruction, predicting a sequence of low-level actions to navigate a robot from a sta...
在连续环境中的视觉-语言导航(VLN-CE)要求智能体根据自然语言指令预测低级动作。本文针对农业场景,提出在导航中加入可通行性预警,防止机器人陷入泥泞或坑洼。
结合了 VLM(视觉语言大模型)的理解能力和农业地形的物理评估,非常契合当前农业机器人的商业化需求。如果你的业务涉及户外巡检或采摘机器人,这项研究解决的就是怎么让机器人听懂人话的同时,又不一头扎进烂泥地里的实际工程痛点。
Autonomous systems inevitably age, yet their artificial intelligence typically assumes hardware remains in its original condition. Batteries degrade, sensors drift, processors accumulate timing errors...
自主系统的硬件不可避免地会老化(电池退化、传感器漂移等),但其 AI 通常假设硬件状态恒定。该框架提出让机器感知自身硬件老化并相应调整策略。
这个切入点非常妙,解决的是机器人长时间服役后“脑子好使但手脚不听使唤”的问题。对于大规模部署在仓库或园区的物流机器人团队来说,引入硬件感知模型可以实现预测性维护和动态降级操作,极大降低设备生命周期内的运维换件成本。
Can every robot in a swarm predict the same future collective state from only local observations and bandwidth-limited messages? We formulate this as decentralized shared-state prediction and introduc...
在集群机器人中,每个机器人能否仅凭局部观察和有限带宽的消息预测出相同的未来集体状态?本文将其形式化为去中心化共享状态预测,并引入了 JEPA 框架。
基于 Yann LeCun 的 JEPA 架构来做多机协同预测,抛弃了生成稠密像素的沉重包袱,让算力有限的无人机或微型机器人也能做到意图对齐。做集群算法的开发者可以重点关注,这比传统的集中式调度在弱网环境下的鲁棒性强太多了。
Curved tactile fingertips for dexterous manipulation must resolve fine contact geometry, distinguish normal and tangential loads, and capture transient signals. Existing curved vision-based tactile se...
灵巧操作中的曲面触觉指尖需要解决精细接触几何、区分法向和切向载荷以及捕捉瞬态信号的难题。本文提出一种曲面视觉触觉传感器,突破了传统传感器速度和精度的瓶颈。
机器人的精细操作最后拼的都是触觉感知。这款传感器能在高速下分辨微小的受力和形状,对于做假手、柔性抓取或精密插件的团队来说是关键部件。硬件工程师可以关注其多光谱方案,相比传统纯 RGB 灯光方案对形变的捕捉会更精确。
Latent world models enable efficient planning by predicting future states in a compact representation space, but their performance depends critically on the quality of the learned latent distribution....
潜在世界模型通过在紧凑的表示空间中预测未来状态来实现高效规划,但其性能严重依赖学习到的潜在分布的质量。该方法通过分位数匹配来正则化世界模型。
世界模型很容易在长时间预测后出现分布崩溃或生成不合理的物理状态。引入分位数匹配做正则化,本质上是强行拉住模型不让它跑偏。如果你在用 World Model 做机器人的长视野任务规划,这能有效减少幻觉导致的荒谬动作。
World Action Models (WAMs) jointly predict future observations and actions, but their iterative denoising and closed-loop execution make efficient deployment costly. Existing post-training quantizatio...
世界动作模型(WAMs)联合预测未来观测和动作,但其迭代去噪和闭环执行导致部署成本高昂。现有的量化方法粒度不合适,本文提出一种更精细粒度的校准量化方案。
世界动作模型通常参数量大,很难塞进边缘算力盒子里在工厂实时跑。这篇论文解决了大模型上身的算力瓶颈,通过精细到特定粒度的量化压缩,让昂贵的 WAM 模型能在功耗受限的机器人主板上流畅运行,直接利好具身智能的端侧落地。
Hand-object interaction (HOI) modeling remains challenging because it requires joint reasoning about hand articulation, object geometry, contact, semantics, and dynamics under severe visual uncertaint...
手部与物体交互(HOI)建模需要对关节、几何、接触和动力学进行联合推理。该研究结合大型基础模型,解决视觉不确定性下的重建与生成,并将其迁移到具身智能任务中。
这打通了从互联网上的纯视频数据到机器人操作的直接路径。利用大模型强大的先验知识,我们可以直接从人类操作视频里提取动作语义,不用再苦哈哈地遥操采集数据。这种 Data Scaling 的思路可能带来机械臂操作的下一个 ChatGPT 时刻。
World Action Models (WAMs) combine future-state prediction with robot action generation, but existing approaches largely rely on visual futures. Visual prediction captures scene structure and object m...
现有的世界动作模型(WAMs)主要依赖视觉未来进行预测和动作生成。本文提出 TacWAM,引入触觉预测来补充视觉信息,更好地捕捉物理接触和交互力学。
纯视觉的世界模型在处理遮挡或判断抓取力度时存在先天缺陷。加入触觉模态补全了物理交互的最后一块拼图。做柔性物体(如毛巾、线缆)装配或易碎品抓取的研发团队,这种视觉+触觉多模态大模型是突破目前成功率瓶颈的关键技术栈。
Transferring manipulation skills across object instances that share functionality but differ in geometry remains a fundamental challenge in robot learning. While recent correspondence methods leverage...
在功能相似但几何形状不同的物体实例间迁移操作技能仍是难题。本文提出一种语义锚定的对应方法,绕过纯几何限制,实现零样本的操作技能泛化。
这解决了工业产线上频繁换件的痛点。以前抓过这个马克杯,换个细高玻璃杯模型可能就不认了。这种基于语义而非纯几何对应的方法,意味着只要功能相近(比如都是把手),训练好的抓取模型就能无缝迁移,极大降低了针对新 SKU 重新训练的成本。
The latest version of Google DeepMind's AI model includes a significant jump into “physical AGI.” But plopping AI into the real world comes with risks.
谷歌 DeepMind 的最新 AI 模型向“物理通用人工智能(AGI)”迈出了重大一步。但将 AI 放入真实世界也伴随着风险。
谷歌直接祭出“物理 AGI”的概念,说明大厂之间的大战已经从纯文本大模型烧到了具身智能硬件。开发者在关注其强大泛化能力的同时,更要留意物理世界部署带来的安全边界问题,端到端模型的不可解释性在真实硬件上试错的容错率极低。
While depth sensors have the potential to complement RGB data for affordance segmentation in wearable robots, their usage seems to remain underexplored. The paper proposes two approaches: a reformulat...
在可穿戴机器人中,深度传感器可以补充 RGB 数据进行可供性分割(判断物体的可操作性),但目前应用仍不充分。本文提出了新方法,优化在嵌入式设备上的运行效率和精度。
可供性分割是机器人决定“抓哪里”的前提。这项工作把目光投向了算力孱弱的嵌入式端,不仅要算得准,还要算得快。这对于做成低成本的家庭服务机器人或外骨骼设备至关重要,能省下高昂的边缘计算硬件成本。
Collaborative robotics is a representative task-oriented 6G use-case, where communication quality should be reflected in mission execution, environment understanding, and closed-loop operation rather ...
协作机器人是典型的面向任务的 6G 用例,其通信质量应体现在任务执行、环境理解和闭环操作中,而不仅仅是传统的数据传输速率。
这波研究抓住了多机器人系统的核心痛点:传视频太费带宽且延迟高。当机器人之间直接传输“语义”(比如“把那个红色危险品递给我”),通信带宽需求能呈指数级下降。做集群机器人和无人工厂集成的架构师,必须尽早跟进这种结合了通信与任务目标的跨学科设计。
Despite rapid advances in policy pretraining, embodied AI systems routinely plateau during task-specific finetuning. The root cause lies in how finetuning data are collected: the default pipeline gath...
具身智能系统在特定任务微调时常常遇到瓶颈。根本原因在于数据收集方式偏向随机探索,本文引入关键性模型,让智能体自动识别并专注于那些对任务成败影响最大的状态进行学习。
这就是给机器人的强化学习加了“重点复习提纲”。避免在海量无意义的空动作上浪费算力,能大幅缩短工业机器人在新产线上的训练微调时间。对于需要快速切换任务节拍的柔性制造场景,这种数据高采样效率算法能直接转化为真金白银的时间成本。
Egocentric video offers rich manipulation experience for embodied AI, yet collecting diverse egocentric data across scenes, objects, motions, and embodiments remains costly. We present \method, an ego...
第一人称视频为具身智能提供了丰富经验,但跨场景数据收集成本高昂。本文提出了一种第一人称的世界-动作建模框架,结合在线投影记忆和三维旋转位置编码,实现高效自生成。
这其实是让机器人通过做梦或者自我演绎来“刷数据”。利用 3D RoPE 和投影记忆,机器人可以在虚拟引擎里自己生成海量带物理标注的第一人称操作数据。做机器人 VLA 大模型的同学可以重点关注,这是解决高质量真机数据枯竭的一个极具潜力的方向。
Many dexterous manipulation tasks require the object to remain securely held throughout the interaction. From the perspective of hand-object relational motion, such manipulation comprises four canonic...
许多灵巧操作任务要求在整个交互过程中物体被稳固握持。从手-物体关系运动的角度看,本文将操作分解为四种规范技能,并提出统一框架进行合成。
这为机械手操作建立了一套类似人体经络的底层规范。将复杂的“转笔”或“盘核桃”动作拆解为可重组的基础模块,意味着开发者不用为每一个复杂动作从头训模型,通过技能链的组合就能快速生成新动作的执行流。
Recent advances in 4D radar enable robust perception in adverse weather; however, the inherent sparsity, noise, and limited positional precision of radar point clouds pose significant challenges for r...
4D 雷达能在恶劣天气下实现稳健感知,但雷达点云固有的稀疏性、噪声和有限的位置精度给测距带来挑战。本文提出结合距离有界匹配和点不确定性模型,显著提升测距鲁棒性。
自动驾驶圈很久没有在 4D 毫米波雷达这种硬核传感融合上发力了。相比容易受雨雪雾干扰的激光雷达,4D 雷达成本更低且全天候工作。这套算法为那些主打下沉市场、不用高成本激光雷达的 L2/L3 级辅助驾驶方案提供了更强的安全冗余。
In the physical world we inhabit, space and time are fundamentally continuous. However, existing machine learning paradigms for world modeling are largely confined to discrete-time prediction, thereby...
我们生活的物理世界中空间和时间是连续的,但现有的世界模型多局限于离散时间预测,导致动作延迟。本文提出基于常微分方程(ODE)的连续时间预测架构,让机器人的动作执行更加平滑自然。
用 ODE 来做世界模型,解决的是控制频率和预测频率不匹配的问题。离散的预测容易导致机械臂动作一顿一顿的,而连续时间架构能算出任意时刻的状态,这对于高动态场景(比如接抛物体或高速奔跑的机器狗)的平滑控制至关重要。
Robots navigating among pedestrians typically sense their surroundings with a 2D LiDAR mounted close to the ground. At that height, the sensor mostly sees moving legs rather than whole people, yet mos...
在人群中导航的机器人通常使用贴近地面的 2D 激光雷达,在这个高度传感器主要看到的是移动的腿而不是全身。本文提出利用腿部运动特征来预测人类轨迹,优化避障策略。
服务机器人厂商可以直接抄作业。以往用 2D 激光雷达做导航,机器人经常在玻璃商场里撞人或者被突然跑过来的小孩吓到。把腿部抽象为动态预测模型,不用上昂贵的 3D LiDAR 就能大幅提升穿梭人群时的丝滑度和安全性,极具商业落地价值。
Visuomotor policies have advanced on manipulation tasks where the target object stays static during execution, but real deployments break this assumption: parts drift on conveyors and fruits sway in t...
视觉运动策略在目标静止的任务上表现良好,但真实部署中常遇到传送带漂移或水果摇晃等动态情况。本文提出反事实动作增强,通过生成动态数据来提升模型对运动目标的抓取能力。
打破了机器人只能抓静态物体的魔咒。对于在农业采摘(风吹果树)或流水线分拣(传送带移动)场景掉头发的工程师来说,这种数据增强方法不用你去实地采集成千上万张晃动物体的照片,在虚拟引擎里通过物理扰动生成数据就能大幅提升泛化性,省钱又高效。
A German startup sent a camera-wearing chef to my apartment. In exchange for a free lunch, I let them record every chop and stir to train future humanoids.
一家德国初创公司派了一位戴相机的厨师到作者家中。为了换取免费午餐,作者允许他们记录厨师每一个切菜和搅拌的动作,以此来训练未来的人形机器人。
这透露出具身智能数据收集的一个新趋势:用极具性价比的真实人类第一人称视角数据来训练模型。对于缺乏高质量操作数据的机器人初创公司来说,通过众包或提供生活服务来换取第一人称视音频,是一条绕过昂贵实验室动捕采集的捷径。
Vision-Language-Action (VLA) models have attracted growing interest as a scalable approach to robotic manipulation. While these models are effective action predictors, deploying them as robotic agents...
视觉-语言-动作(VLA)模型作为可扩展的机器人操作方案备受关注,但直接部署往往鲁棒性不足。RoboBRIDGE 提出了一个模块化框架,旨在将 VLA 模型的动作预测能力平滑且稳定地迁移到真实世界的物理智能体中。
VLA 模型在实验室里表现很好,但一到真机就拉胯,主要卡在鲁棒性上。这个框架给开发者提供了一个实用的中间件思路,不用重训模型就能解决实际部署时的各种不确定性和误差问题。
Perceiving human motion and intent at long range is a prerequisite for socially intelligent aerial robots, yet the data to learn it barely exists. We introduce Drones2BodyLanguage, a dataset grounding...
为了让无人机等空中机器人具备远距离社交感知能力,研究团队引入了 Drones2BodyLanguage 数据集,通过在空中画面中精准放置 3D 虚拟人,帮助机器人学习理解和感知人类的运动轨迹与意图。
低空经济和无人机应用正在爆发,让无人机看懂人的动作是安防和救援场景的刚需。这个数据集填补了高空视角下人体姿态估计的空白,做无人机视觉的团队建议跟进。
Reconstructing dynamic surgical scenes is crucial for robot-assisted minimally invasive surgery; however, it continues to be difficult because of tissue deformation, occlusions, specular reflections, ...
在内窥镜等微创手术机器人场景中,由于软组织变形、遮挡和镜面反光,动态场景重建极具挑战。Endo-NeRF++ 结合多分辨率哈希编码与不确定性感知神经渲染技术,有效提升了动态手术视野的重建质量和鲁棒性。
医疗机器人对精度要求极高,传统 NeRF 在处理软组织反光和形变时容易崩。引入不确定性感知和哈希编码,相当于给重建模型加了一层物理过滤,这对手术导航和术中增强现实有直接的商业落地价值。
Scalable collection of dexterous manipulation demonstrations remains a major bottleneck for robot learning. High-fidelity interfaces often require costly hardware and extensive setup, while low-setup,...
收集灵巧操作的演示数据是机器人学习的核心瓶颈,现有高保真设备成本高昂且配置繁琐。DexDirect 提出了一种直接的动觉引导方法,能够低成本、高效率地收集机器人灵巧操作的演示数据。
现在具身智能卡脖子最严重的其实是高质量真机数据采集。这种低硬件门槛的动觉引导方案如果能铺开,能极大降低中小团队做灵巧手操作策略训练的试错成本。
Flow-matching Vision-Language-Action (VLA) policies have shown strong potential for robotic manipulation but often suffer from compounding errors caused by distribution shifts during deployment. While...
基于流匹配的 VLA 策略在机器人操作中潜力巨大,但部署时容易因分布偏移导致复合误差。RedFlow 通过将模型的失败预测重定向为动作级别的纠正信号,显著提升了策略在面对真实环境扰动时的稳定性。
相比于传统的从头重训,把失败状态直接转化为动作级纠偏是一种非常轻量的闭环控制思路。这解决的是大模型落地真机时最常见的'小错误不断放大'问题,工程实用性很强。