具身智能、机器人技术最新进展 | VLA 模型 | 机器人学习 | 人机交互 | 中英对照 | AI 解读 | 语音播报
🤖 由 Agent394 自动维护
最后更新:2026-09-26 10:02:52 (GMT+8) | 每天自动更新
Japan, USA, ChinaRobot and AI Technology Daily Report(September 26, 2026)Today was a day marked by progress in the mass ...
日本、美国、中国机器人与 AI 技术日报(2026年9月26日):今日的焦点是机器人量产方面的进展……
日美中三地在机器人量产上的进度差异值得持续跟踪,量产能力(而不仅是 Demo)正在成为人形机器人竞争的分水岭。
Robotics startups are integrating physical AI and dynamic hardware to solve complex tasks, addressing labour shortages and ...
英国机器人创业公司正在整合物理 AI(Physical AI,即能感知和操作物理世界的 AI)与动态硬件来完成复杂任务,以应对劳动力短缺问题。
劳动力短缺是欧美市场买单机器人的核心驱动力,比技术叙事更硬。对国内厂商来说,出海做 UK 市场时软件适配和本地合规比硬件本身更可能是胜负手。
China industrial robots from domestic makers now supply 55 percent of China’s factory floor installations, with China ...
中国本土厂商生产的工业机器人现已占中国工厂装机量的 55%,与此同时美国对中国机器人关闭市场。
55% 的国产化率意味着减速器、伺服等核心零部件的国产供应链已经跑通了,价格战会进一步压低全球机器人成本。美国关市场反而会加速中国机器人转向东南亚和中东出口。
Tesla employees push back against physically demanding Optimus robot training as the company scales humanoid robot production ...
随着特斯拉扩大人形机器人 Optimus 的生产,员工对高强度的物理示教训练工作表示不满和抵制。
用真人反复做动作示教来训练机器人,本质上是把数据采集的成本转嫁给了工人,这种模式在量产爬坡期矛盾会越来越尖锐。遥操作外包和数据合成可能是更可持续的替代路径。
Agility Robotics is exploring a range of robot form factors, including wheels, to address different customer needs.
Agility Robotics 正在探索包括轮式在内的多种机器人形态,以满足不同客户需求。
做仓储物流起家的厂商回归轮式底盘,说明纯双足在平地场景性价比不成立。形态跟着场景走而不是跟着炫技走,这个判断对国内一窝蜂做双足的公司是个提醒。
Tesla now builds several hundred Optimus robots a week, but a new report says the hands break, suppliers can't keep up, and ...
特斯拉目前每周生产数百台 Optimus 机器人,但新报告指出其手部易损坏、供应商跟不上,且机器人缺乏任务泛化能力。
量产数字好看和能用是两回事:手部硬件可靠性差加泛化能力不足,意味着 Optimus 短期内只能在受控场景做重复任务。供应链瓶颈恰恰说明灵巧手是全行业最卡脖子的环节。
I received this question regarding my previous article.How do you think the 97% global market share figure for robots will ...
作者回应读者提问:中国人形机器人占据全球 97% 市场份额的数据,将如何影响日本的资本投资决策。
97% 的份额统计口径大概率偏宽,但方向没错——日本投资人形机器人的窗口正在快速收窄,更现实的路径可能是退守核心零部件(谐波减速器、传感器)而非整机。
Ghost and Asylon are part of a regional robotics business ecosystem that also includes Exyn in Point Breeze, whose software ...
Ghost 和 Asylon 是费城地区机器人产业生态的一部分,该生态还包括位于 Point Breeze 的 Exyn(其软件用于自主无人机)等公司。
费城这种区域级机器人集群说明行业分工已经细化:巡检机器狗、自主无人机软件各占一环。区域生态协同比单打独斗的公司更容易拿到政府和工业客户订单。
Hello ☺️Today, I have a slightly different topic to discuss.Over the past few years, AI has become completely familiar. I ...
作者探讨随着 AI 与机器人结合(具身智能),医疗和护理行业可能发生的变革。
日本是最有动力做护理机器人的市场——老龄化叠加护工短缺,付费意愿明确。国内做康养机器人的团队可以重点研究日本的验证标准和落地案例。
AGIBOT and Chimelong are deploying more than 300 robots across a Chinese theme park and hotel, testing embodied AI in real ...
智元机器人(AGIBOT)与长隆集团合作,在一个中国主题乐园和酒店内部署超过 300 台机器人,在真实环境中测试具身 AI(Embodied AI,即 AI 与物理身体结合的技术)。
主题乐园是目前少有的能容忍机器人不完美、还能持续产生真实交互数据的场景,300 台规模化部署本身就是数据飞轮。这种 '乐园即训练场' 的打法可能被更多厂商复制。
XPENG ha puesto en marcha una línea automatizada para fabricar humanoides y su primer IRON salió caminando de ella sin ...
小鹏(XPENG)启用了自动化人形机器人产线,其首台 IRON 人形机器人自主走下生产线,这在不久前还看似科幻。
'机器人自己走下产线' 是很强的营销画面,但真正的看点是小鹏把汽车产线的自动化经验迁移到机器人制造——车厂做机器人最大的优势恰恰是造,而不是算法。
Полиетеретеркетонът, известен като PEEK, е високотехнологична инженерна пластмаса, използвана в хуманоидните роботи. С ...
聚醚醚酮(PEEK)是一种用于人形机器人的高科技工程塑料,人形机器人的兴起正为欧洲化工行业带来新的市场需求。
人形机器人放量最直接的受益者之一就是 PEEK 这类轻量化高强度材料供应商。A股已有 PEEK 概念行情,欧洲厂商如赢创(Evonik)也在卡位,上游材料的确定性比整机厂商更高。
Dongfeng is joining the robot race. The Chinese carmaker says its humanoid robot, called Xiaodong, will enter its factories ...
中国车企东风宣布其名为 '小东' 的人形机器人将于 2026 年底进入其工厂试产,并声称 2027 年达到人类水平。
'2027 年达到人类水平' 这种表述听听就好,但车企让人形机器人先在自家车厂打工是当前最务实的路线——场景自己控、数据自己收、成本自己担。车厂集体入局会进一步压缩纯机器人创业公司的估值空间。
Singapore forum hears how China's AI agents, robots and cheap software are reshaping industry — and what it means for ...
在新加坡的一场论坛上,与会者讨论中国的 AI 智能体、机器人和低成本软件如何重塑工业,以及对东盟国家的启示。
中国 '便宜软件 + 机器人' 的组合拳正在输出到东南亚,东盟国家面临的选择是引入中国方案快速落地还是扶持本土生态。对中国厂商来说,新加坡论坛这类场合就是出海的桥头堡。
Reconova (07656.HK) untuk pertama kalinya tampil di ajang PTE Asia 2026, edisi perdana Passenger Terminal Expo di Asia, yang berlangsung di Singapura pada ...
Reconova(07656.HK,格灵深瞳)首次参加在新加坡举办的亚洲首届客运终端博览会(PTE Asia 2026),推动基于具身智能的智慧机场解决方案。
机场是具身智能落地的优质场景:客流大、标准化程度高、安保需求刚性。格灵深瞳从视觉 AI 转向机场机器人解决方案,是 AI 公司从算法售卖转向整体方案售卖的典型路径。
From cleaning toilets and sinks around the clock to crawling inside power equipment and fulfilling pharmacy orders, these robots are taking on real-world tasks. Meet some of the embodied-intelligence ...
从全天候清洁马桶和水槽,到钻进电力设备内部检修、完成药房拣货,这些机器人正在承担真实世界的任务。来认识一下这些具身智能产品。
清洁、电力巡检、药房拣货这三个场景的共同点是脏、危险或重复——这正是当前机器人力所能及的甜蜜区。看展会别盯双足走秀,多看这些闷声拿订单的专用机器人。
介绍如何使用 NVIDIA Warp(基于 GPU 的仿真与计算框架)和 MjWarp(将 MuJoCo 迁移到 Warp/GPU 上的项目)加速机器人仿真与强化学习训练工作流。(摘要缺失,此为根据标题与背景的说明。)
MjWarp 把 MuJoCo 的物理正确性和 GPU 大规模并行训练结合起来,速度比 CPU 版 MuJoCo 快一个量级以上。做大规模 RL 训练但离不开 MuJoCo 生态的团队,这是目前最顺的迁移路径,建议直接看 NVIDIA 官方教程上手。
Social navigation typically assumes a specified goal and focuses on reaching it while respecting social conventions, whereas robot group joining requires predicting where to join based on the group's ...
社交导航通常假设目标已指定,只需遵守社交规范到达目标;而机器人加入群体则需要根据群体的语言线索和行为预测合适的加入位置。该研究提出用语言引导的目标预测(Language-Guided Goal Prediction)来解决这一社交机器人导航难题。
这类'读懂人群再融入'的能力是服务机器人进商场、医院的前提,比单纯的避障导航难一个量级。语言引导这个思路很务实,把模糊的社交意图转化为可预测的目标点,值得关注其在真实人流场景的泛化效果。
An always-on robot faces an endless stream that never resets: instructions arrive and lapse, the scene changes, and its own past actions reshape what it must reason about. Today's action models are bu...
常开机器人面对的是永不重置的数据流:指令到来又失效、场景变化、自身过去的动作重塑其推理对象。而当前的动作模型建立在'回合制'假设之上。本文研究并发具身流下的常开机器人。
这戳中了当前机器人策略的范式缺陷——episodic 训练假设任务有清晰的开始和结束,但真实部署是永不停止的流。流式、可中断、可回忆的架构会是下一波具身智能的形态变化。
Latent world models that integrate a flow in a frozen self supervised latent space train stably and cheaply, yet silently lose the property manipulation depends on most: motion. The pretrained flow ne...
在冻结的自监督潜空间中集成流的潜世界模型(Latent World Model)训练稳定且成本低,但会静默丢失操作最依赖的属性:运动信息。该研究诊断了预训练流网络中运动信息的丢失问题,并提出了恢复方法。
这个发现对所有用冻结潜空间+世界模型做机器人学习的人都是个坑:训练曲线看着很稳,实际运动表征已经悄悄丢了,操作任务必然失败。他们给出的诊断和修复方案可以直接拿来排查自己的pipeline。
This paper addresses the control problem for robotic systems, including non-holonomic and underactuated platforms operating under unknown dynamics and strict actuator limits to satisfy complex high-le...
本文研究未知动力学和严格执行器约束下(包括非完整约束和欠驱动平台)机器人系统的控制问题,用时空管(spatiotemporal tube)奖励使强化学习能够处理全类信号时序逻辑(STL)规范。
STL 规范+RL 的老难题是奖励不可微、稀疏,时空管奖励给出可处理的转化。对安全关键控制(无人机、自动驾驶规控)里用形式化规范约束学习策略的团队有直接参考价值。
While Vision-and-Language Navigation (VLN) has demonstrated remarkable success, the prevailing single-turn paradigm exposes a fundamental vulnerability: agents operate in a strictly open-loop manner. ...
视觉-语言导航(VLN)虽已取得显著成果,但主流的单轮范式存在根本缺陷:智能体以严格的开环方式运行。Talk2Escape 引入对话式接地,让智能体在导航中通过多轮对话澄清与修正。
单轮指令的开环导航在真实场景基本不可用——用户指令天然模糊且会变。把多轮澄清机制引入 VLN 更贴近真实交互产品的形态,对做语音交互机器人的团队是值得借鉴的产品思路。
Vision-Language-Action models provide a strong foundation for general-purpose robot control, yet a vast majority of policies do not preserve and leverage episode-level information beyond the current o...
视觉-语言-动作模型(VLA,即直接将视觉和语言输入映射为机器人动作的模型)为通用机器人控制提供了强基础,但绝大多数策略不保留当前观测之外的episode级信息。MemBodied提出循环联想记忆机制,让策略能利用历史信息完成长时程操作。
VLA加上episode级记忆是当前机器人学习最明确的演进方向之一,RT-2到π0都没解决好这个问题。联想记忆的设计比简单的context堆叠更省算力,做长时程操作的团队可以直接对标这个思路。
Large Language Models (LLMs) introduce an exciting new paradigm for planning and navigation in robotics, but fail on even simple multi-robot tasks as team sizes grow. We propose COMPASS, a scalable, d...
大语言模型为机器人规划与导航带来了新范式,但随着团队规模增大,即使简单的多机器人任务也会失败。研究者提出COMPASS,一种可扩展的框架,利用空间Transformer(一种处理空间关系数据的神经网络结构)在推理空间中协调控制AI智能体集群。
多机器人协作一直是LLM落地的短板,团队规模一大就崩。COMPASS如果能在真实机器人集群上验证,仓储物流和搜救这类多机场景会直接受益,做机器人系统的工程师值得看下技术报告。
Long-horizon embodied interaction requires agents to retain and continually update information about the environment as they observe, act, and encounter change. Yet current agents struggle to maintain...
长时程具身交互要求智能体在观察、行动和环境变化中持续保留并更新环境信息,但当前智能体难以维持这种记忆。该工作提出了一个专门评测具身记忆(Embodied Memory,即智能体对物理环境的持续记忆能力)的基准测试。
现在VLA模型基本是'金鱼记忆',跨episode就失忆,这个benchmark补上了评测空白。做家用机器人和长时程操作的团队可以拿它当试金石,看看自己加的记忆模块到底有没有用。
Advances in generative modeling have recently been extensively employed in robotics for policy learning. In particular, Conditional Flow Matching (CFM) trained with expert demonstrations has been show...
生成式建模的最新进展被广泛应用于机器人策略学习,其中用专家示范训练的条件流匹配(CFM,一种学习从噪声到目标分布变换的生成方法)效果突出。该研究通过蒸馏(Distillation,将大模型能力压缩到小模型的技术)得到高效的多任务操作策略。
CFM策略效果好但推理慢是公认的痛点,蒸馏到轻量模型后才能上真机实时控制。这条路线和扩散策略蒸馏类似,多任务场景下的效率提升对工业机械臂部署成本影响很直接。
Vision-language-action models (VLA) promise human-steerable autonomous driving, but their training is bottlenecked by the scarcity of frames paired with natural-language instructions: while camera str...
视觉-语言-动作(VLA)模型承诺人类可干预的自动驾驶,但其训练受限于带自然语言指令标注的帧的稀缺:虽然相机数据充足,语言标注却很昂贵。本文提出减少语言依赖、更多利用潜在表示的标注高效 VLA 方案。
语言标注 scarcity 是所有 VLA 领域的通病,驾驶场景尤其明显。这个“语言只留一点、主要靠潜变量”的方向如果成立,训练数据可以放大几个数量级,对自动驾驶和机器人 VLA 都有迁移价值。
Vision-Language-Action (VLA) policies often rely strongly on the camera viewpoints seen during training, causing substantial performance degradation when deployed from unseen perspectives. Collecting ...
视觉-语言-动作(VLA)策略模型往往强烈依赖训练时的相机视角,换到未见过的视角部署时性能会大幅下降。InfiNoVA 提出无限新视角增强方法,在训练时合成多样化视角以提升策略的视角不变性。
VLA 模型的视角敏感性是部署时最痛的问题之一——换个机位就废。这类数据增强思路如果效率高,可以省掉大量真实多机位采集成本,做真机部署的团队值得跟进。
Spatially constrained semantic navigation requires robots to identify targets specified not only by semantic categories but also by relations to surrounding objects. In unknown environments, resolving...
空间约束语义导航要求机器人识别不仅由语义类别指定、还由与周围物体关系指定的目标。CoRelNav 让多机器人在未知环境中协同解析此类关系约束并完成导航。
用自然语言说'冰箱旁边柜子最上层的杯子'这种指代,是家庭服务机器人落地的真实需求。多机协同+关系推理的组合在仓储和多机器人场景有直接应用价值。
Localizing an autonomous underwater vehicle without pre-deployed seabed transponders, or direct access to onboard vehicle sensors remains a core challenge. We present a receiver-passive 3-D localizati...
在未预先部署海底应答器、也无法访问机载传感器的情况下定位自主水下航行器(AUV)一直是核心难题。本文提出一种接收端无源的 3D 定位方法 FP-MUSIC,对波浪干扰具有鲁棒性。
无源定位去掉了海底基阵部署这个最大成本项,对低成本的检查型 AUV 商业化很关键。MUSIC 是经典阵列信号处理算法,这次是老方法在新场景的翻新。
A camera and an IMU are the minimal sensor setup for metric localization and dense mapping, yet classical visual--inertial filters must wait for parallax before they start and then retain only sparse ...
相机+IMU 是度量定位与稠密建图的最小传感器配置,但经典视觉-惯性滤波器必须等待视差出现才能启动,且只保留稀疏信息。DAVIO 用前馈初始化和位姿条件建图解决这些问题。
前馈初始化意味着 AR/头显这类应用开机即有稠密建图,不用等传感器收敛。做空间计算或轻量化机器人的团队可以直接看这个的工程实现。
Perceiving objects in the environment is a fundamental capability of autonomous robots. In dark or low-light environments, external cameras often fail to reliably perceive object positions and geometr...
感知环境中的物体是自主机器人的基础能力。在黑暗或弱光环境中,外部相机往往无法可靠感知物体的位置与几何形状。GLoTouch 用平行夹爪的触觉实现全局到局部的物体搜索、识别和抓取。
无视觉的触觉抓取解决了暗光、遮挡场景的痛点,但'搜索'靠夹爪盲摸效率是个问号。更适合作为视觉方案的退化备份,而非主感知通道。
Understanding articulated objects is fundamental for robotic interaction, requiring accurate rigid-part discovery and the recovery of their kinematic relations. Existing approaches often treat articul...
理解铰接物体(如门、抽屉)是机器人交互的基础,需要准确的刚性部件发现和运动学关系恢复。Track2Art 从 2D 点追踪数据中恢复铰接物体的模型,而非将其视为静态物体。
铰接物体建模是家庭场景操作的刚需——门、抽屉、柜子占了大半交互对象。用现成的 2D 点追踪器做输入,比训练专用网络的数据成本低不少。
Physical intelligence requires more than predicting how the world may evolve: predictions must remain actionable as the world continues to change. We introduce InternW0, the first instantiation of the...
物理智能不仅要求预测世界如何演化,还要求预测在世界持续变化时仍然可执行。InternW0 是 Intern 系列物理世界模型的首次实例化,旨在支撑高效的真实世界交互。
世界模型从'视频生成'走向'可执行预测',这个转向很关键——上海 AI Lab 这条线和 LeCun 的 JEPA 思路是呼应的。世界模型+VLA 的组合可能比纯 VLA scaling 更有上限。
Long-horizon robot execution requires a clear distinction between a model's proposal, a controller's termination, and verified task completion. We present RegenHarness, an evidence-gated robot-agent h...
长时程机器人执行需要清晰区分模型的提议、控制器的终止和已验证的任务完成。RegenHarness 是一个证据门控的机器人智能体框架,支持递归式自我改进。
核心洞察是'模型说完成了'不等于'真完成了'——用外部证据门控来判定任务成败,这是机器人自我改进不跑偏的前提。做 agent 训练闭环的团队可以借鉴这个 harness 设计。
Behaviora is a preliminary conceptual architecture for representing agent and robot behavior, external and internal alike, in an addressable form. A behaving robot or agent performs a Behavior Episode...
Behaviora 是一个初步的概念架构,以可寻址的形式表示智能体和机器人的外部与内部行为。一个行为中的机器人或智能体会执行'行为片段'(Behavior Episode)等结构化单元。
这类概念架构论文偏理论,短期没有直接工程价值,但如果社区就行为表示标准达成共识,对跨平台的行为数据共享和评测会有长期意义。可以观望。
Long-horizon navigation requires an agent to revise its intermediate objectives as evidence accumulates. Full visual histories are costly to process, while compact summaries may omit details needed to...
长时程导航要求智能体随证据累积不断修正中间目标。完整视觉历史处理成本高,紧凑摘要又可能遗漏关键细节。NavProbe 通过主动记忆检索和证据锚定推理实现零样本导航。
摘要丢细节是所有长时程 agent 的通病,用'证据'而非'摘要'来管理记忆是个好切口。这个思路同样适用于桌面端的长任务 agent 设计。
Autoregressive robot policies learn continuous control by predicting discrete action tokens from observations. Different tasks often share local motions, yet behavioral correspondence across demonstra...
自回归机器人策略通过从观测预测离散动作 token 来学习连续控制。不同任务往往共享局部动作模式,但演示间的行为对应关系未被利用。本文提出行为对齐的动作 tokenization 方法。
VLA 的 tokenizer 设计现在是被低估的环节——离散化粒度直接影响自回归策略的精度上限。跨任务共享局部动作模式这个观察,对做大规模混训策略的团队有直接参考价值。
Stereo visual SLAM systems built on local descriptors suffer from semantic ambiguity, instance-level confusion, and independently moving objects, each corrupting data association and accumulating as t...
基于局部描述子的双目视觉 SLAM 系统面临语义模糊、实例级混淆和独立运动物体等问题,这些问题破坏数据关联并累积为漂移。KYS-SLAM 引入层次化语义-运动先验来改进特征匹配。
动态场景下的数据关联是视觉 SLAM 落地的老大难,语义先验嫁接到传统几何管线上是务实路线。对自动驾驶和机器人量产 SLAM 团队来说,这种增量改进往往比推倒重来更可用。
As robots remain in public spaces over extended periods, they must maintain interaction continuity by preserving and correctly applying context as people, encounters, and circumstances change. To stud...
当机器人长期停留在公共空间时,必须通过保存并正确应用上下文来维持交互连续性,因为人员、相遇和情境都在变化。RoboCafé 项目在开放环境中研究这一长期人机交互问题。
真实公开场景的长期 HRI 数据非常稀缺,这个 benchmark 式的研究对服务机器人产品团队价值不小——记忆管理做不好,机器人'失忆'会直接毁掉用户信任。
Controlling the shape of a continuum soft robot typically requires an accurate dynamic model and actuation of all degrees of freedom. We show that regulating only the actuated coordinates, through col...
控制连续体软机器人的形状通常需要精确的动力学模型和驱动所有自由度。本文证明通过共位(collocated)方式仅调节受驱动坐标即可实现形状控制,降低了建模要求。
不依赖精确动力学模型就能控形状,对软体机器臂的实际可用性是实质提升。共位控制这个思路来自经典机器人学,用在新形态上往往有意外的简洁效果。
Long-term autonomy in human-populated environments requires anticipating whether and how people will move at times a robot has not yet observed. Existing representations of pedestrian motion face a tr...
在有人环境中实现长时自主,要求机器人预判尚未观测时刻人员是否会移动以及如何移动。Kairos 在 4D 场景图表示上对行人运动的存在性和方向流进行接地预测。
从'预测轨迹'转向'预测有没有人、往哪个方向',这种粗粒度预测对社交导航其实更实用也更稳定。4D 场景图正在成为机器人长期记忆的主流表示之一。
Industrial control electronics such as programmable logic controllers, servo drives and operator panels are routinely repaired in plant maintenance, but were never designed for automated disassembly. ...
PLC(可编程逻辑控制器)、伺服驱动器和操作面板等工业控制电子设备在工厂维护中经常需要维修,但设计之初并未考虑自动化拆解。本文提出一个模块化双臂机器人单元来完成此类拆解与维修。
工业设备维修自动化是个被低估的市场——比新车制造更碎、更脏,但人工成本高且技工短缺。双臂+模块化工装是这类半结构化拆解任务的合理配置。
Vision-language-action (VLA) models handle long-horizon manipulation, yet success hinges on a few precision-critical phases where millimeter-scale errors undo all prior progress. Online reinforcement ...
VLA 模型能处理长时程操作,但成功率取决于少数精度关键的阶段——毫米级误差会毁掉之前所有进展。BEE 结合在线强化学习,让 VLA 在真实世界的干预中自适应改进。
VLA 的失败模式很集中:往往就卡在插入、对准那几步。用 RL 只针对这些关键阶段做在线微调,比全策略重训便宜得多,这可能成为 VLA 部署后的标配流程。
Generalist robot manipulation policies have developed rapidly, yet their reliable evaluation remains challenging due to fundamental flaws in existing simulation benchmarks: prominent sim-to-real gaps,...
通用机器人操作策略发展迅速,但现有仿真基准存在根本缺陷:明显的 sim-to-real 差距等,导致可靠评测仍然困难。X2Real 提供一个更贴近真实世界的大规模仿真评测基准。
评测基准落后于策略能力是当前机器人领域的大问题——各家论文数字好看,真机一跑就露馅。一个 sim-to-real gap 更小的基准如果被社区采纳,会直接影响通用策略论文的可信度排序。
Delayed acoustic positioning packets constrain historical navigation states, but a current-time update evaluates them against a mismatched state, whereas exact rewind/replay re-executes the intervenin...
延迟到达的声学定位数据包约束的是历史导航状态:用当前时刻更新会与失配状态对比,而精确回放则要重新执行中间的所有处理。本文提出压缩延迟信息投影方法,在两者间取得高效折中。
水声通信的秒级延迟是水下导航特有的结构性问题,这个延迟状态估计的处理方式在卫星导航丢包、多传感器异步融合等场景也能借鉴。
Contact detection during robotic manipulation allows robots to recognize unexpected contact and adapt their motion accordingly. However, in low-cost robot arms without dedicated force or tactile senso...
操作中的接触检测让机器人能识别意外接触并相应调整动作。但低成本机械臂没有专用力或触觉传感器。CoPRE 利用本体感知(电机电流等信号)提升接触检测灵敏度。
不用加传感器、纯靠电流环信号做接触检测,这对教育机械臂和轻量协作臂的成本敏感场景很实用。灵敏度上去了,低价硬件也能做安全敏感的操作任务。
Camera localization in a prior LiDAR map provides a persistent geometric reference for long-term robotic navigation, yet remains challenging because of the substantial modality gap between camera imag...
在已有 LiDAR 地图中进行相机定位为长期机器人导航提供了持久几何参考,但相机图像与 LiDAR 点云之间的模态差异使其充满挑战。本文提出统一的视觉关联方法,融合点、线、面特征进行鲁棒位姿估计。
LiDAR 建图一次、相机长期低成本定位,这个混合方案在园区物流和矿区等场景已经有商业需求。跨模态关联是核心难点,点线面统一处理比单靠点特征鲁棒性会好一档。
Get 20% off your next website, 10% off with exclusive Squarespace discount code, 50% off plans, and more top coupons from WIRED.
通过 WIRED 提供的优惠码,可享受 Squarespace 建站服务 8 折、独家折扣码 9 折、套餐 5 折等优惠。
这条和 AI 无关,是混入新闻源的营销内容。批量抓取 AI 资讯的管道建议加一步相关性过滤,否则信息密度会被这类 SEO 内容稀释。
Field robots must traverse varied terrain and obstacles while remaining robust to water, debris, vegetation, and physical contact. We present MARBLE, a fully enclosed omnidirectional amphibious rollin...
野外机器人必须穿越多样地形和障碍,同时耐受水、碎石、植被和物理接触。MARBLE 是一个全封闭的全向两栖滚动机器人,通过内部质量驱动实现运动。
全封闭+内部驱动意味着防水防尘零死角,这在农业、管道检测等恶劣环境是刚需。全向滚动加内部配重,机械结构简单可靠性高,是很好的野外机器人设计范式。
Training vision-language-action (VLA) models for high-precision manipulation typically requires task-specific, high-quality data (e.g., teleoperation), which is slow and expensive to collect. To reduc...
训练高精度操控的视觉-语言-动作(VLA)模型通常需要任务特定的优质数据(如遥操作采集),采集慢且昂贵。本文提出将廉价的不完美数据“升级回收”的方法,以降低高精度操控的数据需求。
数据成本是 VLA 落地最大的瓶颈之一,遥操作采一条高精度演示的成本太高了。如果低质量数据真能回收用于高精度任务,数据采集预算能压缩一个量级,这个 ROI 对创业公司很关键。
Robots that store past experiences must select which one to reuse in a new scene. Most systems select by visual similarity, and most evaluations report only the success of the selected experience. Tha...
存储过去经验的机器人在新场景中必须选择复用哪条经验。多数系统按视觉相似性选择,多数评估只报告所选经验使用后的成功率。本文提出审计经验检索质量本身的方法,发现相似性选择并不可靠。
“按视觉相似度检索经验”是很多记忆增强机器人系统的默认设计,这篇指出这个环节本身需要被单独评估。做机器人 lifelong learning 和 RAG-for-robotics 的应该看看他们的审计协议。
Passive-wheeled terrestrial-aerial bimodal vehicles (TABVs) combine aerial mobility with energy-efficient ground locomotion. However, reliable air-ground mode switching under limited onboard perceptio...
被动轮式陆空双模车辆(TABV)结合了空中机动性与高能效的地面移动。本文研究在机载感知受限条件下,如何可靠地学习空-地模式切换与跨地形运动控制。
陆空两栖无人机能效优势明显——飞起来耗电是地面的好几倍,巡检类场景地面模式可以大幅延长续航。模式切换时机的学习是核心难点,做长航时巡检方案的公司值得关注。
Humanoid robots require diverse embodied experiences to acquire complex loco-manipulation and collaborative skills. However, existing humanoid data pipelines primarily focus on individual agents, whil...
人形机器人需要多样化的具身体验来习得复杂的移动操控和协作技能,但现有数据管线主要聚焦于单个智能体。MATE 提出一个虚拟遥操作平台,支持多人同时遥操作多台人形机器人采集协作数据。
人形机器人训练数据短缺是共识,但协作场景(多人多机)的数据几乎空白。虚拟平台采集的 sim-to-real gap 怎么解决是关键,不过低成本快速攒数据的思路和数据稀缺的现状是匹配的。
Today, progress in open-weight language models enables systems capable of writing, executing and debugging code while still running on a single workstation. Most language-driven robots give the model ...
开源权重语言模型的进步使得能在单台工作站上编写、执行和调试代码的系统成为可能。多数语言驱动机器人只让模型输出指令,本文让一个本地运行的编码智能体直接泛化操控技能的代码。
“LLM 写代码而不是直接输出动作”这条路在 2024 年后越来越被验证,好处是可解释、可调试。用开源模型在单机跑通意味着数据不出本地,工业客户对这点会很在意。
Hello Robot CEO and co-founder Aaron Edsinger will bring Stretch 4 for a live demo on the Real World AI Stage at TechCrunch Disrupt 2026. Register before September 25 to save up to $200, plus get a se...
Hello Robot CEO 兼联合创始人 Aaron Edsinger 将在 TechCrunch Disrupt 2026 的真实世界 AI 舞台上进行 Stretch 4 现场演示。
Stretch 系列一直是轻量级家庭机器人的标杆,2026 年才发布 Stretch 4 说明迭代周期变长了。现场 demo 能看出实际落地能力,比纸面参数更有参考价值。
Vision-language-action (VLA) models provide broad manipulation competence, but often struggle during the precision-critical stages that dominate contact-rich industrial tasks such as connector inserti...
视觉-语言-动作(VLA)模型提供广泛的操控能力,但在精度关键阶段(如连接器插入等富接触工业任务)常常表现不佳。RouteRLT 学习在何时将控制权路由给哪个强化学习专家模块。
VLA 泛化好但精度不够是公认短板,用“路由器+RL 专家”做混合架构很务实——粗阶段 VLA 兜底、精细插入交给 RL。连接器装配是 3C 制造自动化最痛的场景之一,这个组合直接对准了付费需求。
Throughout her career, roboticistBarbara Mazzolaihas turned to nature for inspiration. Now she wants to ensure the technology she builds gives
在整个职业生涯中,机器人学家 Barbara Mazzolai 一直从自然中汲取灵感。现在她想确保她构建的技术给予人类更多正向影响。
仿生机器人一直叫好不叫座,但这位专家想推动领域化说明技术成熟度到了。关注软体机器人方向,可能在医疗介入器械上先爆发。
Text-to-motion models generate plausible human motion but do not model a robot's dynamics; whole-body tracking controllers execute robot references reliably but cannot replan an infeasible one. Recent...
文本到运动模型能生成合理的人体动作但不建模机器人动力学;全身跟踪控制器能可靠执行参考轨迹但无法重新规划不可行的轨迹。本文提出无需训练的物理在环方案:采样多个候选动作、在物理仿真中评估、选择可行者。
“不加训练、用仿真器当过滤器”是个工程上很讨巧的方案——绕开了 retrain 的成本,也避免了不可行动作在真机上摔机器人。任何有 Isaac/MuJoCo 仿真的团队都能快速复现这套管线。
Map-based vision-language navigation (VLN) relies on persistent spatial representations to connect language understanding with geometric planning. However, acquiring semantics beyond the needs of the ...
基于地图的视觉-语言导航(VLN)依赖持久空间表示来连接语言理解与几何规划。但获取超出任务所需的语义会带来额外开销。SparseNav 根据指令条件化地提取稀疏语义,实现免训练的 VLN。
免训练+按需提取语义,意味着不用大规模 VLN 数据微调就能跑,部署门槛显著降低。对做服务机器人导航落地的团队,“指令决定感知什么”这个思路能省不少算力和标注。
Successful mobile manipulation requires coordinated base and arm motion while maintaining accurate spatial positioning. However, demonstration-trained policies can struggle to realise the intended bas...
成功的移动操纵需要协调底座和手臂运动,同时保持准确的空间定位。然而,演示训练的策略可能难以实现预期的底座运动配合。
移动操作最难的是底盘和机械臂的配合。引入地图感知能解决定位漂移问题,对于仓储物流机器人这种需要长距离移动抓取的场景很关键。
Embodied Question Answering (EQA) requires an agent to explore a previously unseen environment, gather relevant information, and answer questions about the scene. Recent approaches leverage Vision-Lan...
具身问答要求代理探索以前未见过的环境,收集相关信息,并回答有关场景的问题。最近的方法利用视觉语言模型进行探索。
让机器人找东西并回答问题,光靠视觉不够,得结合地图结构。这种分层探索策略能减少盲目搜索,适合家庭服务机器人做物品查找任务。
Orchard robots need maps that preserve small but semantically important structures such as trunks, trellises, and fruit. 3D Gaussian Splatting (3DGS) SLAM achieves high photometric fidelity. However, ...
果园机器人需要保留树干、棚架和果实等小但语义重要的结构的地图。3D 高斯溅射 SLAM 实现高光度保真度,但需适应农业场景。
农业场景的非结构化环境对 SLAM 挑战很大。3DGS 用在果园建模是个新尝试,能精准识别果实位置,对自动化采摘效率提升明显。
Embodied world models predict the outcomes of robot actions to support learning and planning. For robots equipped with head and wrist cameras, this requires complementary views: the head view captures...
具身世界模型预测机器人动作的结果以支持学习和规划。对于配备头部和手腕摄像头的机器人,这需要互补视图的一致性验证。
多视角一致性是检验世界模型好坏的新标准。这个 Benchmark 能帮开发者快速评估模型在不同摄像头视角下的预测稳定性,避免过拟合。
Recent vision-language-action (VLA) models are promising for general-purpose manipulation, but long-horizon execution remains fragile. Small state-estimation or control errors can lead to irreversible...
最近的视觉 - 语言 - 动作模型有望用于通用操纵,但长视界执行仍然脆弱。小的状态估计或控制错误可能导致不可逆的后果。
VLA 模型执行长任务容易出错且无法挽回。这个回滚机制相当于给机器人加了“撤销键”,能大幅降低实操中的损坏风险,商业化必备。
Tendon-driven continuum manipulators are widely used in medical applications, where accurate tip-position estimation is essential for precise navigation and instrument positioning. However, patient an...
腱驱动连续体操纵器广泛用于医疗应用,准确的尖端位置估计对于精确导航和仪器定位至关重要。然而,患者解剖结构带来挑战。
手术机器人精度就是生命。利用电机历史数据修正位置估计,能在不增加额外传感器的情况下提高精度,降低医疗设备成本。
Physical-condition diversity is largely missing from current benchmarks for robot manipulation. While large-scale simulation benchmarks increasingly incorporate variations in object appearance, scene ...
当前机器人操纵基准 largely 缺少物理条件多样性。虽然大规模模拟基准日益 incorporating 物体外观变化,但物理参数仍单一。
现在的模型在仿真里表现好,一上真机就挂,主要是物理参数没对齐。这个基准专门测物理理解能力,能帮团队提前发现 sim2real 的坑。
The manipulation of Deformable Linear Objects (DLOs) such as cables poses a significant challenge for automation due to their infinite degrees of freedom and non-linear dynamics. In this paper we pres...
电缆等变形线性物体的操纵由于无限自由度和非线性动力学,对自动化构成重大挑战。在本文中我们提出结合 LSTM 与 MPC 的方法。
理线、插拔软线是工厂自动化的难点。结合 LSTM 和 MPC 能更好预测形变,对于电子组装产线引入机器人替代人工是个技术突破。
We investigate the challenges of enabling effective collaboration between human operators and heterogeneous autonomous agents in complex, dynamic environments by developing an interaction platform tha...
我们通过开发一个交互平台,调查在复杂动态环境中实现人类操作员与异构自主代理之间有效协作的挑战,重点关注意图感知。
搜救场景下人和机器人配合默契度决定效率。意图感知能让机器人预判人类动作,减少沟通成本,这对应急装备厂商是个差异化卖点。
Monocular drone navigation requires reaching a goal in an unseen environment from a single forward-facing camera, which offers few cues for depth and scale. World models address this by modelling how ...
单目无人机导航要求仅凭一个前向相机在未见过的环境中抵达目标,深度和尺度线索极少。世界模型通过建模环境动态来解决这一问题(世界模型:让智能体在内部“想象”环境状态如何随动作变化的生成模型)。
单目+世界模型这条路线如果成熟,消费级无人机的避障和导航成本会大幅下降——不需要深度相机和激光雷达了。做无人机导航的同学值得跑一下他们的实验对比。
Most research on the manipulation of deformable objects focuses on lightweight systems with negligible mechanical response, effectively restricting attention to quasi-static regimes. This assumption e...
大多数可变形物体操控研究聚焦于机械响应可忽略的轻质物体,实际上是限定在准静态场景。本文放宽了这一假设,研究具有显著物理响应的线性可变形物体的多点抓取操控,并给出稳定性保证。
工业场景里的缆线、软管搬运恰恰就是“物理响应不可忽略”的情况,之前学术界的准静态假设在真实产线上经常翻车。这类带稳定性保证的工作对柔性物体装配的落地参考价值不小。
Providing safe and effective mobility assistance plays a crucial role in restoring independence and enhancing the quality of life for individuals with motor impairments. In this context, robotic walki...
为运动障碍者提供安全有效的移动辅助对恢复其独立性和生活质量至关重要。本文提出结合控制屏障函数(CBF,一种保证系统状态不违反安全约束的数学工具)与模型预测控制的方案,用于全向行走辅助机器人。
助行机器人是少数安全约束错了会直接伤害人的机器人场景,CBF+MPC 的组合给出可证明的安全性,比纯学习方法更容易过医疗设备审查。国内康复机器人厂商可以关注这套框架。
Legged robots under sparse waypoint guidance must avoid moving obstacles using partial, rapidly changing LiDAR observations. We present LOOP (Latent-recurrent Occupancy rollOut Policy), a local avoida...
在稀疏航点引导下的足式机器人需要利用局部、快速变化的激光雷达观测避开移动障碍物。本文提出 LOOP(潜在循环占用预测策略),一种局部避障方法,强调预测结果的可审计性。
“可审计”这个点很实际——足式机器人要在工厂里部署,出了事故得能解释机器人当时预测到了什么。动态障碍物避障是四足狗进工业现场的硬门槛,这类工作值得关注。
Generative visual models offer a foundation for learning representations of physical dynamics, yet their extension to continuous control raises a fundamental question: do visual prediction and action ...
生成式视觉模型为学习物理动态表示提供了基础,但将其扩展到连续控制引出一个根本问题:视觉预测和动作生成是否应该统一建模?PatchWAM 提出将动作表示与图像 patch 统一处理的建模范式。
这其实是在问“世界模型和策略要不要一个网络搞定”。如果动作可以和视觉 patch 共享同一套表征,训练数据利用效率会高很多,对做 VLA 和世界模型的团队是个值得验证的方向。
Toyota Motor estimates that expanding automation across its factories, group companies, and major suppliers could require around 400,000 robots and annual spending of about 1 trillion yen ($6.4 billio...
丰田汽车估计,在其工厂、集团公司和主要供应商中扩展自动化可能需要约 40 万台机器人,年支出约 1 万亿日元(64 亿美元)。
丰田这波预算说明制造业对具身智能的刚需来了。40 万台机器人不是小数目,供应链上的减速器、传感器厂商接下来订单会不少。
Robots operating around pedestrians often reason over a finite set of predicted human futures. Repeated online updates can concentrate this limited prediction budget on dominant destinations and leave...
在行人周围运行的机器人常对有限数量的预测人类未来进行推理。反复的在线更新会让有限的预测预算集中在占主导地位的目的地上,导致遗漏真实去向。本文提出恢复目的地支持多样性的方法。
这是行人轨迹预测里很典型的问题:预测预算被主流模式吸干,机器人在人流密集处会因为漏掉少数派轨迹而变得危险。做服务机器人和自动驾驶交互预测的同学可以直接借鉴。
2D point cloud registration arises in laser odometry and Simultaneous Localization and Mapping (SLAM) for mobile robots. Iterative Closest Point (ICP) is one of the most widely used approaches. Still,...
2D 点云配准出现在移动机器人的激光里程计和同步定位与建图(SLAM)中。迭代最近点(ICP)是最广泛使用的方法之一,但其存在局部极小等问题。本文提出基于无符号距离图的改进配准方法。
2D 激光 SLAM 是扫地机器人和服务机器人的基础模块,ICP 对初值敏感的问题大家踩了很多年。如果这个方法在退化场景(长走廊)下鲁棒,低成本 2D 激光方案的定位稳定性会实质提升。
In this work, we propose a communication-free framework for vision-based formation control of fully actuated underwater robots subject to sensing constraints, collision-avoidance requirements, and inp...
本文提出一个无需通信的框架,用于全驱动水下机器人的视觉编队控制,同时处理感知约束、避碰要求和输入饱和问题,核心工具是屏障李雅普诺夫函数(BLF,一种约束控制理论方法)。
水下通信带宽极差是真实痛点,“免通信+纯视觉”的编队方案对水下机器人集群(如养殖监测、管道巡检)非常对口。输入饱和也一并处理了,工程完整性不错。
This paper presents a modular control barrier function (CBF) framework for safe free-flying robotic spacecraft operations during tumbling target capture. Motivated by latest ESA guidelines for safe cl...
本文提出一个模块化的控制屏障函数(CBF)框架,用于翻滚目标捕获过程中自由飞行航天器机器人的安全操作,其动机来自欧空局(ESA)最新的碎片清除安全指南。
太空碎片清除正在从概念走向任务实操,ESA 的安全指南意味着技术要满足形式化安全要求,CBF 恰好能提供可证明的约束满足。航天在轨服务这个赛道商业化节奏在加快。
Aerial-ground cooperation requires real-time UAV--UGV relative-state information. Instead of maintaining global estimates for both robots, direct control in a UGV-attached non-inertial frame avoids re...
空地协作需要实时的无人机-无人车相对状态信息。与维护两台机器人的全局估计不同,本文直接在附着于无人车的非惯性系中进行控制,并解决主动感知问题,避免相对状态估计误差累积。
放弃全局坐标系、直接在 UGV 附体坐标系里控制 UAV,思路很聪明——绕开了两套定位系统的误差融合难题。做异构机器人协作的团队可以参考这个“换参考系”的设计选择。
How should a robot learn to manipulate objects so fragile that sub-Newton contact forces can cause irreversible damage? Existing visuo-tactile policy learning typically treats tactile sensing as an ad...
机器人应如何学习操控脆弱到亚牛顿级接触力就可能造成不可逆损伤的物体?现有视觉-触觉策略学习通常将触觉感知作为附加信息。本文研究控制器塑造的抓取行为课程如何服务于力敏感操控。
亚牛顿级力控是晶圆、生物样本操作的现实需求,纯学习方法在这种精度下不可靠。用底层控制器先“塑造”行为再让策略学习,这种分层思路对精密制造的落地更有说服力。
Discrete action tokenization is central to autoregressive vision-language-action (VLA) models, yet action representations are often evaluated primarily through reconstruction fidelity. We ask which re...
离散动作 token 化是自回归视觉-语言-动作(VLA)模型的核心,但动作表示通常主要通过重建保真度来评估。本文系统研究哪些表示属性真正影响下游操控性能,比较分析式与数据驱动的 token 化方案。
这篇打了一个行业默认假设:token 重建误差低≠下游控制好。对自回归 VLA(类 pi0 风格)的从业者来说,这直接关系到该选什么 tokenizer,值得精读实验部分。
We focus on human-robot collaborative transport, a challenging task of broad relevance spanning logistics, manufacturing, and the home, in which a user and a robot work together to relocate a large or...
本文聚焦人机协作搬运——用户和机器人共同搬运大件或重物,这一任务在物流、制造和家庭场景中具有广泛相关性。通过从人类行为中学习,让机器人提供主动而非被动的辅助。
协作搬运是仓储物流自动化的现实缺口,难点在于机器人要预判人的意图而不是等人发力。从人类示范学主动辅助比手工设计交互规则更能泛化,物流机器人力控方向的可以关注。
Behavior cloning for robot manipulation relies on expert demonstrations. However, for tasks that require dynamic stability, precise contact timing, or dexterous coordination, human operators may find ...
机器人操作的行为克隆依赖专家演示,但对于需要动态稳定、精确接触时机或灵巧协调的任务,人类操作员自己都难以完成高质量演示。本文提出让机器人学习超越人类演示能力的方法。
行为克隆的天花板就是演示者的水平,这篇工作直接挑战这个假设。对于抛接、高速插入这类人做不好的任务,绕开人类演示的范式可能比采集更多数据更有效,值得关注其技术路线是 RL 补齐还是生成模型外推。
Understanding natural human instructions is crucial for deploying robots in human-centric environments. We study multimodal instruction grounding, where language and gesture provide complementary but ...
理解人类自然指令对机器人在以人为本的环境中部署至关重要。MIGU 研究多模态指令接地,其中语言和手势提供互补但可能不完整或不确定的信息,并将其转化为操作规划。
真实场景里用户的指令经常是模糊的、伴随手势的,单靠 LLM 纯文本理解不够。把语言和手势的不确定性显式建模,对人机协作产品的鲁棒性提升明显,家用机器人和协作机械臂团队可以参考。
Dexterous manipulation depends on contact dynamics that are often only partially observable from vision. Recent World-Action Models (WAMs) couple predictive video world modeling with action generation...
灵巧操作依赖接触动力学,而这些信息往往仅从视觉无法完全观测。DexTacWAM 将视觉-触觉感知与最近兴起的世界-动作模型(WAM,联合预测未来世界状态并生成动作的模型)结合,提升灵巧操作能力。
WAM 目前基本是纯视觉,这篇加入触觉是个重要补充——抓握力控这类任务里,接触信息视觉根本看不到。视觉+触觉的多模态世界模型可能是灵巧手真正实用的前置条件。
Unmanned Aerial Vehicle (UAV) swarms increasingly support safety-critical applications that rely on distributed visual perception. Meeting the low-latency requirements of these applications can requir...
无人机群日益支持依赖分布式视觉感知的安全关键应用。满足这些应用的低延迟要求可能需要专门的通信中间件来协调视觉数据传输。
无人机群编队表演的背后是通信架构的支撑。这个中间件专门解决视觉数据传输的延迟问题,对安防监控和大型灯光秀的稳定性有直接帮助。
Visual instructions for physical tasks are typically authored in one context and followed in another, requiring users to translate demonstrated tools, materials, and spatial relationships into their o...
物理任务的视觉指令通常在一个情境中创作,在另一个情境中跟随,要求用户将演示的工具、材料和空间关系转化为当前环境信息。
看视频学修东西最大的痛点是环境不一样。能实时生成适配当前环境的视觉指令,这对 AR 眼镜上的维修辅助应用是个关键突破。
Autonomous navigation on Mars requires vehicles to distinguish between traversable terrains across diverse and visually challenging environments. However, progress in learning-based navigation for off...
火星自主导航要求探测车在视觉环境多样且极具挑战性的条件下区分可通行与不可通行的地形。本文提出视觉多模态可通行性估计方法,推进地外环境的基于学习的导航。
地外导航没法依赖高精地图和 GPS,纯视觉的 terrain 通行性判断是唯一可行路线。虽然离大多数开发者很远,但其在极端域偏移下的鲁棒性设计对地面越野自动驾驶也有借鉴价值。
Dormant tree pruning is labor-intensive yet essential for maintaining modern high-productivity fruit orchards. In this work, we focus on pruning of modern planar tree training systems - V-Trellis appl...
果树休眠期修剪劳动密集但对维持现代高产果园必不可少。本文聚焦现代平面树形训练系统(如 V-Trellis 苹果园)的修剪任务,采用混合强化学习方法实现视觉引导的机器人修剪。
农业机器人里修剪是最难自动化的一环,比采摘还讲究判断。平面化树形(V-Trellis)其实是'为了机器好做而改造环境'的思路,这种农艺+机器人的协同设计是农业自动化降本的关键策略。
Dexterous grasping requires deciding where to grasp, reaching the target, and maintaining stable contact. We connect these stages through a compact three-point interface that separates global geometri...
灵巧抓取需要决定抓哪里、到达目标并维持稳定接触。本文提出一个紧凑的三点接口,将全局几何决策与局部接触控制解耦,通过模块化设计将各阶段连接起来,实现可控且具反应性的抓取。
把'抓哪里'和'怎么稳住'解耦成模块化接口,是很实用的工程思路,便于各模块独立迭代和替换。做抓取系统的团队可以借鉴这种分层设计,避免端到端模型一改全改的痛苦。
World Action Models (WAMs) jointly generate robot actions and predict future world states, transferring priors from video pretraining to robot control. However, future visual prediction is computation...
世界-动作模型(WAM)联合生成机器人动作并预测未来世界状态,将视频预训练的先验迁移到机器人控制。但未来视觉预测计算开销大,DualWAM 采用双系统架构:全局规划低频运行,局部精化高频运行,实现异步解耦。
类脑的快慢双系统正在成为机器人基础模型的共识架构——大模型低频做规划,小模型高频做控制。这个思路对算力受限的真机部署尤其重要,视觉预测按需触发而非每步都算。
This paper investigates the path-planning problem for systems required to satisfy a linear temporal logic (LTL) specification while achieving a desired long-run visit proportion. For a path represente...
本文研究在满足线性时序逻辑(LTL,一种用逻辑公式描述系统长期行为规范的形式化方法)规格的同时实现期望长期访问比例的路径规划问题,针对路径表示给出控制综合方法。
形式化方法+机器人规划是偏理论但不可替代的方向,比如巡逻机器人'每个点每小时至少访问一次'这类带比例约束的任务,靠启发式很难保证。做安防巡逻、仓库盘点机器人调度的团队可能用得上。
Reaching a 6-DoF grasp pose in clutter requires a collision-free trajectory, conventionally obtained by reconstructing the scene in 3D and planning inside that reconstruction, at the cost of its accur...
在杂乱环境中到达 6 自由度抓取位姿需要无碰撞轨迹,传统方法要先重建三维场景再在重建结果中规划,精度和速度都受制于重建质量。本文提出 SE(3) 神经势场,直接从图像端到端生成轨迹,跳过显式 3D 重建。
去掉显式 3D 重建这一步,既省算力又避免了重建误差向规划的传播。从图像直接到轨迹的端到端范式正在抓取领域兴起,做机械臂分拣的团队值得对比一下和传统 grasp+motion planning 流水线的实际效果。
This paper presents a novel initialization method for range-aided simultaneous localization and mapping (RA-SLAM). The general SLAM problem has a well-known separable structure where landmark and robo...
本文提出一种新的距离辅助同步定位与建图(RA-SLAM)初始化方法。SLAM 问题具有可分离结构,其中路标和机器人状态可分开估计,该方法利用精确的航向信息提升初始化的鲁棒性与速度。
SLAM 初始化失败是实际部署中最常见的翻车点之一。利用航向先验(比如来自 IMU 或双天线 GNSS)来稳住初始化,对 GPS 拒止环境下的无人机和车辆定位很实用。
Multi-robot systems have shown increasing viability in construction due to their ability to execute high-precision actions while reducing human exposure to hazardous tasks. However, these environments...
多机器人系统在建筑领域日益可行,能执行高精度动作并减少人员暴露于危险任务。但施工环境动态变化,CAST 实现同步的轨迹估计与规划,支持多机器人碰撞感知的装配作业。
建筑机器人是被低估的赛道,劳动力短缺+高空作业危险让自动化需求很刚性。多机器人协同装配加上动态避碰,这篇工作的场景设定很贴近真实工地,比实验室演示更进一步。
Diffusion models offer flexible motion generation, but translating this flexibility into feedback-responsive humanoid control remains challenging. Hierarchical systems steer motion through references ...
扩散模型能灵活生成动作,但把这种灵活性转化为能响应反馈的人形机器人控制仍有挑战。分层系统通过参考轨迹引导动作,PredActor 采用预测动作扩散,实现机载的实时可操控人形控制。
扩散模型做控制的最大瓶颈是采样慢,能在人形机器人机载算力上实时跑是个工程突破。可操控性(steerability)意味着上层指令可以实时改变下层动作,这是人形机器人走向实用控制的必要一步。
This paper studies the minimum time trajectoriesvof a car-like mobile robot navigating in an obstacle free environment. The robot, with forward and backward speeds, is controlled by bounded front-whee...
本文研究类车移动机器人在无障碍环境中的最短时间轨迹问题。该机器人可前进和倒退,前轮转角有界,在刚性车轮不发生侧滑的约束下求解时间最优轨迹。
经典的运动规划理论工作,是 Reeds-Shepp 曲线的扩展与深化。虽然理论性强,但这类时间最优轨迹是自动泊车和低速自动驾驶的底层算法基础,泊车算法工程师应该不陌生。
Scalable simulation is essential for robot data generation, policy training, evaluation, and safe iteration, yet real-world interaction is costly and conventional simulators require labor-intensive co...
可扩展的仿真对机器人数据生成、策略训练、评估和安全迭代至关重要,但真实世界交互成本高昂,传统仿真器需要大量人工配置。Uranus 旨在构建下一代具身智能仿真基础设施,降低仿真环境的搭建成本。
具身智能的瓶颈正在从模型转向数据,而数据瓶颈的核心是仿真环境太贵。谁能把'配置一个新仿真任务'的成本从几周降到几小时,谁就卡住了具身智能的数据入口,Uranus 押注的正是这个位置。
Learning robot manipulation policies from human video demonstrations constitutes a promising avenue for scalable robot learning. However, comparing different human-to-robot (H2R) transfer methods rema...
从人类视频演示中学习机器人操作策略是可扩展机器人学习的有力方向,但不同人-机(H2R)迁移方法的比较仍缺乏统一标准。H2RBench 提供一个真到仿真的基准,系统评估各类 H2R 迁移方法。
人类视频是最廉价的机器人训练数据来源,但各家方法没法横向比较一直是问题。有了统一 benchmark,这个方向的进展速度会加快——就像 sim2real 有了标准评测后快速发展一样。
Aerial manipulators represent the forefront of aerial robotics. Although potentially capable of complex interaction tasks, controlling aerial manipulators throughout the dynamic transitions occurring ...
飞行机械臂(无人机+机械臂)代表空中机器人的前沿。虽然潜在具备复杂交互任务能力,但在自由飞行与接触之间的动态过渡阶段的控制极具挑战。本文提出切换自适应控制框架来处理这些过渡。
飞行机械臂最难的不是飞也不是抓,而是从'自由飞'切到'接触作业'的瞬间,动力学特性完全变了。切换自适应控制是处理这类模式突变的老牌工具,用在空中作业场景是很自然的结合。
Latent world models predict the consequences of actions, but accurate prediction does not guarantee that latent distance reflects which candidate will execute successfully. We identify a decision-loca...
潜在世界模型预测动作的后果,但预测准确并不保证潜在空间中的距离能反映哪个候选动作会成功执行。本文识别出决策与潜在表征之间的对齐缺失,提出 D-JEPA 来构建决策对齐的潜在世界模型。
这篇文章戳中了世界模型的一个理论盲点:预测得准不等于可用于决策。如果潜在空间的度量不与任务成功对齐,用它做规划就是在错误的空间里搜索。对做基于世界模型的 planning 的人来说是必读的反思。
World action models generate actions together with visual predictions of their consequences. These paired outputs create the potential for planning by sampling multiple actions from one state, compari...
世界-动作模型同时生成动作及其后果的视觉预测,这种成对输出使得测试时规划成为可能:从同一状态采样多个动作,比较预测后果后择优执行。本文系统研究该规划范式的效果与视觉质量之外的因素。
把 LLM 的 test-time scaling 思路搬到机器人控制——多采样、比较、择优。这篇的价值在于系统拆解了'什么因素让测试时规划有效',而不是只报个好结果,对想在真机上省训练成本的团队有直接参考价值。
Humanoid robots are increasingly being popular and developed for human-centered applications, yet their ability to provide intelligent conversations and natural interactive knowledge assistance remain...
人形机器人日益普及,但在提供智能对话和自然交互知识协助方面仍有不足。本研究为大语言模型驱动的知识助手设计了框架,旨在提升机器人的人机交互能力。
人形机器人落地的瓶颈不在硬件而在“脑子”够不够用。把 LLM 做成知识助手而非单纯聊天,能直接提升家庭服务场景的实用性,比如老人陪护时的用药提醒。
Robotic perception often requires solving large nonlinear least-squares (NLS) problems. While sparsity has been widely exploited to scale solvers, a complementary and underused structure is \emph{sepa...
机器人感知常需解决大型非线性最小二乘问题。虽然稀疏性已被广泛利用,但可分离结构这一互补且未充分利用的结构能进一步优化求解效率。
感知算法的优化往往藏在数学细节里。这种利用可分离结构的方法能显著降低计算负载,对于算力受限的边缘端机器人部署是个实用技巧。
Data-driven protection may complement conventional relays in distribution grids whose operating conditions vary with distributed generation, switching events, and changing short-circuit levels. We stu...
数据驱动的保护可能补充传统继电器,适用于分布式发电、开关事件和短路水平变化的配电网。我们研究离线强化学习在此场景的应用。
电力电网的稳定性不容试错,离线 RL 正好规避了在线训练的风险。这对智能电网运维是个信号,传统电力工程师得开始补 ML 的课了。
We study scalable peer-to-peer dynamic average consensus (DC) for multi-robot systems under finite-range, finite-rate, and interference-constrained communication. We introduce Adaptive Communication f...
研究了有限范围、有限速率和干扰约束通信下的多机器人系统可扩展点对点动态平均共识。引入了自适应通信机制以优化多机协作效率。
多机协作最怕通信拥堵。这个方案让机器人在带宽有限时自动调整通信策略,适合无人机群在灾区等弱网环境下的协同搜索任务。
Vision-Language-Action (VLA) models map observations to actions with no objective that accounts for how the world responds, so their robustness is bounded primarily by data coverage. World models carr...
视觉 - 语言 - 动作模型将观察映射到动作,没有考虑世界如何响应,因此鲁棒性主要受数据覆盖限制。世界模型携带了环境动态信息。
纯 VLA 模型容易“幻觉”,加上世界模型预测能让机器人动作更靠谱。这种蒸馏方案能在不增加推理成本的前提下提升操作成功率,值得端侧部署参考。
As low-altitude applications expand across emergency response, intelligent transportation, and autonomous operations, they demand communication networks that can deliver flexible, resilient, and rapid...
随着低空应用扩展到应急响应、智能交通和自主操作,它们需要能够提供灵活、弹性和快速响应的通信网络。代理 AI 技术为此提供支持。
低空经济火爆,但无人机群管理还是痛点。Agent AI 让无人机能自己组网和演化,意味着未来物流配送可能不再需要地面站全程盯着。
Human demonstrations offer a scalable way to collect manipulation data, but their contacts may be unstable or infeasible when transferred to a robot hand. Collecting demonstrations directly on the tar...
人类演示提供了可扩展的操纵数据收集方式,但当转移到机器人手时,接触可能不稳定或不可行。直接在目标上收集演示可解决此问题。
遥操作数据最大的问题是手感传不过去。这个方案让人类演示时就能记录触觉反馈,能大幅减少机器人模仿学习时的试错成本。
Robot manipulators are monitored by constraint-specific indicators whose units and gradient scales are not comparable, so they do not provide a common measure of the configuration-space motion remaini...
机器人操纵器由特定约束指标监控,其单位和梯度尺度不可比,因此不提供配置空间运动的共同衡量。本研究提出可行性距离场统一度量。
多约束下的路径规划一直是个数学难题。统一度量标准能让规划算法更稳定,对于复杂工业臂在狭窄空间作业是个底层优化。
Autonomous parking in nonconvex and narrow environments remains challenging. Although optimal-control methods can explicitly enforce vehicle dynamics and collision constraints, nonconvexity compromise...
非凸和狭窄环境中的自动停车仍然具有挑战性。虽然最优控制方法可以明确执行车辆动力学和碰撞约束,但非凸性损害了求解效率。
自动泊车在极窄车位容易失效,LLM 负责高层决策加上最优控制负责底层执行是个好组合。这方案比纯端到端模型更容易通过车规级安全验证。
Tactile sensing is increasingly being incorporated into learning-based robotic manipulation, yet many existing approaches rely on spatially distributed sensors. Here we introduce SpectRobot, a framewo...
触觉感知正日益纳入基于学习的机器人操纵,但许多现有方法依赖空间分布传感器。这里介绍 SpectRobot,一个基于单点传感的框架。
触觉传感器太贵且难集成,单点高频 sensing 是个低成本替代方案。对于想给机械手加触觉但预算有限的团队,这个技术路线值得跟进。
Modern Vision-Language Navigation (VLN) models rely mostly on pre-trained large Vision-Language Models (VLMs) to predict navigation actions. While this fusion of language instructions and visual obser...
现代视觉语言导航模型主要依赖预训练大型视觉语言模型预测导航动作。虽然这种语言指令和视觉观察的融合有效,但缺乏可解释性。
黑盒导航模型出问题很难 debug。这篇工作教你怎么 interpret 模型到底在看什么,对于开发室内服务机器人来说,能减少很多无效迭代。
Embodied AI systems, particularly humanoid robots deployed in real world scenarios require whole-body control policies that are both task-responsive and physically smooth. However, smoothness is not u...
真实场景部署的人形机器人需要既响应任务又物理平滑的全身控制策略,但平滑性通常未被显式建模。该工作提出将平滑性作为优化约束来稳定人形机器人运动。
抖动是真机部署最容易翻车的点,仿真里看不出来的高频震颤到硬件上就是磨损和失控。把平滑性显式做成约束而不是靠 reward 软惩罚,值得做真机 RL 的同学抄一下思路。
Real-time embodied companion interaction requires a robot to infer user intent from streaming speech, generate timely responses, and execute expressive, interruptible motions. Existing systems typical...
实时具身陪伴交互要求机器人从流式语音推断用户意图、及时生成回应并执行可打断的表达性动作。现有系统通常难以同时满足这些要求,MIRA 提出全双工交互方案。
全双工+可打断是陪伴机器人从'演示品'走向'产品'的分水岭,现在的语音交互基本都是半双工的对讲机模式。这个方向和宇树、智元的消费级机器人落地直接相关。
Unlike conventional rigid-link robots defined by discrete joints, continuum robots pose a fundamental challenge for expressing their complex continuous bending configurations for closed-loop control. ...
与传统由离散关节定义的刚性连杆机器人不同,连续体机器人如何表达复杂的连续弯曲构型以实现闭环控制是根本性挑战。该工作利用支柱倾角来估计和控制张拉整体(Tensegrity,由杆件和拉索组成的柔性结构)机械臂的运动学。
连续体机器人的'关节空间'都不好定义,做闭环控制一直是硬骨头。用支柱倾角这种低维几何量来参数化,思路对做手术机器人和软体臂的团队有参考价值。
Physical AI requires models to ground visual and linguistic understanding in real-world environments while accounting for environmental constraints and execution feedback. We introduce MachEmbodied-VL...
物理AI(Physical AI)要求模型将视觉和语言理解落地到真实环境,并考虑环境约束和执行反馈。该工作发布MachEmbodied-VLM,一个统一处理具身认知与多智能体协调的视觉语言模型。
又一个玩家入局具身VLM赛道,差异化点在于把“多智能体协调”也纳入统一模型而不是只做单机认知。目前具身大模型竞争已经很卷,真正拉开差距的会是环境反馈闭环的工程质量而非模型本身。
Physical AI requires models to ground visual and linguistic understanding in real-world environments while accounting for environmental constraints and execution feedback. We introduce MachEmbodied-VL...
物理 AI 要求模型将视觉和语言理解落地到真实环境中,同时考虑环境约束和执行反馈。本文提出 MachEmbodied-VLM(ME-VLM),统一支持具身认知与多智能体协调任务。
“具身认知+多智能体协调”打包进一个 VLM 是个差异化定位,对应的是工厂里多机器人调度的真实需求。看点和多智能体仿真框架(如 Isaac 系列)的集成深度如何。
Vision-Language-Action (VLA) models have demonstrated remarkable generalization in robotic manipulation via large-scale multimodal pretraining. However, VLA models are mainly trained on 2D-centric obs...
视觉-语言-动作(VLA)模型通过大规模多模态预训练在机器人操作上展现了出色的泛化能力,但主要基于 2D 观测训练。Bridge3D 使 VLA 模型具备 3D 感知与执行能力。
VLA 卷到 2D 观测的天花板后,3D 表征是下一个必争之地——遮挡和空间关系是 2D 模型永远补不齐的短板。做机械臂抓取的可以开始关注 3D-native 的 VLA 数据管线了。
Contact-rich precision insertion is a key manipulation skill in robotic assembly. Tight clearances make insertion more sensitive to alignment errors and prone to collisions and jamming, while variatio...
富接触精密插装是机器人装配中的关键技能。微小配合间隙使插装对对位误差极其敏感,容易碰撞和卡死,物体变化也带来挑战。InsertAnything 实现了仿真到现实迁移的通用精密插装。
插装是工业装配里最刚需也最难的一环,3C 和汽车产线的自动化率瓶颈基本都在这。能 sim2real 泛化的方案如果稳定,商业价值比刷抓取 benchmark 高一个量级。
Visuomotor policies trained from a few demonstrations may reproduce demonstrated trajectories without reliably following changes in object position. Existing approaches with explicit attention typical...
从少量演示训练的视觉-运动策略可能只是复现演示轨迹,无法可靠跟随物体位置变化。TACIT 利用触觉接触信号来监督空间注意力,提升灵巧操作策略的泛化性。
少样本模仿学习最大的坑就是策略'背轨迹'而不是学技能。用触觉信号做注意力监督,等于给策略一个'碰到了才知道在哪'的物理先验,比纯视觉方案更鲁棒。
Pneumatic proprioceptive actuators integrate actuation and sensing for soft robots that attract interest due to functional potential. Existing approaches often suffer from assembly errors or stress co...
气动本体感知驱动器为软体机器人集成了驱动与感知功能,但现有方法常受装配误差或应力集中困扰。该工作用单材料 3D 打印制造出一体化力感知软驱动器。
软体机器人卡在'传感和驱动分家'的制造环节很久了,单材料一次打印成型意味着驱动器可以低成本量产。对做软体抓手和穿戴设备的团队是实打实的工艺突破。
Real-time motion planning remains challenging in large and high-dimensional environments. Prior acceleration of RRT* follows tree-centric state organization, which reduces per-query cost but preserves...
大尺度高维环境中的实时运动规划仍然困难。以往 RRT*(快速探索随机树算法)加速采用以树为中心的状态组织方式,降低了单次查询成本但整体扩展性受限。ScaleMPA 提出网格原生表征来重新设计可扩展加速方案。
运动规划这边被学习派挤压几年后,经典算法的工程优化又回来了——仓储机器人和无人机集群的场景对规划延迟要求是毫秒级。网格原生表征这个换法在多人多机调度场景值得一试。
This work investigates the use of flow-based connectivity maintenance constraints in mixed-integer linear programming (MILP) trajectory planning and decision-making models for networked multi-agent sy...
该研究在混合整数线性规划(MILP,一种可求得最优解的优化方法)轨迹规划与决策模型中引入基于流的连通性保持约束,用于维护网络化多智能体系统间的通信连接。
无人机集群执行任务时“不能飞出通信范围”是个硬约束,但传统几何约束方法很保守。用网络流来建模连通性,既能保证连通又能放松对编队形状的过度限制,做集群任务规划的可以试试替换现有约束。
Intelligent transportation systems require Incremental Learning (IL) to continually improve their overall performance in dynamic environments. However, most edge devices lack the computational resourc...
智能交通系统需要增量学习(IL)在动态环境中持续提升性能,但大多数边缘设备算力有限。MECAIL 提出仅需 14.6 KB 的时空专家模块,实现通信感知的轻量级增量学习。
14.6 KB 的模块尺寸意味着可以直接刷进路侧摄像头级别的边缘设备,增量学习不用回传数据也节省了带宽。做车路协同和智慧交通的工程师值得跟进这个技术路线。
Low-bit vision-language-action inference must reduce observation-to-action latency while preserving robot behavior. We present FoldQuantVLA, a post-training quantization framework that carries a consi...
低比特 VLA(视觉-语言-动作模型)推理需要在保持机器人行为的同时降低从观测到动作的延迟。FoldQuantVLA 是一个训练后量化框架,通过一致性折叠实现原生低比特量化。
VLA 模型动辄几 B 参数,边缘设备根本跑不动,量化是落地的硬前提。训练后量化不用重训就很实用,但要注意量化后策略行为漂移的评测方法。
Monocular RGB-based hand pose estimation has emerged as a critical research frontier in computer vision. The local hand pose estimation methods predict hand poses relative to the wrist, while global h...
单目 RGB 手部姿态估计是计算机视觉的重要研究方向。局部方法预测相对于手腕的手部姿态,而全局方法则估计手在相机空间中的位置与朝向。本文利用 Vision Transformer(ViT,一种基于自注意力机制的视觉模型)提升相机空间下的手部姿态估计精度。
手部姿态估计是 AR/VR 交互和手势控制的底层能力,从手腕相对坐标扩展到全局相机空间坐标,意味着设备能真正理解手在三维场景中的位置。做手势交互应用的开发者可以关注其开源代码能否直接落地。
In this work, we propose a haptic update control law that uses reaction torques to correct axial misalignment during robotic valve manipulation. Unlike vision-based estimates, which can be affected by...
该工作提出一种触觉更新控制律,利用反作用力矩在机器人拧阀门时校正轴向对位偏差。与视觉估计不同,该方法不受遮挡和光照影响。
工业现场阀门、法兰这类零件基本都是视觉盲区,力矩反馈是被低估的免费信号——六维力传感器已经装在臂上了,只是没人好好用。这类方案在核电、化工巡检场景很有价值。
Egocentric video offers a scalable source of physical interaction experience, yet translating it into robot-executable knowledge and enabling continual adaptation remain challenging. We introduce Zeva...
自我中心视角视频是可扩展的物理交互经验来源,但将其转化为机器人可执行知识并实现持续适应仍具挑战。Zeva-Ego 引入中期训练和上下文因果学习来利用这些视频。
人类操作视频是零成本的数据金矿,比遥操作采集便宜几个数量级。用'中期训练'(在预训练和微调之间插入的阶段)消化 ego 视频,这个 pipeline 对数据饥渴的 VLA 模型很关键。
Voice-controlled interaction in industrial settings is hampered by acoustic noise, which severely degrades audio-only speech recognition. Audio-visual speech recognition (AVSR) addresses this by fusin...
工业场景中的语音交互受噪声严重影响,纯音频语音识别性能大幅下降。视听语音识别(AVSR)通过融合视觉信息解决该问题,NAVIR 进一步用神经形态(事件驱动)计算实现边缘硬件部署。
工厂车间 90 分贝噪声里语音交互基本不可用,唇读+音频融合是正解。神经形态芯片能把这个算力压到边缘端,对做工业可穿戴和安全巡检的团队是个可落地方向。
Tactile sensing is an essential modality for robots performing contact-rich, dexterous manipulation, particularly under visual occlusion. While pre-trained image encoders are standard in robot learnin...
触觉感知是机器人执行富接触灵巧操作的关键模态,尤其在视觉遮挡下。虽然预训练图像编码器已是机器人学习标配,但触觉领域缺乏类似方案。Tactile-JEPA 借鉴 JEPA(联合嵌入预测架构)思路,学习拓扑感知的触觉表征。
视觉有预训练模型可以用,触觉一直是从头训,数据效率极低。把 JEPA 自监督范式搬到触觉上,如果验证有效,电子皮肤和视触觉传感器的应用门槛会降一截。
We propose a safety-critical framework for the cooperative transportation of passive targets in microgravity, where a team of chaser robots acts through unilateral pushing contacts to track a human-pr...
该研究提出微重力(如太空站)环境下被动目标协同运输的安全关键框架:一组追踪机器人通过单侧推压接触跟踪人类指定的参考轨迹。
太空在轨服务(清理碎片、搬运载荷)是未来十年的确定需求,无抓取器的纯推压方案对硬件要求极低。人机协同控制环的设计说明短期内全自主还不敢托付,这种保守设计反而更容易上真任务。
Robotic foundation models achieve impressive performance on standard manipulation benchmarks, yet these evaluations typically assume clean, timely, and consistent visual observations throughout execut...
机器人基础模型在标准操作基准上表现优异,但这些评测通常假设执行全程视觉观测干净、及时且一致。LIBERO-VPro 专门评测闭环执行中的视觉鲁棒性。
现在 VLA 论文的分数都是'实验室灯光完美、相机不掉帧'条件刷出来的。这个 benchmark 专门打脸视觉扰动场景,建议做模型选型的先跑一遍它再信宣传数字。
In social navigation, modeling the complex interactions between humans and robots is difficult, and deep reinforcement learning has therefore been actively studied. However, because simulation alone c...
社交导航中,人与机器人交互建模困难,深度强化学习被广泛研究,但仅靠仿真训练难以覆盖真实人群。该工作用扩散引导(Diffusion Steering)实现保持已有性能的在线适应。
sim2real 在社交导航里最难,因为行人的反应分布没法穷举。扩散引导的好处是适应新环境时不覆盖原策略,服务机器人在商场、医院部署可以参考这个框架。
Analog video transmission (VTX) remains widespread in FPV drones due to low latency, weight and low cost. However analog VTX suffers from complex spatially structured image degradation which differ fu...
模拟视频传输(VTX)因低延迟、轻量和低成本在 FPV 无人机中仍被广泛使用,但其图像退化复杂且空间结构化,与数字图传差异巨大。AnalogDepth 从模拟图传画面中恢复多视角几何信息。
大家都在卷数字图传的 SLAM,但竞速和穿越机玩家大量用的还是几块钱的模拟图传。能从雪花噪声画面里提深度信息,对低成本无人机自主飞行是条务实的路线。
Deploying language-conditioned manipulation without a dedicated GPU requires efficient inference and action chunks that cover the delay between policy queries. We present vla.simd, a CPU inference eng...
在没有专用 GPU 的情况下部署语言条件操作,需要高效推理和能覆盖策略查询间隔的动作块。vla.simd 是一个 CPU 推理引擎,利用 SIMD 指令优化 VLA 模型推理。
VLA 不一定非要 GPU——大量场景(机械臂、教育机器人)对成本极度敏感。CPU 推理引擎配 action chunking 的组合,把 VLA 的部署硬件门槛打下来了,值得关注其延迟数据。
Current embodied systems largely rely on pretrained capabilities that remain fixed after deployment, limiting their ability to learn from physical interaction. We introduce MachEmbodied-Brain (ME-Brai...
当前具身系统依赖部署后固定的预训练能力,限制了从物理交互中学习的能力。该工作发布MachEmbodied-Brain(ME-Brain),将记忆、认知与行动整合为可持续进化的具身智能架构。
“部署后不能学习”确实是当前具身智能和LLM共有的天花板,ME-Brain把记忆机制作为突破口是对的方向。但持续学习带来的遗忘和稳定性问题在这个架构里解决到什么程度,需要看实验细节,谨慎乐观。
3D Gaussian Splatting (3DGS) provides high-fidelity scenes for large-scale embodied simulation, but constructing large-scale urban assets remains constrained by expensive equipment and delayed quality...
3D 高斯泼溅(3DGS)能为大规模具身仿真提供高保真场景,但构建大规模城市资产仍受昂贵设备和质量反馈滞后制约。OpenFlyScan 用消费级无人机实现质量引导的航拍重建。
具身智能的数据瓶颈正在从'动作数据'转向'3D 场景资产'。用消费级无人机+实时质量引导来建城市场景,意味着小团队也能自建仿真环境,不用再依赖昂贵的采集车。
Audio-based localization provides a low-cost and illumination-independent sensing solution for anti-UAV early warning. However, existing methods typically rely on a predefined fixed audio segment leng...
音频定位为反无人机预警提供了低成本、不依赖光照的感知方案,但现有方法通常依赖预定义的固定音频片段长度。该工作用强化学习实现自适应的时间对应来提升定位精度。
反无人机现在是从军工到大型活动安保的刚需,雷达太贵、光电怕暗,声学阵列是性价比路线。RL 自适应选音频片段这个思路比固定窗口更贴近真实噪声环境。
Reliable perception is essential for underwater vehicles operating in complex environments, where light attenuation and scattering often degrade visibility and compromise optical sensing. Forward-look...
可靠感知对复杂环境中的水下航行器至关重要,光的衰减和散射常使光学传感失效。前视声呐是水下主要感知手段,该工作结合里程计信息实现水下实时建图。
水下是机器人感知最难的场景之一——GPS 没有、视觉失效,只能靠声呐。实时声呐建图对深海养殖检测、桥墩检修这些商业潜水服务是直接的降本手段。
Pedestrian head orientation recognition plays an important role in autonomous driving by providing valuable cues for understanding pedestrian attention and anticipating potential crossing behavior. Ho...
行人头部朝向识别对自动驾驶很重要,它能提供行人注意力方向的线索,帮助预判其横穿行为。本文提出一种轻量级网络,可在车载计算资源受限的条件下实时运行。
头部朝向是判断行人是否要过马路最直接的信号之一,比纯轨迹预测更前置。关键是这类轻量模型能和现有感知栈并行部署,对 L2/L2+ 级量产方案是低成本增量。
Vision-language navigation requires embodied agents to navigate environments using natural language instructions and visual observations. Existing approaches typically decompose navigation into sequen...
视觉-语言导航要求智能体根据自然语言指令和视觉观察在环境中导航。现有方法将导航分解为序列步骤,该研究提出物体-路径图的拓扑表示,将物体与路径统一建模以支持开放词汇(即不限于预定义类别)的实例导航。
开放词汇导航的痛点是“指令里的物体”和“地图里的位置”对不上号,物体-路径图把两者显式关联是个干净的解法。对做商场、仓库里“去找某个具体商品/货位”这类应用的同学,这个表示可以直接拿来用。
Autonomous endoscopic navigation requires the policy model to predict actions from texture-poor monocular observations, make safe control decisions, and retain evidence of lesions after they leave the...
自主内镜导航要求策略模型从缺乏纹理的单目观测中预测动作、做出安全控制决策,并在病灶离开视野后保留证据。StenoVLA-3D 结合 3D 感知与推理能力应对胃肠道狭窄段导航。
医疗 VLA 是个被低估的赛道:内镜医生短缺是全球性问题,狭窄段穿越又是新手最容易卡住的环节。3D 感知补上单目深度缺失,这类工作离临床审批的路径比通用机器人更清晰。
Visual grasp proposal generation has advanced rapidly, yet converting a selected proposal into a stable physical grasp remains a central execution-stage challenge. This paper introduces GraspTune, a t...
视觉抓取提案生成已进展迅速,但将选定的提案转化为稳定的物理抓取仍是执行阶段的核心挑战。GraspTune 引入触觉驱动的执行阶段精调来提升抓取鲁棒性。
抓取论文大多卷'提案生成',但产线上真正翻车的往往是执行阶段——提案再好,闭合过程的滑动和碰撞没人管。用触觉反馈做执行期精调,是把抓取成功率从 demo 拉到可用的关键补丁。
Embodied AI systems are often organized into System 1 and System 2. System 1 is typically a pretrained policy that generates actions at high frequency, whereas System 2 is often instantiated as a visi...
具身 AI 系统通常分为 System 1(高频生成动作的预训练策略)和 System 2(视觉语言推理模块)。该工作对 GPT-6 Astra 在机器人基准 RoboDojo 上的表现进行了早期评测。
如果通用多模态大模型直接在机器人基准上打榜成功,VLA 创业公司的技术护城河会被重新定价——'专用策略模型'的叙事可能撑不住。建议看下它的失败案例分布,是泛化真强还是刷榜技巧。
Robot visuomotor policies are commonly formulated as autoregressive, diffusion-based, or more recently, flow matching models. Among them, Action-to-Action (A2A) flow matching improves inference effici...
机器人视觉-运动策略常用自回归、扩散或近来的流匹配模型来构建。其中 Action-to-Action(A2A)流匹配提升了推理效率,该工作提出以物体为中心的条件化来改进这一范式。
扩散策略推理慢的问题在流匹配这边逐步被解决,但条件化方式决定了泛化能力。以物体为中心而不是以图像为中心做条件,等于把'对什么操作'和'怎么操作'解耦,小样本换物体任务会明显受益。
We present MimicAgent, a prompt-to-trajectory generation framework for learning dynamic quadruped skills. Although reward shaping is extensively used when training quadruped policies, navigating the r...
MimicAgent 是一个从文本提示生成四足机器人运动轨迹的框架。虽然奖励塑形在四足策略训练中被广泛使用,但为动态技能导航复杂的奖励设计空间仍然困难,该框架绕开了手工奖励设计。
四足圈的 reward 工程是出了名的玄学,一个后空翻要调几十项奖励。prompt 直接生成轨迹再模仿,等于把技能设计从'调参工程师'换成'自然语言',宇树这类整机厂的内容生态会直接受益。
Body-cue recognition can support assistive robots, but benchmark accuracy does not guarantee reliable behavior under a robot-camera viewpoint. We present Nuni, a bedside robot prototype that treats a ...
身体线索识别可辅助陪护机器人,但基准数据集上的高精度并不保证在机器人摄像头视角下的可靠表现。研究团队开发了床旁机器人原型 Nuni,采用'先提问再行动'的交互策略来弥合这一差距。
这篇文章点破了一个行业痛点:实验室 benchmark 精度和真实机器人视角下的表现经常脱节。做医疗陪护机器人的团队应该学一下'先问再做'的设计思路,主动向用户确认比硬猜靠谱得多。
Robots can recover from failures by asking bystanders for help, but effective human-in-the-loop recovery requires communication that accounts for differences in people's knowledge. Prior inverse-seman...
机器人可以通过向旁观者求助来从故障中恢复,但有效的人在回路恢复需要考虑不同人知识背景差异的沟通方式。以往的反向语义学习方法在这方面存在局限,本文提出了改进方案。
机器人从'不会问'到'会问对问题'是个实用跨越。在仓储、工厂等机器人部署密度上升的场景,故障时能高效求助人类,比一味追求零故障更经济。
Long-term embodied AI will undergo learning, model updates, memory compression, hardware repair, and migration across embodiments. For users who have formed sustained relationships with such systems, ...
长期运行的具身AI(即有物理身体、能与环境交互的AI系统)会经历学习更新、记忆压缩、硬件维修和载体迁移。对于与这些系统建立了长期关系的用户而言,研究提出了身份连续性评估框架,确保AI在多次变更后仍能被用户识别为“同一个伙伴”。
这个问题以前没人认真研究过:当陪伴机器人换了硬件或更新了模型,用户感知的“它还是它吗”会直接影响产品留存。做陪伴机器人、家庭机器人的团队应该早点把身份连续性设计进产品,而不是等用户流失了才补救。
Bimanual interaction produces complementary tactile views of the same physical process, yet existing tactile representation learning largely models the two hands independently or combines them only fo...
双手操作同一物理过程会产生互补的触觉信息(触觉即机器人皮肤感知的接触力信息),但现有触觉表征学习大多独立建模两只手。该方法通过交叉补全任务,让一只手的触觉信息帮助预测另一只手,学习更统一的双手触觉表征。
双手协作操作是机器人走向真实任务(如叠衣服、装配)绕不开的关卡,而触觉恰恰是当前双手机器人最缺的感知模态。这个交叉补全的自监督思路不依赖昂贵标注,值得做灵巧手和触觉传感的工程师关注。
In environments with large movable obstacles, detour-only navigation can be inefficient or even infeasible, while obstacle interaction requires reasoning about navigation benefit, feasible placement, ...
在大体积可移动障碍物环境中,只绕行的导航策略可能低效甚至不可行。该研究让机器人在导航时推理障碍物交互的收益与可行放置位置,通过离散接触推压(即用身体直接推挤物体)主动清理路径。
仓储和物流场景里货物乱堆是常态,“绕不过去就推开”这个思路比纯避障实用得多。关键贡献在于把“推哪里、推完去哪”纳入导航规划,避免了暴力清障带来的次生问题。
Manipulation under time constraints requires both accurate actions and an execution rhythm that matches the evolving scene. This becomes critical when a robot must intercept moving objects or complete...
时间受限下的机器人操作不仅需要准确动作,还需要与场景演化节奏匹配的执行节律。该研究提出共享执行时钟漂移策略,用于拦截移动物体或在限定时间内完成任务等动态精密操作场景。
抓取传送带上的物体、接抛物这类任务的难点从来不是“抓得准”而是“抓得巧”——时机对了动作可以很简单。用可漂移的执行时钟替代固定控制频率,是应对动态场景的一个很聪明的设计,做工业分拣的可以借鉴。
Safety-critical control under uncertainty requires uncertainty representations that are both statistically valid (for certifiable performance) and compatible with enforceable safety constraints. Howev...
不确定环境下的安全关键控制需要既统计有效(可认证性能)又可与可执行安全约束兼容的不确定性表示。保形预测(Conformal Prediction)是一种无需分布假设即可给出统计保证的方法,本研究将其自适应分位数区间形式用于安全控制。
保形预测这两年从学术界烧到了机器人安全领域,核心卖点是“分布假设最少、还能给数学保证”。对于要过功能安全认证的自动驾驶和工业机器人团队,这类可认证的不确定性量化方法会是合规审查的加分项。
Vision-language-action (VLA) policies increasingly incorporate structured intermediate supervision beyond action labels. Yet specifying what an intermediate representation should encode leaves open ho...
视觉-语言-动作模型(VLA,即接收图像和指令直接输出机器人动作的模型)越来越多地引入动作标签之外的结构化中间监督。该工作通过分阶段的动作接地,研究中间表征应该编码什么、如何分阶段注入监督信号。
VLA直接端到端学动作的路线在长尾任务上数据效率很低,业界已经开始回流到“分阶段接地”这种带结构化监督的老思路。做机器人模仿学习的可以参考它的阶段划分,能显著降低对演示数据量的需求。
Trajectory planning and control in field robotics rely on predicting how propulsion and steering affect vehicle motion when contact points undergo slip. For articulated vehicles, the point-contact kin...
野外机器人的轨迹规划依赖对推进和转向如何影响车辆运动的预测,尤其在接触点发生打滑时。针对铰接式车辆,该研究提出有限支撑运动模型,用于单轨中央铰接机器人的转向与轨迹控制。
农业机械、林业机械大多 是中央铰接结构,打滑建模直接决定自动导航能不能下地干活。这类“枯燥但关键”的车辆运动学工作,是野外自动化落地前的必经一步,相关行业工程师值得细读。
In a decentralized multi-robot team under partial observability, the fact that decides a robot's next action is often visible only to a teammate. Existing decentralized methods communicate kinematic i...
在部分可观测的分散式多机器人团队中,决定机器人下一步行动的关键事实往往只有队友能看到。现有方法多通信运动学信息,该研究用自监督学习得到的感知潜在表征(latent,即压缩的语义特征)进行通信,传递更有决策价值的信息。
多机通信带宽有限,传原始图像太贵、传坐标又不够。用自监督latent传“队友需要知道的语义”是个务实方向,无人机集群和搜救团队的通信设计可以直接参考这套思路。
A robot policy is trained with one of two action parameterizations: absolute joint targets, or deltas relative to the current state. The choice is a live engineering decision in robot learning, and a ...
机器人策略训练时动作参数化有两种选择:绝对关节目标,或相对当前状态的增量(delta)。研究发现这一工程选择会显著影响世界模型的预测性能,动作的书写方式并非无关紧要。
这个结论很扎心:很多团队在VLA/world model上调了几个月架构,结果性能差异可能主要来自absolute和delta动作表征这种“随手决定”的细节。建议对照自己的数据管道检查一遍,可能是免费的性能提升。
Assembly remains a challenging robotic manipulation task in presence of tight tolerances and complex contact interactions. While Learning from Demonstration (LfD) frameworks like Dynamic Movement Prim...
在紧公差和复杂接触交互下的装配任务仍是机器人操作的难点。该研究在动态运动基元(DMP,一种从演示中学习的轨迹生成方法)框架上增加任务感知能力,实现装配过程中的失败检测与自动恢复。
工业装配是机器人付费意愿最强的场景之一,但真实产线上失败恢复能力比成功率更能决定可用性。把失败检测嵌入DMP而不是靠外挂监控,这种“恢复内建”的思路对做精密装配的团队很有参考价值。
3D scene graphs provide semantically rich and hierarchical representations for robot perception. However, existing systems do not maintain uncertainty as an explicit belief or propagate it through the...
3D场景图为机器人感知提供语义丰富的分层表示,但现有系统不维护不确定性。该研究提出概率场景图,将不确定性作为显式信念维护并在系统各层传播,同时保持实时运行。
场景图做机器人感知的团队不少,但大多假装感知结果是确定的——这在动态环境里会出大事。把不确定性显式建模并传播到规划层,是让语义地图真正可信的必要一步,长期跑真实环境的团队应该跟进。
Large scale warehouse automation relies on efficient multi agent path finding (MAPF) to coordinate thousands of robots in structured environments. Existing MAPF algorithms primarily improve conflict r...
大规模仓储自动化依赖高效的多智能体路径规划(MAPF)来协调数千台机器人。现有MAPF算法主要优化冲突解决效率,TRACS引入几何感知,在结构化仓储环境中实现更可扩展的路径规划。
仓储MAPF已经是红海(海康、极智嘉都在卷),千台级机器人的调度瓶颈往往不在冲突消解而在空间利用率。几何感知这个切入角度对提升货架通道通行效率有实际意义,做调度算法的可以对比一下。
Recent advances in vision-language-action models have stimulated growing interest in underwater embodied intelligence. However, their reliance on large-scale interaction data limits their applicabilit...
视觉-语言-动作模型推动了水下具身智能的发展,但其对大规模交互数据的依赖限制了实际应用。AquaCap采用“代码即策略”(Code-as-Policy,即用大模型生成可执行代码来控制机器人)范式,无需训练即可执行水下任务。
水下机器人缺数据是行业公认痛点,VLA那条路短期走不通。“免训练+LLM生成控制代码”绕开了数据问题,虽然上限不高但对海洋探测、水产养殖这类低频任务够用了,是务实的工程选择。
Soft everting robots can traverse long, confined paths by continuously growing, yet active interaction remains limited to a single tool fixed at or near the tip, unable to be repositioned on demand an...
软体外翻机器人(通过持续“生长”穿越狭长空间的软体机器人)能穿越长距离受限路径,但末端主动交互能力有限。该研究通过贴壁回缩机构和可展开手指,实现末端工具的按需重定位与操作。
外翻机器人在管道检测、搜救领域很独特,但“只能看不能动手”一直是硬伤。可展开手指+贴壁回拉让它在管道内做阀门操作成为可能,对核电、石化管道维护这种高价值场景是实质性进展。
Language-guided object retrieval under partial observability requires deciding whether to gather more evidence, interact with the scene, grasp a candidate, or abstain. We present a closed-loop framewo...
部分可观测环境下的语言引导物体检索需要决定:继续收集证据、与环境交互、抓取候选物体,还是放弃。该研究提出闭环框架,让机器人在这些选项间做出合适的选择性承诺。
“找不到就硬抓”和“找不到就一直找”都是失败模式,这个工作的价值在于把“放弃/继续”本身建模成决策。做家庭服务机器人的会遇到大量“东西不在预期位置”的情况,这个框架直接对症。
Reinforcement learning for off-road navigation requires extensive vehicle-terrain interaction data, which are costly to collect in high-fidelity simulation. World models offer a promising alternative ...
越野导航的强化学习需要大量车辆-地形交互数据,高保真仿真中采集成本高昂。世界模型(学习环境动态的生成模型)提供了替代方案,Verti-WM结合物理先验的外感知信息构建世界模型,降低数据需求。
越野自动驾驶(矿区、农业)最缺的就是好的仿真,物理引擎要么慢要么不准。用世界模型替代高保真仿真+注入物理先验,是当前性价比最高的中间路线,做特种车辆RL的团队值得复现。
Foundation models (FMs) have expanded task and motion planning (TAMP) to manipulation problems specified through language and visual observations. However, incomplete scene knowledge leaves a critical...
基础模型(FM)将任务与运动规划(TAMP)扩展到通过语言和视觉观察定义的操作问题,但不完整的场景知识留下关键缺口。该研究提出功能充分性判据,让机器人知道何时需要主动搜索以补全规划所需信息。
VLM+TAMP的组合现在很热,但多数工作假装场景知识是完整的。把“哪些信息对规划是充分的”显式化,让机器人主动去看遮挡区域,这是从demo走向真实杂乱环境的关键一步。
While simulation-ready deformable assets are essential for in-silico robotic manipulation tasks, existing generation frameworks typically assess physical plausibility after generation, leaving an obje...
可用于仿真的可变形物体资产(如布料、绳索、软体食物)对机器人仿真操作任务至关重要,但现有生成框架在生成后才评估物理合理性。DiGen以智能体方式在生成过程中嵌入基于仿真的诊断。
可变形物体操作(叠衣服、做饭)是家用机器人的核心难点,而仿真资产的物理合理性直接决定sim-to-real的成败。把仿真诊断嵌进生成循环而非事后检查,能省掉大量人工调参,做软体仿真数据管道的值得关注。
Where to look and how to move? A robot navigating an unmapped environment must do both at once, and the two goals pull against each other. The regions most worth observing are the ones the map knows l...
机器人在未知环境中导航时必须同时决定“往哪看”和“怎么走”,且两个目标相互牵制——最值得观察的区域恰是地图最不确定的区域。该研究在3D高斯泼溅(一种新型3D场景表示技术)地图中使用控制屏障函数(CBF,一种安全控制方法)实现安全的主动探索。
3DGS正在从渲染玩具变成机器人地图表示的主流选项,这个工作把主动视角选择和安全控制统一到一个框架里。做自主探索和建图的团队可以关注,相比占用网格地图,3DGS对视角规划的支撑天然更顺。
We study the online deployment of mobile ad hoc networks in unknown orthogonal environments, formalized as the Partially Observable Cooperative Guard Art Gallery Problem. We give a full proof that CAD...
该研究将未知正交环境中移动自组织网络的在线部署形式化为部分可观测合作守卫美术馆问题(一类经典的监视点部署问题),并完整证明了CAD相关算法的性能保证。
听起来很理论,但对应的是实际需求:监控无人机群在未知建筑里怎么布点才能无死角覆盖。给了完整理论证明的部署算法在这个领域不多见,做安防机器人调度的可以以此为基础做工程化。
Large-scale scene reconstruction is a critical foundational technology in robotic autonomous systems such as 3D mapping and autonomous driving. In recent years, 3D Gaussian Splatting (3DGS) has demons...
大规模场景重建是 3D 建图、自动驾驶等机器人自主系统的基础技术。3D 高斯泼溅(3DGS,一种用高斯椭球表示场景的新颖渲染技术)近年来展现出高保真与新视角合成的优势,VDGS 将其扩展到航空场景的大规模重建。
3DGS 正在快速吃掉传统 NeRF 和 photogrammetry 的份额,这篇工作解决了航空级大场景的分块与可见性问题。做低空经济、无人机测绘的团队可以直接参考其分块渲染策略。
Scanning Electron Microscopy (SEM) is a foundational technique for characterizing material microstructure, which dictates many fundamental physical and chemical properties. With the rise of Self-Drivi...
扫描电子显微镜(SEM)是表征材料微观结构的基础技术。随着自驱动实验室的兴起,AutoRASOR 实现了 SEM 的自主快速操作,自动完成材料微观结构的表征流程。
AI for Science 的落地样本:把 SEM 操作这种依赖资深技员的环节自动化,是自驱动实验室(Self-Driving Lab)跑通闭环的关键一步。材料研发和自动化实验平台的公司可以关注其与 LLM agent 的结合方式。