Daily Tech Briefing
AI 科技速览
每天 5 分钟内学习 AI。获取最新的人工智能新闻,理解其重要性,并学习如何将其应用于您的工作。
arXiv AI · 2026/8/2 06:06:28
VLAGuard: A Framework for Evaluating and Mitigating Physical Attention Hijacking in Vision-Language-Action Robots within Wireless Sensor Networks
AI 中文解读
机器人也会“走神”了!新研究VLAGuard发现,当视觉语言动作机器人被贴上特殊贴纸时,会像人一样被干扰,注意力跑偏,导致干活失败。好消息是,他们开发的“注意力保护”训练法能让机器人抗干扰能力大增——实验中任务成功率从23%提升到67%。简单说,这就像给机器人戴上“防分心耳机”,让它不被外界花哨图案迷惑,稳稳完成拿东西、放东西等操作。未来这种机器人用在智能家居或工厂里时,即使环境杂乱、有广告贴纸,也能可靠工作,普通人用起来更放心。
Deploying Vision-Language-Action (VLA) robots as mobile edge nodes within wireless sensor networks (WSNs) requires robust protection against physical adversarial threats. We present VLAGuard, a framework to assess and mitigate a critical vulnerability: policy-critical action-to-vision attention hijacking. We first introduce a stress-test module, Visuomotor Attention-guided Semantic Attack (VASA), using printable patches to severely distract the robot's action-conditioned cross-attention. To counter this, we propose Attention-Protective Fine-Tuning (APFT), a defense that stabilizes spatiotemporal attention and enforces geometric consistency with zero inference overhead. Evaluations across simulated and physical WSN-assisted smart environments demonstrate significant robustness gains. APFT reduces the OpenVLA failure rate from 100.0% to 25.9% in LIBERO simulations. Furthermore, across 2,000 real-world trials, APFT improves the average success rate from 23.0% to 67.4% under severe patch attacks. This highlights that protecting attention pathways is important for improving the robustness of VLA-driven edge nodes in sensor networks.
分享
阅读原文 ↗