首页 /研究 /SA-VLA:状态感知分词器提升视觉-语言-动作模型性能
MANIPULATION

SA-VLA:状态感知分词器提升视觉-语言-动作模型性能

Tengyue Jiang, Chunpu Xu, Jiayue Kang, Yao Mu

发表年份
2026
访问权限
开放获取

摘要

本文提出SA-VLA,一种状态感知的动作分词器,通过将机器人当前本体状态纳入动作解码过程,解决了离散动作分词中固定原型无法适应不同关节配置和接触条件的问题。该方法允许每个离散令牌表示一族状态依赖的连续动作,在保持离散建模效率的同时提升了VLA策略的准确性。

关键词

state-aware tokenizervision-language-action modeldiscrete action tokenizationrobot manipulationVQ-based action tokenization

相关论文

查看 MANIPULATION 分类全部论文