什么是视觉语言导航?
VLN 是视觉语言导航。智能体结合语言指令与视觉观测,理解目标及环境并执行导航。例如“经过货架,在蓝色门旁停下”包含目标识别、空间关系与运动执行等多个问题。
VLN 与传统导航的关系
传统导航通常基于坐标、地图和明确目标点。VLN 进一步研究怎样把自然语言转化为可执行的空间任务。语言理解不能替代底层位姿、障碍检测、控制与安全策略。
语义感知、语义地图与具身智能
语义感知识别物体和区域的含义;语义地图把标签关联到空间;具身智能强调智能体通过实体感知与行动和环境交互。拥有彩色相机或大模型接口,不等同于完成了可靠的真实世界 VLN 系统。
工程评估重点
- 指令歧义与目标识别是否可处理。
- 当前观测是否支持空间推理。
- 规划是否遵守禁行区、碰撞与运动约束。
- 不确定时是否能够停下、请求澄清或交由人工。
- 任务完成是否由可验证结果判断。
极洞关联
彩色双目与多模态位姿输出,可作为更丰富环境理解的输入。O2 的彩色视觉配置为语义应用提供硬件基础;VLN 属于更高层的算法与系统方向,项目是否包含相关功能应单独确认。
