卫星图上给AI一句话,它真能规划安全路线吗?NeSy-Route论文通俗解读

卫星图上给AI一句话,它真能规划安全路线吗?NeSy-Route论文通俗解读

一句话读懂这篇论文:
NeSy-Route不是让多模态大模型简单回答“图里有什么”,而是要求它先理解自然语言中的通行规则,再把规则对应到遥感影像中的具体地物,最后生成一条尽量安全、可行且接近最优的路线。神经网络负责理解,符号系统负责约束和验算。

过去的遥感大模型,大多擅长回答:

  • 图中有没有道路?
  • 哪些地方是农田?
  • 水体位于建筑物的哪个方向?
  • 洪水前后哪里发生了变化?

这些任务主要停留在“看见”和“描述”。

真实灾害救援还需要进一步回答:

看懂环境以后,下一步应该怎么走?

例如:

  • 洪水后车辆怎样绕开积水和断路?
  • 徒步人员怎样避开树林和水体?
  • 无人机怎样绕开高大树木和建筑物?
  • 船只怎样沿可通航水面到达受困区域?

这不再只是遥感识别,而是:

遥感场景理解 + 语言约束理解 + 空间推理 + 路径规划。

2026年,南京大学团队发布预印本:

NeSy-Route: A Neuro-Symbolic Benchmark for Constrained Route Planning in Remote Sensing

提出了一个面向遥感约束路径规划的神经符号评测基准:

NeSy-Route。

它包含:

  • 3607个文本约束理解问题;
  • 12975个文本—影像对齐问题;
  • 10821个约束路径规划问题。

这篇论文真正想回答的是:

多模态大模型究竟是不会理解规则、不会识别遥感地物,还是即使都看懂了,也不会进行全局规划?


一、为什么“识别出道路”不等于“能规划路线”?

假设一张遥感影像中包含道路、建筑物、农田、裸地、草地、树林和水体。

模型即使把所有地物都识别正确,也不一定能找到合理路线,因为规划还必须同时考虑四类问题。

1. 谁在移动?

不同主体的通行能力不同:

  • 行人可以穿过部分草地;
  • 汽车更适合道路和建设用地;
  • 无人机可以飞越水体,但可能需要避开高大树木和建筑物;
  • 船只只能沿水面移动。

2. 目标是什么?

“最短”和“最安全”并不相同:

  • 穿过裸地可能更短,但更难行走;
  • 绕行道路距离更远,却更稳定;
  • 车辆进入农田可能缩短距离,却可能陷车。

3. 哪些约束不能违反?

路线可能需要满足:

  • 不穿越建筑物;
  • 不进入水体;
  • 避开树林;
  • 起点和终点必须连通;
  • 路径必须连续。

4. 局部能走,不代表全局合理

模型可能每个点都没有直接落入障碍物,但整条路线仍可能:

  • 来回折返;
  • 过度绕行;
  • 大量经过高成本区域;
  • 缺乏整体方向。

因此,路径规划比分类和视觉问答更难。


二、神经符号方法:让大模型理解,让规则系统验算

NeSy是:

Neuro-Symbolic,神经符号。

它可以理解为两套系统合作。

神经部分

多模态大模型负责:

  • 阅读自然语言;
  • 识别遥感影像;
  • 理解复杂描述;
  • 输出地物、规则和路线坐标。

符号部分

符号系统负责:

  • 编码土地类型;
  • 定义可通行规则;
  • 设置地物优先级;
  • 构建像元代价图;
  • 检查连通性;
  • 使用A-Star计算最优路线;
  • 精确评价模型输出。

自然语言和遥感影像

多模态大模型理解

符号向量和航路点

通行规则检查

A-Star最优解对比

评价理解、对齐和规划能力

通俗地说:

神经网络像会看图、会听指令的规划员;符号系统像严格执行规则的导航和验算程序。


三、三级任务:把复杂规划拆成三道关卡

在这里插入图片描述

NeSy-Route没有直接要求模型一次完成全部规划,而是将任务拆成三级。

自然语言描述

任务1:理解文本约束

通行向量和偏好向量

任务2:对应遥感影像区域

地物编号、通行状态和优先级

任务3:生成起点到终点路线

检查可行性、代价和几何差异

任务 核心问题
任务1 模型是否真正理解文字规则?
任务2 模型能否把规则对应到影像中的具体区域?
任务3 模型能否生成满足约束且接近最优的路线?

这种设计可以定位失败来源:

  • 任务1失败:没有理解规则;
  • 任务1正确、任务2失败:文字懂了,但地物认错了;
  • 前两步正确、任务3失败:规则和场景都理解了,却不会全局规划。

四、八类地物、四类主体和四种规划目标

在这里插入图片描述
在这里插入图片描述

论文基于OpenEarthMap,将地表划分为8类:

ID 土地覆盖类型 中文理解
0 Bareland 裸地
1 Rangeland 草地或牧场
2 Developed space 建设用地或硬化地表
3 Road 道路
4 Tree 树木或林地
5 Water 水体
6 Agriculture land 农业用地
7 Building 建筑物

论文设置4类移动主体:

  • 行人;
  • 汽车;
  • 无人机;
  • 船只。

地物被分为:

  • 默认可通行;
  • 条件可通行;
  • 永久不可通行。

例如:

主体 默认可通行 条件可通行 永久不可通行
行人 建设用地、道路 裸地、草地、树林、农田 水体、建筑物
汽车 建设用地、道路 裸地、草地、农田 树林、水体、建筑物
无人机 裸地、草地、道路、水体、农田等 树林、建筑物
船只 水体 其他地物

同时设置4种规划目标:

  • 最短;
  • 最快;
  • 最安全;
  • 最舒适。

不同目标会改变地物优先级。例如汽车通常更偏好:

道路 > 建设用地 > 农田 > 草地 > 裸地。


五、任务1:把自然语言翻译成符号规则

任务1只提供文字,不提供遥感影像。

模型需要输出两类向量。

1. 通行向量

长度为8:

V t r a v ∈ { 0 , 1 } 8 V_{trav}\in\{0,1\}^8 Vtrav{0,1}8

其中:

  • 1表示可通行;
  • 0表示不可通行。

例如:

[ 1 , 1 , 1 , 1 , 0 , 0 , 1 , 0 ] [1,1,1,1,0,0,1,0] [1,1,1,1,0,0,1,0]

表示裸地、草地、建设用地、道路和农田可以通过,树林、水体和建筑物不可通过。

2. 偏好向量

同样长度为8,用数值表示地物优先级。

数字越高,越优先选择。

任务1同时考验:

  • 主体类型;
  • 默认规则;
  • 条件例外;
  • 禁止条款;
  • 路径目标;
  • 优先级顺序。

它本质上是一种带正式输出格式的复杂规则理解任务。


六、任务2:把规则准确落到遥感影像上

任务2会给出一张带编号区域的遥感影像。

模型需要判断:

  • 哪个编号区域是道路?
  • 哪个区域是树林?
  • 哪个区域是水体?
  • 每个区域是否可通行?
  • 各区域的优先级如何排序?

输出包括:

  • 区域编号向量;
  • 通行向量;
  • 偏好向量。

需要特别注意:

图像中的候选区域已经被编号,模型并不是从零完成完整语义分割。

因此,任务2更准确的定位是:

区域级遥感识别 + 规则映射 + 跨模态对齐。

它仍然很难,因为模型可能:

  • 认错地物;
  • 混淆区域编号;
  • 地物识别正确,但规则映射错误;
  • 规则正确,却输出到了错误的向量位置。

七、任务3:从航路点到连续路线

任务3提供:

  • 遥感影像;
  • 自然语言约束;
  • 起点;
  • 终点。

模型需要输出一组稀疏航路点:

τ = { p 1 , p 2 , … , p n } \tau=\{p_1,p_2,\ldots,p_n\} τ={p1,p2,,pn}

其中:

p 1 = S , p n = E p_1=S,\qquad p_n=E p1=S,pn=E

这些点类似导航中的关键转弯点。

模型不需要逐像元输出完整路线,评估器会:

  • 对合法航路点之间使用A-Star连接;
  • 对非法航路点使用直线连接,并计算穿越障碍的比例。

因此,任务3主要考验:

模型能否给出合理的高层航路点。

而不是完全独立完成全部像元级搜索。


八、代价地图与A-Star:标准答案怎样生成?

论文将通行状态和地物偏好转成像元成本:

W ( p ) = { ∞ , 不可通行 max ⁡ ( V p r e f ) − V p r e f [ c ( p ) ] + 1 , 可通行 W(p)= \begin{cases} \infty,& \text{不可通行}\\ \max(V_{pref})-V_{pref}[c(p)]+1,& \text{可通行} \end{cases} W(p)={,max(Vpref)Vpref[c(p)]+1,不可通行可通行

含义是:

  • 优先级越高,成本越低;
  • 优先级越低,成本越高;
  • 禁止区域成本为无穷大。

路线目标是:

min ⁡ τ ∑ p ∈ τ W ( p ) \min_\tau \sum_{p\in\tau}W(p) τminpτW(p)

论文使用A-Star寻找标准最优路线:

f ( p ) = g ( p ) + h ( p ) f(p)=g(p)+h(p) f(p)=g(p)+h(p)

其中:

  • g ( p ) g(p) g(p)是已经走过的累计成本;
  • h ( p ) h(p) h(p)是到终点的启发式距离。

需要准确理解:

这里的“最优”只是在论文定义的8类地物、固定通行规则和二维代价图下成立,并不等于现实世界中唯一最安全的路线。


九、数据如何自动生成并进行质量控制?

在这里插入图片描述

论文设计了一套自动化生产流程:

主体、目标和地物规则知识库

生成任务配置

DeepSeek生成自然语言问题

重新推导符号向量

Gemini核验逻辑一致性

匹配OpenEarthMap影像

区域编号和连通性检查

A-Star生成最优路线

形成三级任务样本

为了减少自动生成文本中的矛盾,论文采用两层检查:

  1. 生成模型重新根据自己写出的文字推导答案;
  2. 另一个模型再次检查描述是否符合知识库规则。

任务2中,作者还通过形态学腐蚀,将编号点尽量放在地物内部,减少边界混淆。

任务3则先检查起点与终点是否存在合法连通路线,只保留可求解样本。


十、数据规模与评价指标

在这里插入图片描述

数据规模

任务 样本数
文本约束理解 3607
文本—影像对齐 12975
路径规划 10821

任务2和任务3还按照地物数量、斑块破碎度和连通复杂度划分为Easy、Medium和Hard。

任务1指标

在这里插入图片描述

  • TM:通行向量是否完全匹配;
  • PR:偏好排序与标准答案的Kendall相关;
  • FM:通行与偏好是否同时完全正确。

任务2指标

在这里插入图片描述

  • RM:地物类别与编号区域是否匹配;
  • TM:通行规则是否正确;
  • PR:偏好排序是否正确。

任务3指标

在这里插入图片描述

  • AR:所有航路点均位于可通行区域的样本比例;
  • VR:违规路线穿越不可通行区域的比例;
  • CR:预测路线成本与最优路线成本之比;
  • CD:预测路线与最优路线的几何距离。

十一、任务1结果:文字规则已经能被较好理解

论文报告的主要结果:

模型 TM↑ PR↑ FM↑
GPT-5.1 77.02 0.959 69.20
Gemini-3-Pro 98.34 0.962 92.24
Qwen3-VL-235B-A22B 72.91 0.872 52.98
Qwen3.5-27B 80.32 0.906 63.52

Gemini-3-Pro在纯文字任务中表现最强:

  • TM达到98.34%;
  • FM达到92.24%。

这说明前沿模型已经能较好处理多主体、条件通行、禁止约束和偏好排序。

但部分模型虽然能判断什么能走,却不能正确排序地物优先级。

因此:

会判断“能不能走”,不等于会判断“更应该走哪里”。


十二、任务2结果:一加入遥感影像,性能显著下降

主要平均结果如下:

模型 RM↑ TM↑ PR↑
GPT-5.1 56.26 35.31 0.605
Gemini-3-Pro 71.01 27.50 0.463
Qwen3-VL-Plus 57.53 37.34 0.634
Qwen3-VL-235B-A22B 43.66 52.79 0.702
Qwen3.5-27B 60.56 33.16 0.521

结果表明:

  • Gemini最擅长识别编号区域,RM达到71.01%;
  • Qwen3-VL-235B-A22B在规则映射和排序方面更稳定;
  • 场景从Easy变为Hard后,多数模型迅速退化。

最关键的结论是:

会读规则,不代表能把规则稳定地对应到遥感影像中的具体区域。

任务1中Gemini的TM为98.34%,到了任务2只有27.50%,说明真正的瓶颈出现在跨模态绑定阶段。


十三、任务3结果:现有大模型仍不具备稳定规划能力

论文表6的主要平均结果:

模型 AR↑ VR↓ CR↓ CD↓
GPT-5.1 17.63 35.47 1.83 74.54
Gemini-3-Pro 18.70 32.30 1.24 68.74
Qwen3-VL-Plus 29.67 37.57 5.42 61.91
Qwen3-VL-32B 32.70 38.43 12.87 71.19
Qwen3-VL-235B-A22B 27.80 37.30 8.70 64.28

最高AR只有:

32.70 % 32.70\% 32.70%

也就是说,即使表现最好的模型,也只有约三分之一的样本能保证所有航路点都位于可通行区域。

不同模型出现了两类典型失败:

1. Gemini:成功率低,但成功时路线较精炼

Gemini的AR只有18.70%,但合规路线的:

C R = 1.24 CR=1.24 CR=1.24

说明成功时路线成本只比最优解高约24%。

2. Qwen3-VL-32B:更常避开障碍,但路线低效

其AR最高,但:

C R = 12.87 CR=12.87 CR=12.87

表示路线成本远高于最优路线。

因此,大模型可能:

  • 能避开障碍,却不会全局优化;
  • 偶尔规划得很好,但成功率太低;
  • 知道大致方向,却无法精确输出合法坐标。

十四、论文最重要的发现与创新

1. 感知和规则理解是必要条件,但不是充分条件

即使模型理解文字、识别地物,也不一定能完成全局规划。

2. 三级任务可以定位失败阶段

论文能够区分:

  • 语言理解错误;
  • 遥感识别错误;
  • 规则映射错误;
  • 路径规划错误。

3. 使用符号向量和路线指标进行严格评价

不再依赖“看起来合理”的主观判断,而是直接检查:

  • 是否进入禁止区域;
  • 路线比最优解贵多少;
  • 与最优路线相距多远。

4. 标准路线具有明确的优化目标

标准答案由A-Star在代价图上求得,而不是人工随意绘制。

5. 数据规模较大

路径规划样本达到10821个,约为此前同类遥感基准路径样本规模的9.6倍。


十五、必须冷静看待的局限

1. 规划环境仍是二维静态语义地图

现实导航还受到:

  • 高程和坡度;
  • 路面宽度;
  • 桥梁损坏;
  • 天气;
  • 电量和燃油;
  • 车辆转弯半径;

等因素影响。

2. “最优”依赖预设成本函数

A-Star给出的只是当前规则下的数学最优,并不是现实中的唯一安全路线。

3. 任务2区域已经编号

模型主要做区域识别和规则映射,并未从零完成完整语义分割。

4. A-Star会补全局部路线

连续路线的一部分来自评估器,因此任务3更接近“高层航路点规划”。

5. 坐标定位错误与规划错误混在一起

模型可能知道应该沿道路走,却因为坐标偏移几像素而被判违规。

6. 只保留存在合法路线的样本

当前基准没有重点评价模型能否识别:

当前无解,不能强行生成路线。

7. 自动生成文本可能具有固定风格

真实应急指令中的口语、不完整信息和冲突约束仍未充分覆盖。

8. 表格与正文存在一处值得核对的不一致

正文称Gemini的CD最佳,但表6中Qwen3-VL-Plus的平均CD更低。引用时应以最终代码和评估结果为准。


十六、怎样进一步改进这类基准?

未来可以重点增加:

  1. 高程与坡度:限制车辆和人员的最大可通行坡度;
  2. 动态环境:模拟洪水上涨、道路中断和火势蔓延;
  3. 不确定性:为地物、水深和路线附带可信度;
  4. 不可达任务:要求模型判断“当前无合法路线”;
  5. 工具调用:允许模型调用GIS、A-Star和水深查询工具;
  6. 连续物理约束:加入涉水深度、路宽、转弯半径和航程;
  7. 真实轨迹验证:与救援GPS、道路封控和无人机航线比较。

更合理的系统结构不是让大模型独自完成一切,而是:

大模型负责理解任务,遥感模型负责更新环境,符号规划器负责求解和验证。


十七、总结:会看图、会讲规则,离真正会规划还有很远

NeSy-Route把遥感大模型评测从:

图里有什么?

推进到了:

按照这些规则,应该怎么走?

整篇论文可以浓缩为:

自然语言约束

通行和偏好向量

遥感影像

地物区域识别

规则与影像对齐

稀疏航路点

符号验证和A-Star补全

可行性与最优性评价

论文的关键结果包括:

  • 任务1包含3607个样本;
  • 任务2包含12975个样本;
  • 任务3包含10821个样本;
  • Gemini-3-Pro在任务1取得TM 98.34%、FM 92.24%;
  • Gemini在任务2取得最高RM 71.01%;
  • Qwen3-VL-235B-A22B在任务2取得最高TM 52.79%和PR 0.702;
  • Qwen3-VL-32B在任务3取得最高AR 32.70%;
  • Gemini成功路线的CR为1.24,但整体合规率仍很低。

它真正贡献了三点:

  1. 把遥感大模型评测从场景理解推进到行动规划;
  2. 用三级任务定位语言、视觉和规划的失败瓶颈;
  3. 用符号规则和A-Star建立可复核的路线评价体系。

但目前的大模型仍远未达到可靠导航水平。

最准确的评价是:

NeSy-Route建立了一套严格考试,证明当前多模态大模型即使能理解文字规则,也经常无法把规则稳定地落到遥感影像上,更难持续生成安全、高效、全局合理的路线。


论文信息

论文题目: NeSy-Route: A Neuro-Symbolic Benchmark for Constrained Route Planning in Remote Sensing

作者: Ming Yang、Zhi Zhou、Shi-Yu Tian、Kun-Yang Yu、Lan-Zhe Guo、Yu-Feng Li

单位: 南京大学

论文类型: arXiv预印本

版本: arXiv:2603.16307v3

版本日期: 2026年7月15日

Download: https://arxiv.org/abs/2603.16307


Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐