卫星图上给AI一句话,它真能规划安全路线吗?
卫星图上给AI一句话,它真能规划安全路线吗?NeSy-Route论文通俗解读
- 卫星图上给AI一句话,它真能规划安全路线吗?NeSy-Route论文通俗解读
- 一、为什么“识别出道路”不等于“能规划路线”?
- 二、神经符号方法:让大模型理解,让规则系统验算
- 三、三级任务:把复杂规划拆成三道关卡
- 四、八类地物、四类主体和四种规划目标
- 五、任务1:把自然语言翻译成符号规则
- 六、任务2:把规则准确落到遥感影像上
- 七、任务3:从航路点到连续路线
- 八、代价地图与A-Star:标准答案怎样生成?
- 九、数据如何自动生成并进行质量控制?
- 十、数据规模与评价指标
- 十一、任务1结果:文字规则已经能被较好理解
- 十二、任务2结果:一加入遥感影像,性能显著下降
- 十三、任务3结果:现有大模型仍不具备稳定规划能力
- 十四、论文最重要的发现与创新
- 十五、必须冷静看待的局限
- 十六、怎样进一步改进这类基准?
- 十七、总结:会看图、会讲规则,离真正会规划还有很远
卫星图上给AI一句话,它真能规划安全路线吗?NeSy-Route论文通俗解读
一句话读懂这篇论文:
NeSy-Route不是让多模态大模型简单回答“图里有什么”,而是要求它先理解自然语言中的通行规则,再把规则对应到遥感影像中的具体地物,最后生成一条尽量安全、可行且接近最优的路线。神经网络负责理解,符号系统负责约束和验算。
过去的遥感大模型,大多擅长回答:
- 图中有没有道路?
- 哪些地方是农田?
- 水体位于建筑物的哪个方向?
- 洪水前后哪里发生了变化?
这些任务主要停留在“看见”和“描述”。
真实灾害救援还需要进一步回答:
看懂环境以后,下一步应该怎么走?
例如:
- 洪水后车辆怎样绕开积水和断路?
- 徒步人员怎样避开树林和水体?
- 无人机怎样绕开高大树木和建筑物?
- 船只怎样沿可通航水面到达受困区域?
这不再只是遥感识别,而是:
遥感场景理解 + 语言约束理解 + 空间推理 + 路径规划。
2026年,南京大学团队发布预印本:
NeSy-Route: A Neuro-Symbolic Benchmark for Constrained Route Planning in Remote Sensing
提出了一个面向遥感约束路径规划的神经符号评测基准:
NeSy-Route。
它包含:
- 3607个文本约束理解问题;
- 12975个文本—影像对齐问题;
- 10821个约束路径规划问题。
这篇论文真正想回答的是:
多模态大模型究竟是不会理解规则、不会识别遥感地物,还是即使都看懂了,也不会进行全局规划?
一、为什么“识别出道路”不等于“能规划路线”?
假设一张遥感影像中包含道路、建筑物、农田、裸地、草地、树林和水体。
模型即使把所有地物都识别正确,也不一定能找到合理路线,因为规划还必须同时考虑四类问题。
1. 谁在移动?
不同主体的通行能力不同:
- 行人可以穿过部分草地;
- 汽车更适合道路和建设用地;
- 无人机可以飞越水体,但可能需要避开高大树木和建筑物;
- 船只只能沿水面移动。
2. 目标是什么?
“最短”和“最安全”并不相同:
- 穿过裸地可能更短,但更难行走;
- 绕行道路距离更远,却更稳定;
- 车辆进入农田可能缩短距离,却可能陷车。
3. 哪些约束不能违反?
路线可能需要满足:
- 不穿越建筑物;
- 不进入水体;
- 避开树林;
- 起点和终点必须连通;
- 路径必须连续。
4. 局部能走,不代表全局合理
模型可能每个点都没有直接落入障碍物,但整条路线仍可能:
- 来回折返;
- 过度绕行;
- 大量经过高成本区域;
- 缺乏整体方向。
因此,路径规划比分类和视觉问答更难。
二、神经符号方法:让大模型理解,让规则系统验算
NeSy是:
Neuro-Symbolic,神经符号。
它可以理解为两套系统合作。
神经部分
多模态大模型负责:
- 阅读自然语言;
- 识别遥感影像;
- 理解复杂描述;
- 输出地物、规则和路线坐标。
符号部分
符号系统负责:
- 编码土地类型;
- 定义可通行规则;
- 设置地物优先级;
- 构建像元代价图;
- 检查连通性;
- 使用A-Star计算最优路线;
- 精确评价模型输出。
通俗地说:
神经网络像会看图、会听指令的规划员;符号系统像严格执行规则的导航和验算程序。
三、三级任务:把复杂规划拆成三道关卡

NeSy-Route没有直接要求模型一次完成全部规划,而是将任务拆成三级。
| 任务 | 核心问题 |
|---|---|
| 任务1 | 模型是否真正理解文字规则? |
| 任务2 | 模型能否把规则对应到影像中的具体区域? |
| 任务3 | 模型能否生成满足约束且接近最优的路线? |
这种设计可以定位失败来源:
- 任务1失败:没有理解规则;
- 任务1正确、任务2失败:文字懂了,但地物认错了;
- 前两步正确、任务3失败:规则和场景都理解了,却不会全局规划。
四、八类地物、四类主体和四种规划目标


论文基于OpenEarthMap,将地表划分为8类:
| ID | 土地覆盖类型 | 中文理解 |
|---|---|---|
| 0 | Bareland | 裸地 |
| 1 | Rangeland | 草地或牧场 |
| 2 | Developed space | 建设用地或硬化地表 |
| 3 | Road | 道路 |
| 4 | Tree | 树木或林地 |
| 5 | Water | 水体 |
| 6 | Agriculture land | 农业用地 |
| 7 | Building | 建筑物 |
论文设置4类移动主体:
- 行人;
- 汽车;
- 无人机;
- 船只。
地物被分为:
- 默认可通行;
- 条件可通行;
- 永久不可通行。
例如:
| 主体 | 默认可通行 | 条件可通行 | 永久不可通行 |
|---|---|---|---|
| 行人 | 建设用地、道路 | 裸地、草地、树林、农田 | 水体、建筑物 |
| 汽车 | 建设用地、道路 | 裸地、草地、农田 | 树林、水体、建筑物 |
| 无人机 | 裸地、草地、道路、水体、农田等 | 树林、建筑物 | 无 |
| 船只 | 水体 | 无 | 其他地物 |
同时设置4种规划目标:
- 最短;
- 最快;
- 最安全;
- 最舒适。
不同目标会改变地物优先级。例如汽车通常更偏好:
道路 > 建设用地 > 农田 > 草地 > 裸地。
五、任务1:把自然语言翻译成符号规则
任务1只提供文字,不提供遥感影像。
模型需要输出两类向量。
1. 通行向量
长度为8:
V t r a v ∈ { 0 , 1 } 8 V_{trav}\in\{0,1\}^8 Vtrav∈{0,1}8
其中:
- 1表示可通行;
- 0表示不可通行。
例如:
[ 1 , 1 , 1 , 1 , 0 , 0 , 1 , 0 ] [1,1,1,1,0,0,1,0] [1,1,1,1,0,0,1,0]
表示裸地、草地、建设用地、道路和农田可以通过,树林、水体和建筑物不可通过。
2. 偏好向量
同样长度为8,用数值表示地物优先级。
数字越高,越优先选择。
任务1同时考验:
- 主体类型;
- 默认规则;
- 条件例外;
- 禁止条款;
- 路径目标;
- 优先级顺序。
它本质上是一种带正式输出格式的复杂规则理解任务。
六、任务2:把规则准确落到遥感影像上
任务2会给出一张带编号区域的遥感影像。
模型需要判断:
- 哪个编号区域是道路?
- 哪个区域是树林?
- 哪个区域是水体?
- 每个区域是否可通行?
- 各区域的优先级如何排序?
输出包括:
- 区域编号向量;
- 通行向量;
- 偏好向量。
需要特别注意:
图像中的候选区域已经被编号,模型并不是从零完成完整语义分割。
因此,任务2更准确的定位是:
区域级遥感识别 + 规则映射 + 跨模态对齐。
它仍然很难,因为模型可能:
- 认错地物;
- 混淆区域编号;
- 地物识别正确,但规则映射错误;
- 规则正确,却输出到了错误的向量位置。
七、任务3:从航路点到连续路线
任务3提供:
- 遥感影像;
- 自然语言约束;
- 起点;
- 终点。
模型需要输出一组稀疏航路点:
τ = { p 1 , p 2 , … , p n } \tau=\{p_1,p_2,\ldots,p_n\} τ={p1,p2,…,pn}
其中:
p 1 = S , p n = E p_1=S,\qquad p_n=E p1=S,pn=E
这些点类似导航中的关键转弯点。
模型不需要逐像元输出完整路线,评估器会:
- 对合法航路点之间使用A-Star连接;
- 对非法航路点使用直线连接,并计算穿越障碍的比例。
因此,任务3主要考验:
模型能否给出合理的高层航路点。
而不是完全独立完成全部像元级搜索。
八、代价地图与A-Star:标准答案怎样生成?
论文将通行状态和地物偏好转成像元成本:
W ( p ) = { ∞ , 不可通行 max ( V p r e f ) − V p r e f [ c ( p ) ] + 1 , 可通行 W(p)= \begin{cases} \infty,& \text{不可通行}\\ \max(V_{pref})-V_{pref}[c(p)]+1,& \text{可通行} \end{cases} W(p)={∞,max(Vpref)−Vpref[c(p)]+1,不可通行可通行
含义是:
- 优先级越高,成本越低;
- 优先级越低,成本越高;
- 禁止区域成本为无穷大。
路线目标是:
min τ ∑ p ∈ τ W ( p ) \min_\tau \sum_{p\in\tau}W(p) τminp∈τ∑W(p)
论文使用A-Star寻找标准最优路线:
f ( p ) = g ( p ) + h ( p ) f(p)=g(p)+h(p) f(p)=g(p)+h(p)
其中:
- g ( p ) g(p) g(p)是已经走过的累计成本;
- h ( p ) h(p) h(p)是到终点的启发式距离。
需要准确理解:
这里的“最优”只是在论文定义的8类地物、固定通行规则和二维代价图下成立,并不等于现实世界中唯一最安全的路线。
九、数据如何自动生成并进行质量控制?

论文设计了一套自动化生产流程:
为了减少自动生成文本中的矛盾,论文采用两层检查:
- 生成模型重新根据自己写出的文字推导答案;
- 另一个模型再次检查描述是否符合知识库规则。
任务2中,作者还通过形态学腐蚀,将编号点尽量放在地物内部,减少边界混淆。
任务3则先检查起点与终点是否存在合法连通路线,只保留可求解样本。
十、数据规模与评价指标

数据规模
| 任务 | 样本数 |
|---|---|
| 文本约束理解 | 3607 |
| 文本—影像对齐 | 12975 |
| 路径规划 | 10821 |
任务2和任务3还按照地物数量、斑块破碎度和连通复杂度划分为Easy、Medium和Hard。
任务1指标

- TM:通行向量是否完全匹配;
- PR:偏好排序与标准答案的Kendall相关;
- FM:通行与偏好是否同时完全正确。
任务2指标

- RM:地物类别与编号区域是否匹配;
- TM:通行规则是否正确;
- PR:偏好排序是否正确。
任务3指标

- AR:所有航路点均位于可通行区域的样本比例;
- VR:违规路线穿越不可通行区域的比例;
- CR:预测路线成本与最优路线成本之比;
- CD:预测路线与最优路线的几何距离。
十一、任务1结果:文字规则已经能被较好理解
论文报告的主要结果:
| 模型 | TM↑ | PR↑ | FM↑ |
|---|---|---|---|
| GPT-5.1 | 77.02 | 0.959 | 69.20 |
| Gemini-3-Pro | 98.34 | 0.962 | 92.24 |
| Qwen3-VL-235B-A22B | 72.91 | 0.872 | 52.98 |
| Qwen3.5-27B | 80.32 | 0.906 | 63.52 |
Gemini-3-Pro在纯文字任务中表现最强:
- TM达到98.34%;
- FM达到92.24%。
这说明前沿模型已经能较好处理多主体、条件通行、禁止约束和偏好排序。
但部分模型虽然能判断什么能走,却不能正确排序地物优先级。
因此:
会判断“能不能走”,不等于会判断“更应该走哪里”。
十二、任务2结果:一加入遥感影像,性能显著下降
主要平均结果如下:
| 模型 | RM↑ | TM↑ | PR↑ |
|---|---|---|---|
| GPT-5.1 | 56.26 | 35.31 | 0.605 |
| Gemini-3-Pro | 71.01 | 27.50 | 0.463 |
| Qwen3-VL-Plus | 57.53 | 37.34 | 0.634 |
| Qwen3-VL-235B-A22B | 43.66 | 52.79 | 0.702 |
| Qwen3.5-27B | 60.56 | 33.16 | 0.521 |
结果表明:
- Gemini最擅长识别编号区域,RM达到71.01%;
- Qwen3-VL-235B-A22B在规则映射和排序方面更稳定;
- 场景从Easy变为Hard后,多数模型迅速退化。
最关键的结论是:
会读规则,不代表能把规则稳定地对应到遥感影像中的具体区域。
任务1中Gemini的TM为98.34%,到了任务2只有27.50%,说明真正的瓶颈出现在跨模态绑定阶段。
十三、任务3结果:现有大模型仍不具备稳定规划能力
论文表6的主要平均结果:
| 模型 | AR↑ | VR↓ | CR↓ | CD↓ |
|---|---|---|---|---|
| GPT-5.1 | 17.63 | 35.47 | 1.83 | 74.54 |
| Gemini-3-Pro | 18.70 | 32.30 | 1.24 | 68.74 |
| Qwen3-VL-Plus | 29.67 | 37.57 | 5.42 | 61.91 |
| Qwen3-VL-32B | 32.70 | 38.43 | 12.87 | 71.19 |
| Qwen3-VL-235B-A22B | 27.80 | 37.30 | 8.70 | 64.28 |
最高AR只有:
32.70 % 32.70\% 32.70%
也就是说,即使表现最好的模型,也只有约三分之一的样本能保证所有航路点都位于可通行区域。
不同模型出现了两类典型失败:
1. Gemini:成功率低,但成功时路线较精炼
Gemini的AR只有18.70%,但合规路线的:
C R = 1.24 CR=1.24 CR=1.24
说明成功时路线成本只比最优解高约24%。
2. Qwen3-VL-32B:更常避开障碍,但路线低效
其AR最高,但:
C R = 12.87 CR=12.87 CR=12.87
表示路线成本远高于最优路线。
因此,大模型可能:
- 能避开障碍,却不会全局优化;
- 偶尔规划得很好,但成功率太低;
- 知道大致方向,却无法精确输出合法坐标。
十四、论文最重要的发现与创新
1. 感知和规则理解是必要条件,但不是充分条件
即使模型理解文字、识别地物,也不一定能完成全局规划。
2. 三级任务可以定位失败阶段
论文能够区分:
- 语言理解错误;
- 遥感识别错误;
- 规则映射错误;
- 路径规划错误。
3. 使用符号向量和路线指标进行严格评价
不再依赖“看起来合理”的主观判断,而是直接检查:
- 是否进入禁止区域;
- 路线比最优解贵多少;
- 与最优路线相距多远。
4. 标准路线具有明确的优化目标
标准答案由A-Star在代价图上求得,而不是人工随意绘制。
5. 数据规模较大
路径规划样本达到10821个,约为此前同类遥感基准路径样本规模的9.6倍。
十五、必须冷静看待的局限
1. 规划环境仍是二维静态语义地图
现实导航还受到:
- 高程和坡度;
- 路面宽度;
- 桥梁损坏;
- 天气;
- 电量和燃油;
- 车辆转弯半径;
等因素影响。
2. “最优”依赖预设成本函数
A-Star给出的只是当前规则下的数学最优,并不是现实中的唯一安全路线。
3. 任务2区域已经编号
模型主要做区域识别和规则映射,并未从零完成完整语义分割。
4. A-Star会补全局部路线
连续路线的一部分来自评估器,因此任务3更接近“高层航路点规划”。
5. 坐标定位错误与规划错误混在一起
模型可能知道应该沿道路走,却因为坐标偏移几像素而被判违规。
6. 只保留存在合法路线的样本
当前基准没有重点评价模型能否识别:
当前无解,不能强行生成路线。
7. 自动生成文本可能具有固定风格
真实应急指令中的口语、不完整信息和冲突约束仍未充分覆盖。
8. 表格与正文存在一处值得核对的不一致
正文称Gemini的CD最佳,但表6中Qwen3-VL-Plus的平均CD更低。引用时应以最终代码和评估结果为准。
十六、怎样进一步改进这类基准?
未来可以重点增加:
- 高程与坡度:限制车辆和人员的最大可通行坡度;
- 动态环境:模拟洪水上涨、道路中断和火势蔓延;
- 不确定性:为地物、水深和路线附带可信度;
- 不可达任务:要求模型判断“当前无合法路线”;
- 工具调用:允许模型调用GIS、A-Star和水深查询工具;
- 连续物理约束:加入涉水深度、路宽、转弯半径和航程;
- 真实轨迹验证:与救援GPS、道路封控和无人机航线比较。
更合理的系统结构不是让大模型独自完成一切,而是:
大模型负责理解任务,遥感模型负责更新环境,符号规划器负责求解和验证。
十七、总结:会看图、会讲规则,离真正会规划还有很远
NeSy-Route把遥感大模型评测从:
图里有什么?
推进到了:
按照这些规则,应该怎么走?
整篇论文可以浓缩为:
论文的关键结果包括:
- 任务1包含3607个样本;
- 任务2包含12975个样本;
- 任务3包含10821个样本;
- Gemini-3-Pro在任务1取得TM 98.34%、FM 92.24%;
- Gemini在任务2取得最高RM 71.01%;
- Qwen3-VL-235B-A22B在任务2取得最高TM 52.79%和PR 0.702;
- Qwen3-VL-32B在任务3取得最高AR 32.70%;
- Gemini成功路线的CR为1.24,但整体合规率仍很低。
它真正贡献了三点:
- 把遥感大模型评测从场景理解推进到行动规划;
- 用三级任务定位语言、视觉和规划的失败瓶颈;
- 用符号规则和A-Star建立可复核的路线评价体系。
但目前的大模型仍远未达到可靠导航水平。
最准确的评价是:
NeSy-Route建立了一套严格考试,证明当前多模态大模型即使能理解文字规则,也经常无法把规则稳定地落到遥感影像上,更难持续生成安全、高效、全局合理的路线。
论文信息
论文题目: NeSy-Route: A Neuro-Symbolic Benchmark for Constrained Route Planning in Remote Sensing
作者: Ming Yang、Zhi Zhou、Shi-Yu Tian、Kun-Yang Yu、Lan-Zhe Guo、Yu-Feng Li
单位: 南京大学
论文类型: arXiv预印本
版本: arXiv:2603.16307v3
版本日期: 2026年7月15日
Download: https://arxiv.org/abs/2603.16307
更多推荐




所有评论(0)