GeoReason:让遥感大模型不仅“答对”,还要“推得对”

当前不少遥感视觉语言模型已经能够生成思维链,但会写推理过程,并不代表模型真的在推理

例如,模型可能在分析中声称“停车区域已经接近饱和”,最终却选择“停车区域较为空旷”这一正确答案。此时答案虽然正确,但推理过程与答案明显矛盾。GeoReason 将这种现象称为逻辑幻觉伪推理

因此,GeoReason 关注的不只是答案准确率,而是希望模型做到:

基于正确的视觉证据,通过合理的推理过程得到最终答案。
在这里插入图片描述

GeoReason-Bench:从检测标注构造推理数据

作者首先构建了 GeoReason-Bench,其中包含 4,000 条遥感推理轨迹,图像主要来自 DOTA 和 DIOR。

与普通视觉问答数据不同,GeoReason 会利用目标检测标注提取更加丰富的结构信息,包括目标数量、尺度、方向、间距、密度和排列方式。

例如,飞机之间的距离和停放密度可以用于估计停机坪容量,建筑物的排列结构则可以辅助判断住宅区、工业区或物流区域。

随后,作者将这些几何信息与视觉语言模型生成的全局场景描述结合,再使用 GPT-4o 合成完整的推理过程和答案。

数据被分为两部分:

  • 1,000 条感知与逻辑数据,用于监督微调;
  • 3,000 条选择题形式的演绎推理数据,用于强化学习。

两阶段训练:CoT-SFT + GRPO

在这里插入图片描述

第一阶段采用 CoT 监督微调,让模型学习按照固定格式输出推理过程和最终答案。

这一阶段可以让模型“学会写推理”,但无法保证推理内容真的支持最终结论。因此,作者在第二阶段引入 GRPO 强化学习,并提出了一个关键奖励:Logical Consistency Reward,即逻辑一致性奖励

它的实现方式很直接:随机打乱选择题的选项顺序。

模型首先针对原始问题生成推理过程和答案。随后,系统保持原来的推理过程不变,只打乱选项,再要求模型重新选择。

如果模型真正依据自己的推理作答,那么无论正确答案位于 A、B、C 还是 D,它都应该选择语义相同的选项。反之,如果模型只是依赖选项位置或统计捷径,选项顺序变化后就可能出错。

因此,GeoReason 的奖励同时关注:

  1. 最终答案是否正确;
  2. 输出格式是否规范;
  3. 推理过程与答案是否保持一致。

实验结果

论文以 Qwen2.5-VL-7B 为基座模型,并使用 LoRA 进行训练。

方法 推理准确率
Qwen2.5-VL 23.86%
+ CoT-SFT 31.93%
+ 标准 GRPO 36.49%
+ 逻辑一致性奖励 43.51%
在这里插入图片描述

完整 GeoReason 的平均准确率达到 56.20%。消融结果表明,普通 GRPO 可以提升模型“答对”的能力,而逻辑一致性奖励进一步改善了推理过程与答案之间的对齐。

总结

GeoReason 最重要的启示是:

思维链的存在,并不等于模型具备真实推理能力。

它通过选项重排检查模型是否真正依据自己的推理作答,为遥感多模态模型的可靠推理提供了一种简单且具有针对性的训练方法。

不过,这种方法主要适用于选择题,并且更关注“推理—答案一致性”,还不能完全保证推理过程与图像证据一致。

未来更完整的研究方向,应进一步实现:

视觉证据 → 推理过程 → 最终答案
Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐