
本期主线问题遥感 VLM 是不是必须走专用架构这条路最值得先看的是 More with Less——它用通用视觉语言模型 多任务强化学习不新增任何遥感专用模块就在高分辨率、多时相、多模态、多视角一堆基准上拿到有竞争力的结果结论直白对遥感 VLM 来说数据规模比架构创新更值钱。1. More with Less通用 VLM 挑战专用架构假设头条是什么遥感视觉语言模型训练配方论文自报。它明确挑战领域主流假设——“遥感数据特殊必须设计专用编码器/对齐模块/融合机制”。做法是拿一个通用 VLM 起步用单语言策略统一输出要么直接答文本要么调用 SAM3 做分割与接地训练用多任务强化学习每个任务配自适应奖励。主要发现从 2.3M 原始数据池精选 80k 唯一样本、覆盖 16 个标注源多任务 RL 训练后在高分辨率 VQA、多时相、多模态、多视角等基准上取得有竞争力的结果OOD分布外增益与训练数据多样性正相关论文自报。为什么值得关注遥感 VLM 领域加模块是默认动作这篇给了反例证据——先问数据够不够、任务铺得够不够宽再考虑改架构。INSAIT索非亚大学团队作者含 Luc Van Gool。 辩证思考观点犀利但本质是规模定律在遥感域的再验证——它证明通用架构大数据可行没证明专用架构一定多余80k 样本/2.3M 池的精选工程才是真正的护城河论文没展开讲这套筛选规则怎么定。OOD 增益报告里 XLRSBench-det 是 7.6 倍离群点被排除出平均——这个数字其实值得读者自己去看一眼它可能暗示检测类任务仍未饱和。2. Filling-Before-Advancing先补能力缺口再谈场景特化是什么遥感 MLLM 的后训练方法论文自报。针对目标域高质量数据稀缺 能力覆盖不全的困境提出三阶段流程RS 语义锚定俯视视角的图文对齐→ 域桥收敛跨场景共享遥感先验→ 证据接地的场景调优。配套构建 CPRS 三层监督数据集与 HarborEval 八轨评测海岸港口场景。为什么值得关注SFT 微调遥感大模型很容易学歪——目标域样本少模型记住了场景却没补上基础能力。这篇把先补课再上课做成显式流程对做垂域微调的人有直接参考价值。 辩证思考三阶段本质是课程学习curriculum learning的变体——先易后难、先通用后专用思路成熟但落地扎实。局限是只在一个场景海岸港口验证跨场景普适性未报告能力缺口怎么检测、缺口没填满怎么判定论文未给出可操作的量化标准。3. SkyVLaMUAV 视频里的小目标用稀疏 token 抓是什么面向无人机视频的遥感多模态大模型论文自报。UAV 视频语言条件分割难在目标小、视觉模糊、视角动态变化。SkyVLaM 从 patch 级视频表示直接构造稀疏 token时间基感知器用正则化让稀疏基携带互补时间线索再自适应选一段时序连贯的稠密片段做高分辨率检查——稀疏稠密 token 一起进 LLM 做查询条件分割。主要发现配套构建 SkyVid 数据集含视频接地对话VGCG与视频目标分割RVOS两个子集101 个视频、33.6K 帧、1.53M 标注论文自报。为什么值得关注UAV 视频是遥感里动的场景多数遥感 VLM 只处理静态影像。这条把视频时序结构做进 token 设计给无人机巡检类应用提供了可参考的建模方式。 辩证思考稀疏 token 是视频理解里降计算的通用思路贡献在把时序基感知器适配到 UAV 小目标场景——方向对但论文未报告与全 token 基线的计算-精度权衡曲线稀疏到底省了多少、值不值读者看不到账。SkyVid 是新数据集规模101 视频在视频基准里偏小后续能否成标准待观察。4. FUSAR-R1SAR 影像的大规模推理模型是什么面向合成孔径雷达SAR影像解译的大规模推理模型论文自报。SAR 图像受相干成像机制影响噪声结构复杂、标注稀缺传统解译方法难以表达复杂语义。FUSAR-R1 把视觉语言大模型的范式引入 SAR 解译结合文本语义提升认知表达与交互能力。为什么值得关注SAR 是遥感里最难啃的模态之一——不像光学影像直观解译门槛高。大模型能把 SAR 解译从专家看图推向自然语言对话式解译对灾害监测、海洋监视等 SAR 主力场景是实用方向。 辩证思考方向正确但信息量有限——论文自报以初始进展定位关键数字在哪些 SAR 基准、比基线高多少在摘要中未给出需要读全文才能判断大规模是否名副其实。SAR 领域已有多个专用基础模型FUSAR-R1 与它们的具体差异和优势点论文未在摘要层交代清楚。5. GeoThreat给遥感大模型做定向攻击是什么针对遥感视觉语言模型LVLM的可迁移定向对抗攻击方法论文自报。通用视觉域已有大量攻击研究遥感域几乎空白而遥感解译需要局部判别线索与全局结构联合推理攻击设计必须兼顾两者。为什么值得关注遥感 LVLM 正在进入应急响应、灾害评估等安全敏感场景——如果对抗样本能让模型把灾情判错后果严重。这篇把鲁棒性评估这个通用域成熟话题带进遥感域给部署遥感大模型的人提了个醒别只测精度测测抗攻击能力。 辩证思考可迁移定向攻击在通用域已有成熟方法族如投影梯度下降类这篇的贡献是把问题域搬到遥感并做适配——新意有限但填补空白。摘要未给出攻击成功率/迁移率数字实际威胁等级需看全文且对抗鲁棒性与真实部署风险之间还有距离读者别过度恐慌。6. RS-MLLM 全景综述专用模型到底赢在哪是什么遥感多模态大模型系统综述 诊断评测ISPRS JPRS论文自报。系统梳理 RS-MLLM 技术演化模型设计/多模态学习/训练数据/下游能力并跨任务、跨基准对比遥感专用 MLLM 与通用视觉 MLLMCV-MLLM。主要发现反常识结论——通用 CV-MLLM 在多个遥感任务上不经过遥感微调就能匹敌甚至超过专用 RS-MLLMRS-MLLM 的保留优势集中在遥感视觉接地与高分辨率 VQA论文自报。为什么值得关注这正是本期头条 More with Less 的学术版证据——两条独立线索指向同一判断遥感 VLM 的专用架构优势没有想象中牢固。做选型的人可以直接拿这篇的对比表当参考。 辩证思考综述价值高但要警惕平均结论的误导——通用模型匹敌专用模型是跨任务平均后的说法具体任务上可能两极分化有的碾压、有的惨败综述未在摘要层给出任务级明细。另外评测基准本身多为遥感社区自建通用模型在这些基准上的表现是否等于真实遥感场景表现仍需存疑。综合洞察2 条判断本期最强的信号是数据与任务多样性 架构专用性在遥感 VLM 领域被反复验证——More with Less 用实验、JPRS 综述用跨模型评测两条独立证据指向同一结论。做遥感 VLM 的团队下一步优先考虑扩数据、铺任务而不是继续堆模块。依据条目 1 的 80k/2.3M 配方与条目 6 的对比结论信号遥感大模型的安全与鲁棒性评测刚起步——GeoThreat 是遥感域少见的对抗攻击研究说明社区开始从能不能用转向可不可信。这是一个值得跟踪的信号后续大概率会出现更多遥感鲁棒性基准。依据条目 5 填补空白、条目 6 综述未覆盖鲁棒性维度附录 A · 本期相关链接More with LessarXiv 2607.15942Filling Before AdvancingarXiv 2607.22205Filling Before Advancing · GitHub 仓库SkyVLaMarXiv 2607.17386FUSAR-R1arXiv 2607.16819GeoThreatarXiv 2607.21036GeoThreat · GitHub 仓库附录 B · 补充说明数字口径全部为论文自报论文自报统计时点 2026-08-31。More with Less80k/2.3M/16 源、SkyVLaM101 视频/33.6K 帧/1.53M 标注均与 PDF 原文核对一致。下载链接2 个 GitHub 仓库filling-before-advancing、GeoThreat已逐个核实可访问2026-08-31 验证仓库 README 可正常读取其余条目论文未提供开源链接按规范不写下载承诺。头条选择说明More with Less 以反常识结论 权威团队入选头条GeoThreat 与综述分列 5、6 位安全评测与体系化证据。