一键去反光,一眼辨真伪:合合信息在WAIC 2026交出的两份技术答卷 前言今年WAIC 2026合合信息带着用AI洞悉文海万象的主题把两项核心技术——AI去反光和AI跨模态鉴伪搬到了展台让开发者亲手体验。我在现场待了大半天从宫灯装置前隔着玻璃扫古画到展台上的AI鉴伪演示和「AI较真大赛」互动把两项技术各摸了一遍。这篇文章就是我一边上手、一边拆技术的真实记录8个实测场景每个都先测后拆。下面带大家来详细感受一下。智能高清·去反光实测①对着玻璃相框拍文物反光有多难消除合合信息在展台搭了一座以宫灯为灵感的互动装置参观者需要隔着不同颜色和覆膜效果的玻璃用扫描全能王扫描《兰亭集序》《千里江山图》《簪花仕女图》等六幅中华传世名画的复刻本。下面是我站到装置前对着覆膜玻璃拍摄的名画照片和扫描后的图片的对比图。为什么擦反光不是加个滤镜就完事其实在计算机视觉中单图反射去除Single Image Reflection Removal, SIRR是一个经典的病态逆问题ill-posed inverse problem。一张带反光的照片可建模为I B RI是相机拍到的混合图像B是本体层你想看的内容R是反射层玻璃/水面反光。已知I求B一个方程两个未知数理论上无限多解。更麻烦的是真实反光与本体内容在像素级别深度交织——透明度变化、色彩干扰、本体层与反射层空间混叠。这也是我拍糊的根本原因过曝的反射层把本体层纹理淹没了。学术界早期解法有限基于物理模型用偏振镜、闪光/非闪光图像对、多角度拍摄辅助分离——需要特殊硬件日常用不了基于深度学习用CNN/Transformer在合成数据上学映射——但合成数据与真实场景有分布偏移domain gap一换真实玻璃就崩。这正是CVPR NTIRE 2026专设自然场景下的单图像去反射赛道、并发布OpenRR-5k大规模真实图像基准的原因。 该赛道吸引全球100团队注册11支进入测试——而合合信息方案拿了全球第一。实测②一键去反光后细节还原到什么程度下面是在展台用扫描全能王使用智能高清·去反光隔着玻璃拍的名画几秒出图。我放大一看原本被高光抹平的青绿山水渐变回来了绢本的肌理也能辨认。合合信息首创的是高保真还原方案它的目标是还原而不是生成。对图像修复这块儿有了解的应该知道传统方法的缺陷反光遮挡区域像素已丢失强行分离时算法会脑补出不存在的内容导致纹理模糊、细节失真虽然看着干净却引入了不可靠的信息。合合信息的突破当反光造成信息缺失时它只还原可还原的信息保留原始纹理/笔触/色彩层次不做无依据的内容补充。放到文档扫描、证据保全这类严肃场景这就是可信和不可信的分界线。为什么同一个模型能覆盖这么多反射场景第一是模型具备强图像理解能力处理玻璃、白板、证件、自然环境拍摄中本体层深度交织、透明度变化、色彩干扰复杂问题。关键在架构层面的场景感知先判断哪些区域是反光、反光属性是什么再针对性分离而非走去噪→增强固定pipeline。这种先理解再处理思路和现代多模态大模型范式一脉相承。其次是模型运行成本低、对反光区域秒级还原——大概率做了移动端轻量化知识蒸馏/剪枝让普通用户用手机App拿到专业级效果不再依赖昂贵偏振镜头和布光。这就是他们说的普惠解法。技术背书CVPR 2026 NTIRE冠军是怎么赢的实测完说回那个全球第一NTIRE是CVPR旗下图像恢复与增强旗舰研讨会代表该领域全球顶尖水平。本届赛道基于OpenRR-5k数据集论文 arXiv:2604.10321《NTIRE 2026 Challenge on Single Image Reflection Removal in the Wild》。in the wild定位很关键——要求处理真实世界中多种反射场景和强度的图像而非实验室合成图直接对准产业落地gap。我扒了下榜单OpenRR-5k Leaderboard合合信息方案RRay成绩指标合合信息 RRay说明PSNR36.17第1峰值信噪比越高越好SSIM0.9758结构相似性越近1越好LPIPS0.0235感知相似度越低越好DISTS0.0135深度图像结构相似度越低越好NIQE3.7375无参考图像质量越低越自然主观评分4.45第15位领域专家主观打分不仅PSNR、主观评分两项第一同时LPIPS/DISTS等感知质量指标也是全面领先。这说明了去反光结果不只是数学指标好看人眼观感也最自然。这正是高保真还原理念在工程指标上的印证。AI跨模态鉴伪实测①AI生成图 vs 真实照片人眼能分辨吗在鉴伪这条线合合信息展示了扫描全能王AI鉴伪小程序用户可以上传图片、视频、文本等多种素材直接就可以出检测结果和置信度。我先在小程序上传了两张图一个是用GPT-Image 2生成的一个是实拍的。小程序分别给出AI生成和真实判定置信度都很高。但我盯着那张假图看了半分钟真挑不出明显破绽甚至发在某音上也没提示疑似AI。为什么人眼越来越难AI却看得准ICLR 2025的AIDE论文A Sanity Check for AI-generated Image DetectionarXiv:2406.19435小红书中科大上海交大做了个扎心的清醒检测在Chameleon数据集上评估9个现成AI图像检测器结果几乎所有模型都把精心制作的AI生成图像判成了真实。Chameleon的图不是实验室里photo of a plane这种简单prompt生成的而是从网上收集、经摄影师和AI艺术家精心调校的——和真实世界高度接近。论文结论很直接AI图像检测任务还远没被解决。而合合信息图像的鉴伪不依赖单一特征综合了三条路径频谱分析频域捕捉AI生成图像特有频谱伪影噪声分布建模不同生成器噪声模式有规律语义一致性分析检测违背物理规律/常识的元素。这和AIDE思路互补——AIDEAI-generated Image Detector withHybrid Features也用多个专家网络同时提取视觉伪影visual artifacts和噪声模式noise patterns其实都是在单特征易被绕开的共识下走向多特征融合。实测②PS合成图图生图——最高难度鉴伪场景第二张我传了一张图生图合成图主体是我实拍的一张桌面陈列照片几件电子产品摆在一起其中一件物品被AI局部重绘替换成另一款——整张图大部分真实只有那一块被编辑。这种图最难——人眼几乎无法定位篡改区域因为被替换区域边缘、光照都和原图衔接得很自然。大家可以猜猜看是哪个物件被改了。为什么图生图是图像鉴伪最难啃的骨头因为图像主体真实传统依赖全局频域特征的方法会失效——真实区域频谱干净只有局部异常易被平均掉。合合信息方案综合捕捉图像频谱细节 高层语义提升复杂场景泛化。这和ICLR 2025的FakeShield北大基于多模态大语言模型的可解释图像伪造检测与定位高度共鸣FakeShield首次把MLLM引入IFDL任务定义可解释IFDLe-IFDL——既给像素级掩码也用人类可理解语言解释哪里假、为什么假其DTE-FDM模块用域标签domain tag引导模型识别不同篡改技术Copy-Move / Splicing / Removal / DeepFake / AI-Generated显著提升跨场景泛化配套开源MMTD-Set-34k数据集用GPT-4o对图像-掩码-描述做三元组标注。合合信息的一键多类型检测理念一致多维度特征联合判决把AI生成、AI编辑、传统PS篡改一网打尽不为每种伪造单独训模型。实测③深伪视频检测帧间缝合痕迹藏不住第三次我上传了段短视频是一段看似正常的宠物视频中间有两秒我剪进去了AI生成的片段。小程序判定疑似AI生成/编辑。视频鉴伪为什么比图像难一个量级它既要看单帧更要看帧与帧连贯性。合合信息视频鉴伪模型建了四条检测路径时序分析帧间物体抖动、运动轨迹异常时空频域检测3D频域空间捕捉生成痕迹传感器噪声指纹用真实相机传感器固有噪声模式当物理指纹区分真视频和生成视频时空网格伪影spatial-temporal grid artifacts视频生成模型常见结构缺陷。多条路径交叉验证而非只看单帧这也是深伪视频缝合痕迹藏不住的原因。实测④AI生成文本鉴定换个说法也骗不过第四次我上传了两段文字一段ChatGPT生成的技术随笔一段手写的作文。小程序分别给AI生成和人类写作判定。文本鉴伪为什么容易翻车、合合信息怎么解决传统文本鉴伪依赖词频、句长、n-gram概率等表层统计特征但让模型换个说法或加口语化提示词统计特征就漂移。合合信息文本方案突破是从统计表象深入语义深层去预判大模型生成某词、某句式时的高概率表达路径找出AI文本与人类写作三维本质差异——深层语义连贯性AI文本常局部完美但全局逻辑有微妙断裂句法结构微小畸变生成文本句法树结构有统计偏好高维逻辑表征embedding空间中AI生成文本语义向量分布与人类写作有系统性偏移。它不依赖表面措辞抓更深层、更难伪装的差异这就是提示词伪装骗不过去的原因。总结这次测试的AI去反光和AI鉴伪小程序 我的脑子里一直盘旋两个词——看清和看透。两者指向同一命题AI深度渗透时代可信信息通道就是底层基础设施。从一张反光照片还原的细节到一段被判深伪的视频再到一份被识别为AI生成的文本——每处都是真实与虚假的较量。

本月热点