
为什么决策头训练时没见过一张图却能“看懂”图像JEV-27B-VL零样本视觉决策的完整故事【免费下载链接】JEV-27B-VL项目地址: https://ai.gitcode.com/hf_mirrors/autotrust/JEV-27B-VL你有没有想过一个从未在图片上训练过的“决策头”为什么看一眼视频封面就能预测用户会不会点开JEV-27B-VL 就是这样一个多模态决策模型——它的决策头只训练过文本却能零样本地对图像做视觉决策单次前向传播就给每个选项输出一个校准过的概率。这篇文章把它的完整机制、实测成绩和上手方法一次讲清楚。先看效果决策头没见过图却做成了这些视觉决策在解释“为什么”之前先看看 JEV-27B-VL 的 System 1快决策层在零样本图像任务上的表现短视频推荐只看封面图就能把“用户下一个会看的视频”排进前 5AUC 0.727追平了用 59,045 个用户行为日志训练出的协同过滤0.728前 5 命中率反而更高59% vs 49%。多模态裁判给定一张图、一个问题、两个答案判断哪个答案更好VL-RewardBench 上准确率 78.3%超过官方榜单上的全部 26 个模型。机器人臂抓取每 0.24 秒看一次摄像头图像判断“目标在夹爪左边还是右边、上边还是下边”20 个随机场景中完成 75%。电脑操作看截图决定下一步点哪个编号框60 个多步任务完成 95%每次点击约 0.26 秒。为什么没见过一张图的决策头却能“看懂”图像答案藏在这个仓库的三层结构里。打开模型构成你会发现所谓的“决策头”其实薄得惊人第一层真正的“眼睛”属于基座模型不属于决策头。JEV-27B-VL 的底座是 Qwen3.8-27B 多模态模型。看 config.json 里的vision_config一个 27 层的视觉编码器ViT以 16×16 像素为一块patch_size: 16扫描图像输出 5120 维视觉特征再通过 MRoPE 位置编码mrope_section: [11, 11, 10]把“视觉位置”和文本位置对齐。换句话说图像在进语言模型之前就已经被转成“视觉 token 语言”了。决策头从头到尾不需要认识图像它面对的永远是基座模型消化过的统一表示。第二层决策头只学“怎么读答案”不学“图像是什么”。真正训练过的东西只有 adapter_vllm/ 目录里的一个 LoRA 适配器和 adapter_vllm/decision_head.json。决策头做的事一句话就能说完决策 logit 语言模型在“选项词”上的 logprob 偏置再按题型除以一个温度。adapter_vllm/decision_head.json 里的verbalizer_ids就是 24 个“选项词”的 token 编号false/true是/否题、0–5打 0–5 分题、A–P选择题。训练时它只调整 lm_head 附近的 LoRA 权重让“选项词的 log 概率”变成一个校准过的概率分布——ECE期望校准误差低至 0.0009。图像内容它压根不碰。这就是“零样本视觉决策”成立的完整逻辑基座模型早已在海量图文数据上学会了看图决策头只是给这位“看图老手”换了一套输出接口——老手本来就会说“这张封面像用户爱看的动漫解说”决策头教会的只是“把这句话换算成 0.83 / 0.17 这样的概率”。图像换成什么新内容都不影响因为读图能力不在决策头上。第三层温度校准让概率“可信”。calibration.json 里记录了分题型的温度系数noul 题 1.014、choice 题 1.016、score 题 1.004都是用约 1.1 万条 held-out 数据拟合出来的。所以/v1/decide返回的概率可以直接拿去做阈值决策而不用再做一层后处理。一次视觉决策的完整链路把上面的三层串起来一次图像决策的流程是图像预处理Qwen3.8 的 processor 把图片切成视觉 token官方建议先压到 448px 以内省 token单次前向基座模型读取“图像 token 问题 选项列表”预测下一个 token读出选项分布只取A–P或true/false等这些选项词的 logprob加上偏置、除以温度softmax 归一化返回每个选项一个校准概率例如{true: 0.83, false: 0.17}全程约 0.1–0.3 秒。这条链路全部实现在 serve_decide.py 的s1_pass函数里它把[kind] / [state] / [question] / [options] / [decision]:拼成裸决策模板用logprob_token_ids精确读出选项词的概率。state字段可以直接混排文本和图像data URL 或 https URL这是图像决策唯一的“入口”。值得玩味的是它的边界意识README 的 Limitations 一节明说决策头是在文本上训练的图像决策属于零样本排序能力已被验证但图像任务上的概率校准尚未系统性测量。工程上诚实也是这套系统值得参考的一点。快慢结合不确定时交给会思考的系统零样本视觉决策还有一层“保险丝”。serve_decide.py 内置了自适应思考System 1 先给概率置信度低于阈值默认 0.8时自动切换到 System 2——同一个 27B 基座进入思考模式看着同样的图像逐步推理再按 50/50 权重把两次分布混合起来。实测中 70% 的问题在 0.11 秒内由 System 1 直接答出准确率反而从 0.792 提升到 0.892快速上手一条命令跑起零样本视觉决策服务hf download autotrust/JEV-27B-VL --local-dir JEV-27B-VL bash JEV-27B-VL/serve.sh # 需要 80GB 显存的 GPU 一张serve.sh 会启动带/v1/decide路由的 vLLM 服务。发一张图给它做视觉决策import base64, requests def decide_img(question, image_path, optionsNone, kindchoice): img data:image/jpeg;base64, base64.b64encode(open(image_path, rb).read()).decode() body {kind: kind, state: [Photo: , {image: img}], question: question} if options: body[options] options r requests.post(http://localhost:8000/v1/decide, jsonbody).json() return dict(zip(r[options], r[probabilities])) # 看封面判断分类 decide_img(这个视频封面属于哪类, cover.jpg, options[动漫解说, 游戏, 美食, 科技])两个必知的运行细节--max-num-seqs 8不能去掉超过 8 并发时该多模态模型的 LoRA 路径会返回错误的 System 1 概率手动调用/v1/chat/completions时记得传top_k: 0, top_p: 1.0否则会被生成配置的默认值截断概率分布。延伸阅读仓库里的关键文件文件内容adapter_vllm/decision_head.json决策头本体选项词表、偏置、题型槽位adapter_vllm/adapter_config.jsonLoRA 配置rank 32覆盖 lm_head 等 10 类模块calibration.json分题型温度与拟合诊断config.json基座模型结构vision_config即“眼睛”serve_decide.py/v1/decide路由 自适应思考的完整实现reports/demos/cu_results.json电脑操作 demo 的逐集结果blog/JEV-27B-VL.md官方发布博客全部实验细节总结这个故事的三个要点分工明确读图的是基座模型的 ViT 编码器决策头只负责把基座的输出读成校准概率——“眼睛”和“尺子”分离所以没见过图也能决策。接口即能力24 个选项词、24 个偏置、3 个温度就是整个“决策能力”的全部参数。简单到可以一眼看完 adapter_vllm/decision_head.json。诚实的边界图像任务上的概率校准尚未系统测量超过 16 个选项的标签也是训练时没见过的——这些写在 README 里也提醒我们零样本的“能用”和“校准可靠”之间还有一段路。【免费下载链接】JEV-27B-VL项目地址: https://ai.gitcode.com/hf_mirrors/autotrust/JEV-27B-VL创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考