
1. 周一早上的固定流程我是怎么刷cs.AI新论文的周一早上刷arxiv的cs.AI分类已经成了我过去两年雷打不动的习惯。原因很简单每周一的更新量通常是一周里最大的很多组喜欢赶在同一批放出工作所以周一不花点时间把新论文过一遍后面几天就更容易漏东西。cs.AI这个分类现在每天新增早就过了三位数真要一篇篇点进去读根本不可能靠的是一套稳定的过滤流程先看标题再看摘要最后按需下全文。我知道很多人是直接打开arxiv网站按时间排序从第一条翻到第五十条看到感兴趣的再点开。这个办法不是不行只是效率有点低而且容易把真正该看的漏过去。我自己的习惯是先让工具把范围缩到某个量级再做人工判断。具体来说我用arXiv官方RSS订阅cs.AI分类再加上一个关键词过滤脚本每天早上能把当天的论文先筛一遍过滤后的结果直接汇总到邮件里。这个流程看起来简单但能省下的时间非常可观相当于多了一个不会累的助教帮你把作业先过了一遍。1.1 一套花十分钟就能跑起来的过滤脚本先说工具部分。很多人一听脚本就头大但这里真不需要复杂东西。最基础的做法是用Python加feedparser库读arxiv官方的RSS然后按关键词、按标题、按摘要做一次粗筛。代码大概是这样的import feedparser keywords [reasoning, agent, bias, efficiency, alignment] rss_url https://arxiv.org/rss/cs.AI feed feedparser.parse(rss_url) for entry in feed.entries: text entry.title entry.summary if any(k.lower() in text.lower() for k in keywords): print(entry.title) print(entry.link) print(---)这段代码没有任何运行依赖上的难点能跑Python的地方都能跑。需要说明的是arxiv官方RSS是合法的公开接口完全不需要借助任何第三方镜像或非官方渠道直接订阅官方源就行。关键词列表根据你关注的研究方向随时调整不用写得过于复杂粗筛阶段宁可多留一些也别把相关论文误杀了。如果你完全不想写代码arxiv站内搜索本身就支持保存检索式把关键词组合成查询链接每次打开就是按条件排好序的结果。实测下来官方RSS加脚本的方式更适合批量追踪站内搜索则适合做临时性回溯两者可以搭配使用。1.2 先标题后摘要的两轮筛选法工具筛完之后剩下的论文数量仍然不少这时需要人工判断。我的判断分两层第一层只看标题第二层只看摘要。只看标题时我会刻意快一点每个标题停留时间不超过两三秒。这个阶段主要排除三类一是明显离题的虽然挂在cs.AI下但实际内容偏向纯数学或者纯系统工程二是标题里有大量堆叠关键词的这类论文经常是综述或者凑热点的先放一边三是标题和摘要明显对不上号的这种情况虽然不常见但一旦出现基本说明写作态度有问题。过了标题这一关再进入摘要精读。摘要精读不是逐字读重点抓三块作者声称解决了什么问题、方法的核心思路是什么、实验最大的提升标在哪里。这三块在摘要里通常占两三句话扫一遍就能抓到。如果摘要看完之后这三点里有任何一点不清晰那这篇论文要么表达有问题要么方法本身就不够聚焦。我会再考虑是否值得下载全文。1.3 今天这期列表的整体观感今天刷完当天的cs.AI新论文我的整体观感是推理、对齐、效率仍然是三个最大的山头但和半年前比明显感觉到大家开始从刷榜转向抠细节。越来越多的工作不再只关心榜单上多了几个点而是关心模型在推理过程中到底哪里容易错、多智能体系统的成本到底怎么控制、偏见指标是不是真的可落地。这种趋势对实际做项目和做产品的人来说是好事毕竟论文里再漂亮的方法落地的时候还是得面对一堆具体问题。2. 今天刷到的几个值得展开说的方向接下来把今天扫到的几个方向展开聊一聊。先说清楚下面这些不是严格意义上的论文推荐清单而是我今天看完之后觉得有代表性、有讨论价值的工作方向。对我来说一个方向的长期价值比某一篇论文的两三个点提升重要得多。2.1 推理模型的不确定性与自我校正今天我在cs.AI分类下看到好几篇工作主题都不约而同地撞到了推理过程的不确定性上。过去一年大家习惯了让模型输出长思维链认为推理步骤变长就能提高正确率。但今天这些工作开始正视一个问题思维链越长中途犯错的概率也越高而且模型通常意识不到自己已经偏了。有个工作提出了一种轻量级的方案在解码阶段加一个小的判断模块让模型在推理的每个关键节点输出一个置信度。这个置信度不是模型自己随便说说的而是通过一个小型回归头校准过的用来决定当前推理是一个节点继续走下去还是回到上一步重新规划。作者在数学推理和多跳问答上做了实验整体正确率提升不算夸张但最吸引我的地方是它能把模型犯错的节点精准定位到推理链条的某一段。这个信息在Agent落地的场景里特别值钱因为上层规划器可以据此判断这条路到底适不适合继续走。另一篇工作做的方向更偏分析它对同一个问题做多次采样得到多个候选答案然后研究这些答案之间的分歧程度和最终正确率之间的关系。结论不算意外——分歧越大正确率越低——但他们把这个关系做成了一个可用的校准函数。也就是说不用非得跑大量评测只要观测到模型在某个问题上的采样分歧就能大致估计回答的可信度。这对上线后没法随时跑评测的环境中很有用。这两类工作要说多惊艳谈不上但它们的共同点是不再一味追求让模型想得更久而是想着让模型和调用方都知道自己想到哪一步了。这种能力在严肃场景里比单纯准确率更有用。我把它们记在今天的清单里主要是因为这个思路有长期延续性未来半年应该还会看到更多变体。2.2 多智能体协作的收敛与评估多智能体方向今天也有几篇值得聊的。前一段时间市面上有大量丢一群Agent进去开会任务就自动完成了式的文章现在这类文章明显少了大家开始反思一个问题Agent之间来回对话真的能把问题越辩越明吗还是只是产生了更多的tokens今天有一篇工作做了个有意思的观察多个Agent轮番发言之后观点会趋向一致但这个一致的结论并不一定是正确的。越强的说话者对最终结论的影响力越大有时候哪怕它的判断是错的也会把整个群体带偏。作者专门对比了几种投票和汇总策略最终结论是谁来汇总观点比谁在里面说话更重要。换句话说多智能体系统的瓶颈往往不是单个Agent的能力而是系统的决策机制。另一篇工作把这层反思往前推进了一步把多智能体协作当成一个优化问题来处理。他们的思路是不让Agent靠纯对话形成共识而是用类似群体智能的方式去迭代更新每个Agent的决策策略。模拟环境里的结果不错但我个人对这类工作的落地持保留态度真实系统里每个Agent背后都对应着真实API调用延迟和费用是论文里很难建模的变量。所以看多智能体类论文时我建议不要只看成功率还要专门统计系统攒了多少轮对话、烧了多少token、失败之后能不能恢复。这些指标在实际部署中往往比那点任务成功率更致命。2.3 偏见量化与修正从抽象担忧到可操作指标人工智能偏见这个主题已经火了不止一两年但今年的变化在于大家不再只停留在伦理讨论里而是开始提供可操作的量化指标。今天的几篇相关工作都把偏见拆成了几个不同层面数据层面、训练层面、推理层面并为每个层面设计了对应的代理指标。数据层面最常见的方法是统计语料里不同群体相关词汇的分布差异训练层面则观察模型在不同群体样本上的loss差异推理层面更直接给同一个问题换上不同群体相关的名字或属性再分析输出的倾向变化。今天有一篇工作做了一个很细致的实验只改变输入中的人名性别观察回答的用词差异然后用一个小的探测分类器去量化这种偏移。整个流程很轻成本不高复现起来也不用太多算力适合直接拿来做团队内的模型安全评估标准项。不过要提醒一句这类指标能告诉你存在差异但不能告诉你这个差异一定是恶意造成的。模型输出会因为训练数据里的真实分布产生差异这不等于模型存心歧视。所以在做偏见评估时最好把自动化指标当成初筛人工复核仍然不可替代。今天我把这个方向单列出来是因为能源源不断地产出可落地的量化工具比偶尔出一篇振聋发聩的伦理宣言对行业发展更有实打实的推动。2.4 面向真实场景的效率优化效率优化方向今天的几篇论文都比较务实。其中一篇做了注意力机制的稀疏化作者声称在长序列场景下能省下30%以上的显存同时保持绝大部分效果。另一篇做的是量化调度不是整个模型统一用一种精度而是按层动态选择量化位宽让计算量和精度需求高的层保留更高精度其他层用更低精度。这类工作的好处是它不只在理想的单卡环境下测数据而是考虑了真实服务负载。评估效率优化类工作我一般只看两个东西第一加速比是不是在贴近真实负载的条件下测出来的是不是端到端的时间而不是只测某一个算子第二论文有没有给出精度损失和资源节省之间的完整曲线。只给一个点上的数据通常意味着作者在刻意规避一些不好看的区间。今天这几篇在这两点上都做得还行但也没有哪篇让我觉得能直接用到生产环境。它们更大的意义是提供了值得尝试的切入角度具体效果还得在自己场景里复现了才知道。2.5 零星扫描生成式AI在辅助工作流中的新角色除了上面几个大方向今天还扫到几篇比较零散的论文。有的在讨论怎么把生成式模型接入科研辅助流程比如自动从文献里抽取实验设置、对比不同论文的实验差异。这种工作技术难度不算特别高但想法很实用尤其是在论文阅读和综述整理场景下如果真能做好能替研究人员省不少时间。还有一篇讨论生成式AI辅助制作工作型PPT的排版流程标题听起来很应用但内容其实涉及到版面结构理解和指令跟随能力不能算灌水。这类工作不一定能入选顶会但对普通从业者的日常工作有直接帮助我一般在汇总时也会给它们留一个位置。3. 看完摘要之后我会追问的三个问题一篇论文被我收进汇总清单只说明它值得记录不代表它经得起信任。从收藏到真正消化中间还有一道坎对论文做批判性追问。我给自己定了三个必问的问题每个问题都对应着一个常见的坑。3.1 这个提升是benchmark特异性的吗第一个问题是论文里的效果提升到底是对特定榜单有效还是在通用场景下有意义现在很多工作专门为了刷榜单设计方法从数据构成到评价指标都被优化过换一个分布效果就断崖式下降。我的习惯是看到某个亮眼指标的提升后去查一下作者在这同一个榜单之外是否还做了跨数据验证。最典型的反例是只在某个测试集上做文章却不敢碰更通用的自然任务集或来自不同时间段的数据。如果论文只报了自己改过的子集代码和数据又没公开那它在我这里最多算一个趋势信号提醒我这个方向有人在碰但不值得花整块时间去精读。反过来如果一篇论文愿意在两个以上差异较大的数据集上做对比哪怕提升幅度没那么夸张反倒更值得信任。3.2 为了这点提升付出了多少算力代价第二个问题是成本账。有些论文为了在某个精度指标上提升两个百分点动用了数百张GPU做了大量蒸馏、搜索或多次采样。这种工作在学术上有其意义但对我们这种资源有限、做实际产品的团队来说参考价值有限。所以我会特意把论文里提到的训练规模、推理成本、采样次数这些信息找出来估算一下复现它大约需要花多少计算资源。如果复现成本超过一周的单卡GPU时间我通常不会安排复现只做思路摘录如果成本在一个合理范围我会认真考虑跑一遍最小验证。这并不代表我用资源多少去判断论文好坏而是论文的价值本来就应该结合场景来看。一篇方法精巧、成本极低的论文很多时候比那种靠堆资源堆出来的高分论文更值得深入读。3.3 数据采集过程有没有在细节里藏风险第三个问题针对数据。尤其是涉及人类偏好、群体评价、安全对齐的论文数据采集环节非常容易埋雷。今天的几篇偏见相关工作里就有论文专门讨论标注者的人口统计学特征对标注结果产生的影响这提醒了我一个问题所谓人类偏好数据本质上是某一群人的偏好不是所有人的偏好。如果一篇论文把数据采集过程写得含糊其辞说不清楚标注者怎么招募、任务怎么设计、质量控制怎么做那它的结论就值得打一个大大的问号。我遇到过一些论文模型效果看着挺好结果一看数据采集流程问题一堆结论自然就立不住。所以在做汇总时数据来源是否干净这块我会专门盯一眼算是这几年踩坑踩出来的习惯。4. 从收藏到复现论文清单的落地方法论文汇总最怕变成收藏夹吃灰。我的做法是每筛选完一天的论文就把值得做的那些落到一个轻量清单里然后明确给出三个后续动作定位、找结合点、定复现优先级。4.1 一句话定位与结合点标记给一篇论文做一句话定位看似简单真做起来需要一点提炼能力。这句话要能清楚地回答三个问题它解决什么问题、用的是什么方法、达到了什么效果。比如对今天那篇推理置信度校准的工作我的定位是给推理过程增加可校准的置信度信号用回归模型预测回答可信度以便在问答场景提前拦截低置信度结果。这样一句话写下来即使三个月后回头翻笔记也能在十秒内回忆起来。定位写完之后我会再标一条结合点。如果当前手头有项目就写清楚这篇论文里的方法可以从哪个角度用进项目如果没有直接结合点就写下这篇论文里哪个单点想法值得借鉴。比如今天那篇多智能体收敛性分析的工作虽然我不打算完整复现但它实证对比不同汇总策略的思路可以直接参考以后设计Agent系统时我知道要留一个专门的模块去做汇总策略的评估而不是简单用投票。4.2 复现优先级与最小复现策略复现论文这件事很多人一上来就想完整复现所有数字结果被庞大的实验量劝退。我的习惯不是这样。我会先看这篇论文的核心机制是什么然后只复现这个核心机制。今天那篇稀疏注意力的论文、那篇置信度校准的论文我都会安排复现因为它们不需要超大集群一个人几天内就能跑出最小验证结果。最小复现的策略是先把作者公开代码跑通然后只改最核心的那个变量观察影响有没有如论文所说出现。如果核心机制生效了再考虑是否完整跟进如果没生效就先记录复现失败而不是花更多时间去调参。用这种策略单篇论文的消耗能控制在合理范围内同时还能积累一批哪些方法可信、哪些方法需要验证的认知这种认知积累起来非常有用。我还会给每篇论文打一个五年后是否还值得看的标记。听起来有点玄学但实际操作起来很简单如果这篇论文的核心思想在未来五年还可能有持续影响力就标精读如果只是在某个具体技巧点上优化了几个百分点属于会快速过时的细节改动标泛读就够了。今天这批论文里我认为推理过程的不确定性校准和多智能体收敛性分析属于前者而单纯在特定榜单上提分的那些工作大多属于后者。5. 关于arxiv提交与onhold状态容易被误解的几件事做论文汇总的人往往自己也投稿所以最后这部分聊聊arxiv本身。在网上看到很多关于投稿流程和onhold状态的讨论有些说法存在明显误解这里结合自己的使用经验把几个关键点说透。5.1 从提交到可见中间发生了什么arxiv不是期刊不做同行评审但这不代表它没有审核。提交一份论文后系统会先跑自动检查主要看格式是否合法、内容是否过短、分类是否合理、是否和已有论文重复度过高。自动检查通过之后还会根据规则进入人工处理队列分配到对应领域的管理员那里做人工放行。所以论文提交后并不会立刻可见通常要等一段时间。很多人第一次提交时看到状态不是已发布就开始焦虑其实没必要。正常的排队时间内状态会显示为Processing或类似状态只要没有收到补充材料的通知就说明系统正在走流程。这个等待期里不用反复登录刷状态一般过半天到一天再看即可。5.2 onhold究竟是怎么回事onhold这个状态被很多人说得很玄甚至有人怀疑是不是论文内容踩了红线。实际上onhold只是意味着论文被系统标记为需要人工复核。常见触发原因包括作者身份信息不一致、源文件存在编译问题、摘要和正文内容明显不符、同一个稿件被同时投到多个分类、参考文献里有大量未定义标签等。这些基本都属于流程或格式问题并不代表学术上出了问题。遇到onhold不用慌。我建议做三件事第一打开论文提交页面仔细看有没有未完成的事项第二对照官方格式要求逐项检查源文件特别是论文能否在官方源码检查器里顺利编译第三如果状态持续两天以上没有变化通过arxiv官方联系页面说明情况问一下是哪个环节需要补充。整个过程不需要走什么特殊渠道正常沟通即可。千万不要在onhold状态下去重复提交同一篇论文那反而会把情况搞复杂。5.3 投稿cs.AI最容易踩的几个格式细节结合自己和身边朋友的经历投稿cs.AI分类时最容易在几个格式细节上翻车。我把它们列出来算是给大家提个醒。LaTeX编译必须在官方源码检查器里通过。本地编译器能过不代表官方那边能过尤其是用了比较老的宏包时容易出事。参考文献用BibTeX的话要确认所有引用的key都有定义任何一条未定义引用都会导致编译失败而且报错信息经常很不直观。图表文件路径里不要有空格、中文或特殊字符这是个很基础但很多人会忽略的问题。作者信息在提交前要确认清楚特别是姓名拼写、单位名称和ORCID绑定。提交后虽然可以在修改期调整但能早做就别拖。分类选择上如果你确定文章属于cs.AI就直接选这个主分类不要同时勾选一堆看起来沾边的分类。跨分类提交更容易触发额外的人工审核对速度没好处。这些细节处理好了整个投稿过程会顺畅很多也能减少因为格式问题导致的onhold或退回修改。6. 关于追踪论文这件事我的真实感受最后聊点个人体会不算总结更像是一个坚持做论文汇总两年多的人的碎碎念。定期做arxiv论文汇总最大的好处不是把清单整理得多完整而是逼着自己持续保持对前沿方向的敏感度。最初几个月我经常盯着一个方向看觉得每天都有人在产出新工作焦虑感很重担心自己漏掉什么。坚持半年之后焦虑感反而降下来了原因是判断力上来了我越来越能分辨哪些工作是短期噪音哪些工作在两三年后还会有回响。这种判断力不会凭空出现只能靠一次次地浏览、对比、追问来积累。今天这批cs.AI论文看下来我的感觉是领域依然热闹但研究的颗粒度明显变细了。大家开始关心那些更便宜、更可靠、更清楚自己在做什么的问题而不是一味追求某个榜单上的虚高数字。这对于真正想把AI技术落地到实际场景的人来说是个积极的信号。如果你也想建立自己的论文追踪习惯我的建议很简单从每周固定一个时间段开始不需要太久两小时足够先不要追求全先追求稳定的节奏。一个月后回头看你会发现自己对这个领域的感知能力和记忆力都比以前好了不少。