ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

AI资讯追踪与每日简报系统:从RSS订阅到自动化信息流搭建

AI资讯追踪与每日简报系统:从RSS订阅到自动化信息流搭建 做AI这行十有八九都体会过这种焦虑早上起来刷一圈手机感觉什么都看了可一到下午开会别人提到某个新模型、新框架、新数据集的名称你还是只能尴尬地点头。AI领域的信息密度已经大到靠顺手刷一刷根本接不住的程度每天新发的论文、产品、开源项目、产业动态随便哪个方向都可能成为下一周的讨论热点。我这些年一直在做AI相关的产品和技术落地最大的体会就是信息差就是真金白银。别人提前三天看到某个开源模型的实测结论就能在方案选型上少走一个大弯路别人每天花二十分钟看固定信息源一周积累下来的判断力抵得上你临时抱佛脚刷两个小时热搜。这篇文章就把我自己在用的国内AI资讯网站清单和每日追踪方法完整整理一遍覆盖从综合媒体、技术社区、学术动态到产业报告的各个层级最后会给出一个可以直接抄作业的自动化每日简报方案。不管你是刚入行的学生、做AI产品经理还是在团队里负责技术选型的人这套体系都能让你每天花更少的时间读到更关键的信息。1. 为什么必须建立一套AI资讯追踪体系1.1 AI信息的三个特性决定了随缘刷手机必然失效先说说AI资讯和别的行业资讯有什么不同。第一个特性是爆发式增长。ArXiv上每天新增的论文就有几百上千篇其中真正有长期价值的可能只有几篇但你不扫描一遍根本不知道哪几篇值得精读。第二个特性是极强的关联性。昨天一个框架的发布今天就可能带动一批新项目出现后天又会反过来影响某个大模型的能力测评。如果你只看点状的新闻标题看不到这条因果链就会被信息牵着走而不是利用信息做判断。第三个特性是快速衰减。AI圈的一条新闻热度周期往往不到三天三天后再看到就只剩二手的讨论和情绪一手的信息增量已经被消耗完了。这三个特性叠加在一起结论非常明确追AI资讯必须靠体系不能靠刷。所谓体系就是明确自己每天固定看什么、怎么汇总、怎么筛选、怎么消化。没有这套体系的人每天花两小时刷社交媒体记住的却都是些碎片化的热梗有体系的人每天花二十分钟读固定源大脑里形成的是一条连续的、有结构的认知线。1.2 不同角色的信息需求差异不同身份的人对AI资讯的需求完全不同。我在做这套追踪方法之前走了很多弯路就是因为没有区分自己的角色定位。如果你是在校学生或者想转行进入AI领域的初学者你最需要的其实是方向感和知识地图。你要找的是那种能把技术原理讲清楚、能帮你建立概念框架的内容而不是每天追逐最新模型参数的新闻。对你来说深度教程、综述类文章、入门级的技术博客优先级最高产业新闻反而不着急。如果你是AI产品经理或业务负责人你关注的应该是应用场景和落地案例。哪个行业在用什么技术、跑了什么数据、效果如何、成本多高这些比某个模型在某个榜单上刷了个分数重要得多。你的信息源应该偏向产业媒体、行业报告、企业案例复盘。如果你是做算法、工程、研发的从业者你最需要的是一手信息和可复现的细节。论文源码、评测代码、超参数设置、工程实践中的坑这些往往不会出现在面向大众的新闻稿里而会散落在GitHub、官方技术博客、技术社区和论文站点。你需要在看新闻之外保留一条从论文/源码到社区讨论的追踪链路。我见过太多人犯一个同样的错误用同一种方式追所有信息。产品经理天天刷论文工程师天天看行业报告结果谁都没在自己真正需要的地方投入时间。建立追踪体系的第一步是诚实回答一个问题——这个阶段我到底靠AI信息做什么决策。1.3 一套好的追踪系统的四条评判标准我自己的经验是判断一套信息追踪方案好不好不看它收藏了多少网站也不看它订了多少个公众号而是看四条标准。第一条是覆盖度。你的信息源必须覆盖学术前沿、技术开发、产品应用、产业动态四个层面缺一个都会造成盲区。第二条是信噪比。信息源越多噪声越大好的体系应该能让你在尽量短的时间内得到尽量高的信息密度而不是把时间耗在筛选上。第三条是可持续性。这套方法必须能每天执行、不依赖意志力如果靠今天兴致来了读两小时来维持趁早别做。第四条是可追溯。你看到一条重要信息时要能很快找到它的源头、原始讨论和关键背景避免只看二手解读被带偏。后面给的网站清单和追踪方法全部围绕这四条标准展开。其中任何一条标准达不到我都不会把它写进来。2. 国内值得关注的AI资讯网站清单国内能看AI资讯的地方非常多但真正值得每天花时间盯的其实就那么些。我按信息来源的性质把它们分成五类每类说清楚看什么、为什么、适合谁。这份清单是我自己长期维护、反复筛选后留下的版本不是那种一次性塞给你五十个链接的收藏夹。2.1 综合科技媒体以最快的速度获取头部信息这一类是大多数人最熟悉的也是我每天信息流的起点。国内做AI报道的综合科技媒体里最值得放进RSS订阅的包括量子位、机器之心、新智元和智东西。量子位的特点是快大部分国内外重要AI产品的首发消息、实测报道它都能在很短时间内跟上而且报道角度比较务实很少堆砌没用的修辞。机器之心的优势是技术报道的深度它经常会翻译或约稿一些针对论文、框架、工程实践的解读对于想了解技术细节的研发人员来说价值很高。新智元的选题风格更偏产业和资本适合想了解AI创业公司动态、融资消息和行业竞争格局的人。智东西则是综合类硬科技媒体里AI报道占比很高的一个它的内容更偏产品化和供应链视角做AI硬件和终端应用方向的人值得关注。这一类媒体的特点是信息增量高、更新频率高但每篇文章的保质期都很短适合快速扫标题和摘要不需要逐篇精读。我的建议是早上的信息流以它们为主重点是建立当天AI圈发生什么大事的基线。2.2 技术社区与开发者平台获取工程实践和真实讨论如果说综合媒体告诉你发生了什么技术社区则告诉你实际怎么做的、踩了什么坑。国内最有价值的技术社区包括知乎上的AI话题、CSDN、掘金和开源中国。知乎的AI话题区现在依然是中文互联网上技术讨论密度最高的地方之一很多一线研究员和工程师会在相关问题下输出非常高质量的长文。我特别建议关注那些某某模型技术解读某某论文源码分析类的问题下面的回答往往比新闻稿详细得多。但知乎的信息噪声也很大需要靠关注列表来筛选这是后话。CSDN和掘金对国内开发者的价值在于中文技术博客的生态。很多国内团队的工程博客、开源项目使用教程、模型部署实战会优先发布在这些平台上。你如果平时用主流框架做应用开发搜索解决方案时一定会频繁命中它们。开源中国的价值则在于它和国内开源社区、代码托管平台绑定很深很多项目发布、社区活动、技术沙龙的消息最早都出现在这里。浏览这些平台时要改变一下心态不要把它们当新闻看而是当工具书和讨论场看。需要解决某个具体问题时去搜工作间隙去翻热门讨论不用强迫自己每天都把信息流刷完。2.3 学术动态与官方博客确保自己不被二手信息带偏任何AI资讯追踪体系里最关键也最容易被忽略的是一手信息来源。我见过不少只读新闻稿的人把一个模型的能力吹得天花乱坠结果自己连原始论文的评测设置都没看过。避免这种情况必须把学术动态和官方博客作为正式信息源纳入日常追踪。学术动态方面ArXiv的cs.AI/cs.CL/cs.LG分区是绕不开的源头。国内有大量中文社区和公众号在持续做ArXiv论文的筛选和解读比如PaperWeekly它组织的论文解读、系列专题质量在国内算第一梯队。此外智源社区BAAI提供的中文论文解读、学术会议报道和社区讨论也值得关注尤其是它主办的AI学科前沿报告信息密度很高。官方博客是不可替代的。阿里云、腾讯云、百度AI、华为云、字节跳动、月之暗面、智谱AI、DeepSeek等国内主要AI团队的官方博客和技术公众号会第一时间发布自家模型的技术报告、产品更新、开源项目说明。这些内容的权威性和细节程度远超任何第三方媒体是所有研发人员必须盯的源头。不要只看别人的解读官方口径才是你形成判断的基准线。需要提醒的是论文和官方博客的信息密度虽高但阅读成本也高。我的处理策略是论文看标题和摘要感兴趣放进待读清单官方博客重点看技术指标、使用限制和开源协议三段其他略过。2.4 产业报告与数据平台看清趋势和落地情况AI不只有技术和论文还有产业和商业。对做产品、做投资、做战略的人来说产业报告和数据平台的信息价值往往比技术新闻更高。艾瑞咨询、亿欧智库、IDC中国、甲子光年这几家机构会定期发布AI相关的行业研究报告覆盖大模型应用、智能体落地、数据标注市场、AI基础设施等方向。这类报告通常不会免费公开全部内容但公开的摘要和框架已经足够帮你建立行业全貌。量子位智库和机器之心PRO也会有类似的付费/免费报告适合按需查阅。数据平台方面Hugging Face对于模型开源趋势的价值不用多说它上面的模型趋势、数据集下载量、模型卡信息是判断一个开源项目是否受到真实关注的硬指标。国内也有魔搭社区ModelScope和百度飞桨的模型库对国内生态的覆盖更直接。阿里天池、Kaggle这些竞赛平台的讨论区也会有大量实战经验分享很多人忽略了这个信息源其实在追踪某个任务当前最优方法是什么这个问题上非常高效。产业报告和数据平台不适合每天刷更适合每周固定时间集中看一次。因为它们的更新频率以周/月为单位追逐日更反而浪费时间。把这些源加入RSS订阅列表时我建议单独分组避免它们和日更媒体混在一起拉低你的刷新效率。2.5 视频与播客碎片时间利用选项最后是适合碎片时间消化的一类——视频和播客。B站上有不少质量很高的AI技术UP主比如做论文精读、项目复现、行业吐槽类的三分钟五分钟讲清楚一个技术点的效果往往比读三千字文章好。同样值得关注的是知乎的圆桌讨论、小宇宙上的技术播客很多播客邀请一线从业者聊模型落地、团队管理、职业发展内容深度不比文章差。但视频和播客有一个很大的问题信息密度低。二十分钟的视频有效信息可能十分钟就能读完文字稿。所以我的建议是这类内容不要占据你追踪体系的主体只作为通勤、做家务时的补充。真正重要的信息仍然要从文字源获取。3. 每日追踪的实操方法把信息源变成信息流文章前半段解决了看什么的问题这部分解决怎么看、怎么坚持。我见过太多人收藏了几十个链接结果一个都没打开过。原因很简单信息源不等于信息流中间缺一个汇聚和筛选的环节。3.1 分级订阅把信息源分成S/A/B三级订阅的第一步不是把所有网站都塞进阅读器而是先做分级。我把自己的订阅源分成三个等级用不同的频率和深度去消费。S级是每天必读的源数量控制在5到8个。对我个人来说量子位、机器之心、ArXiv的cs.AI分类、DeepSeek和智谱的官方博客、Hugging Face的趋势页这些属于S级。它们决定了当天信息流的骨架。A级是每周集中读的源包括技术社区的高赞内容、产业报告、某些垂直方向的专业博客。A级源不需要每天刷否则会明显增加信息过载的风险固定每周抽一两个小时集中看就够。B级是每月或按需查阅的源比如特定竞赛平台、冷门的专题博客、行业会议的资料。平时不需要进信息流放进收藏夹、遇到相关问题再检索即可。分级的好处很明显你的注意力被有意识地分配到真正有价值的地方。大多数人信息过载不是因为看得少而是什么源都按S级的频率去刷把自己累坏了最后干脆什么都不看。3.2 用RSS把碎片信息汇聚到一个入口把不同网站的信息汇聚起来最成熟的方案还是RSS。RSS虽然是个老协议但在把分散的信息源聚合到一个地方这件事上到今天都没被替代。国内大部分科技媒体、博客、ArXiv都提供RSS输出少部分不支持的可以通过RSSHub等工具生成订阅地址。我的日常入口是一个单独的RSS阅读器S级源全部订阅进去平时只打开这一个应用就够了。这样做的最大好处是摆脱算法推荐。公众号、新闻App的信息流都是算法按热度推给你的而RSS是按你自己的订阅源按时间排序的你看到的是你选择的世界而不是别人想让你看到的世界。对于AI这种需要主动追踪、深度思考的领域这一点至关重要。我自己的S级订阅列表整理如下供参考级别信息源订阅地址以实际源为准消费频率S量子位qbitai.com 站点feed每天刷标题摘要S机器之心jiqizhixin.com 站点feed每天刷标题精读2-3篇SarXiv cs.AI/CL/LGexport.arxiv.org对应rss每天扫摘要S智谱/DeepSeek/阿里云等官方博客各站点feed每1-2天刷A知乎AI话题热榜通过RSSHub生成每周集中看AIDC/艾瑞/亿欧报告站点更新页面每周看摘要B垂直方向技术博客按需订阅月度/检索使用这里有个实操细节RSS地址会变尤其是一些小站点的feed地址并不稳定。我建议不要到处找XX网站RSS地址的旧帖子抄而是打开网站首页看有没有RSS订阅图标或者用RSSHub按官方文档现场生成。这样得到的地址才靠谱。3.3 公众号与社区讨论的二次加工RSS能覆盖大部分网站但有一个痛点是它覆盖不了微信公众号生态。国内大量优质的AI技术文章只在公众号发布不提供RSS输出这是很多人在信息获取上被卡脖子的地方。我的解决方案是公众号内容不进常规信息流每周固定时间集中看一次。具体操作是把必须看的公众号设星标平时不要每次推送弹出来都点开而是每周挑一个时间比如周六上午统一打开微信订阅号列表从星标号开始按标题筛选着读。这个过程配合微信的搜索功能使用——当你需要回忆哪个公众号发过某篇技术文章时直接搜标题关键词比翻历史记录高效得多。社区讨论如知乎热榜、技术论坛高赞同理不要在零散时间里刷而是每天抽一个固定时段我习惯午休后用十五分钟快速扫一遍当天的热门讨论。扫的时候只做一件事判断有没有值得进入自己待读清单的内容。有就丢进稍后读工具没有就果断关掉。3.4 建立每日追踪时间窗有了信息汇聚工具和分级策略最后一步是固定每日追踪的时间窗。根据我的经验一天里有两个时间段最适合处理AI资讯一个是早上开工前另一个是午饭后。早上的时间窗建议20到30分钟处理S级源。操作顺序是先扫一遍RSS阅读器里的当日更新标记出值得精读的条目然后精读其中最重要的两到三篇最后把还需要深挖的内容论文原文、代码仓库、原始报告丢进待读清单留给晚间的时间窗处理。午饭后或者晚间的时间窗建议15分钟左右消化社区讨论、公众号更新、待读清单里的内容。这两个时间窗加起来每天不到一小时没有额外负担才能长期坚持。我知道很多人会觉得这么做会不会太死板、太束缚了我的回答是所谓自由地刷手机其实是被信息流操控而固定的时间窗才是你把主动权拿回来的方式。你说你随便逛逛也能看到好内容但那是碰运气不是方法。4. 实操打造属于自己的每日AI简报系统前面几节的方法完全可以靠手动完成每天打开RSS阅读器刷一遍也能收效。但如果你和我一样希望在保持信息覆盖的同时进一步压缩时间那么可以花半小时搭一个每日AI简报的自动化脚本。它做的事情很简单每天定时抓取你订阅的RSS源内容调用大模型接口生成一份结构化的中文摘要推送到你习惯的终端。下面直接给出我的实现方案。4.1 系统整体架构整个系统由四个部分组成逻辑非常清晰一是RSS数据源也就是你订阅的那些feed地址它们是系统的输入。二是抓取模块用Python的feedparser库读取RSS数据过滤出过去24小时内的新文章。三是摘要模块把文章标题和链接拼成一段文本发给大模型的API接口让它按主题归纳、生成简报。四是输出模块把生成的简报保存为Markdown文件并推送到钉钉、企业微信、Telegram Bot或者本地终端。为了兼顾易用和通用性我把大模型接口设计成OpenAI兼容格式这样国内用得比较多的DeepSeek、通义千问、智谱GLM都可以直接接入只需要换接口地址和模型名。4.2 抓取模块的代码实现先写抓取部分。feedparser是一个很好用的RSS解析库直接用pip安装即可。下面的代码会遍历你配置的订阅源字典取出24小时内发布的新条目并清理HTML标签后截断保存。import os import re import feedparser from datetime import datetime, timedelta SUBSCRIPTIONS { 量子位: https://www.qbitai.com/feed, 机器之心: https://www.jiqizhixin.com/rss, arXiv cs.AI: http://export.arxiv.org/rss/cs.AI, } def clean_html(text): 去掉HTML标签压缩空白字符方便后续交给大模型处理 text re.sub(r[^], , text or ) return re.sub(r\s, , text).strip() def fetch_recent_articles(feed_url, hours24): 抓取RSS源中最近hours小时内的条目 parsed feedparser.parse(feed_url) articles [] cutoff datetime.utcnow() - timedelta(hourshours) for entry in parsed.entries: published getattr(entry, published_parsed, None) or getattr(entry, updated_parsed, None) if not published: continue pub_dt datetime(*published[:6]) if pub_dt cutoff: continue articles.append({ title: entry.get(title, ), link: entry.get(link, ), summary: clean_html(entry.get(summary, ))[:500], }) return articles注意一个坑不要直接拿entry.published这个字符串去比较时间很容易因为时区格式不一致而出错。用feedparser解析好的published_parsed元组是最稳的它是UTC时间的struct_time直接转成datetime对象做比较就行了。4.3 摘要模块的代码实现抓回来一堆标题和链接之后直接看不划算而且一天几十条信息没重点。我把它们拼成一段文本让大模型做归纳总结。这里使用OpenAI兼容接口通过环境变量配置地址和密钥方便切换不同厂家的模型。import requests API_KEY os.getenv(AI_API_KEY) BASE_URL os.getenv(AI_BASE_URL, https://dashscope.aliyuncs.com/compatible-mode/v1) MODEL os.getenv(AI_MODEL, qwen-plus) def generate_daily_brief(items): 把RSS条目交给大模型生成一份结构清晰的每日AI简报 prompt 你是一名AI行业编辑请根据以下信息源抓取到的条目生成一份中文简报。\n prompt 要求\n prompt 1. 按主题归类例如模型发布、开源项目、产业动态、学术前沿\n prompt 2. 每个条目用不超过60字说明核心信息和值得关注的原因\n prompt 3. 最后用三句话总结今天的整体趋势。\n\n prompt 以下是信息条目列表\n for name, title, link in items: prompt f- [{name}] {title} {link}\n resp requests.post( f{BASE_URL}/chat/completions, headers{Authorization: fBearer {API_KEY}}, json{ model: MODEL, messages: [{role: user, content: prompt}], temperature: 0.3, }, timeout60, ) resp.raise_for_status() return resp.json()[choices][0][message][content]prompt的写法决定了摘要质量。我试过几版最忌讳的是让模型尽量详细地介绍每条新闻那样输出的简报比原文还长完全没有意义。按主题归类 指出值得关注的原因这个约束把模型输出格式固定下来生成的内容才能真正拿来当决策参考。4.4 主流程与定时任务配置最后把抓取和摘要串起来形成完整的main函数并把结果保存为Markdown文件。这段代码还做了基本的容错处理单个源抓取失败不会让整个流程挂掉而会把错误信息打印出来继续执行。def main(): all_items [] for source_name, feed_url in SUBSCRIPTIONS.items(): try: articles fetch_recent_articles(feed_url) print(f[{source_name}] 抓到 {len(articles)} 条新内容) for a in articles: all_items.append((source_name, a[title], a[link])) except Exception as e: print(f[{source_name}] 抓取失败: {e}) if not all_items: print(今天没有抓到任何新内容跳过简报生成。) return brief generate_daily_brief(all_items) output f# 每日AI简报 {datetime.now():%Y-%m-%d}\n\n{brief}\n with open(daily_ai_brief.md, w, encodingutf-8) as f: f.write(output) print(output) if __name__ __main__: main()定时执行我用的是crontabLinux和macOS都支持。想每天早上八点自动跑一次就在终端里执行crontab -e然后加入一行0 8 * * * /usr/bin/python3 /path/to/daily_ai_brief.py /path/to/run.log 21如果你用的是Windows可以在任务计划程序里创建一个每日任务触发器选择每天八点操作指向运行python脚本效果完全一样。跑一段时间后你会得到一个增量改进的空间哪些源老是抓不到新内容说明它的RSS更新不频繁可以考虑调整刷新时间哪些源出来的内容总是无价值的水文说明它不适合进S级果断踢出去。这个脚本的本质不是让你一次搭完就完事而是帮你把每日追踪变成一个可以持续优化的系统。5. 常见问题与排查技巧实录这套方法我在在不同场景下跑了大半年中间踩过不少坑。这一节整理成速查表每个问题都附上我自己实践过有效的解决思路。5.1 遇到的问题合集问题现象排查思路解决办法RSS地址失效阅读器提示404或长时间不更新先确认网站是否改版打开网站首页找新的feed入口用RSSHub现场生成必要时临时改用网页抓取信息源太杂导致刷不完每天红点几十上百条越看越焦虑检查订阅里是否混入大量A/B级源按3.1节分级把非S级源移出每日刷新队列明确每周集中处理时间摘要内容出现幻觉简报里出现原文没有的细节检查prompt是否给了太多自由发挥空间在prompt中明确只根据给定条目总结不要补充外部知识降低temperature参数到0.3以下部分网站反爬严格脚本返回403或验证码请求频率太高或User-Agent被识别给请求加正常浏览器UA增大抓取间隔优先找官方API或RSS而非直接抓网页时区混乱导致漏内容抓到的条目总比预想的少判断是不是utc时间和本地区时间搞混统一用UTC时间做过滤基准展示时再用datetime把时间转换到本地自动化任务没跑到了时间没收到简报先看日志文件有没有报错确认crontab中python路径是全路径Shell环境变量API_KEY是否已正确导出到crontab环境5.2 两个最容易忽略的坑除了表格里的问题还有两个坑值得单独拿出来说。第一个是不要贪多。我一开始做这套系统时订阅了二十多个RSS源结果每天简报内容比我想看的还长最后不得已又花时间精简。信息追踪的收益是边际递减的五个优质源认真读比二十个源随便扫要好得多。这个道理听起来很简单但只有真正被信息洪流冲过的人才会放在心上。第二个坑是不要忽视原始链接。大模型生成的简报里虽然已经包含关键信息但它毕竟经过了压缩和转述难免丢失细节或者出现理解偏差。我在prompt里保留了原始链接并且固化了一个习惯凡是简报里被我标成值得关注的条目都会点进原始链接快速确认一遍。这一步花费不了多少时间却能把二手摘要失真的影响降到最小。6. 一些个人实操感受文章最后不写什么总结就分享两个我实际执行下来的感受。第一追踪AI资讯这件事坚持比方法重要但好的方法能让你坚持得更轻松。我最早也用收藏夹和公众号订阅断断续续坚持不了半个月后来换成RSS分级和每日简报系统每天固定时间执行反而一直用到了现在。区别在于整理好的系统不消耗你的意志力而零散的信息获取方式每次都要靠临时决定人很容易在临时决定面前放弃。第二这套方法一定要做减法和定制。我给自己的信息源做过三轮大清洗每次删掉一半订阅留下的都是真正持续提供价值的。而且每个人画像不同你需要什么取决于你具体做哪个方向、处于什么阶段不要照抄任何人的清单。以我的清单为起点跑两周然后根据自己日常使用中的感受做调整最终形成属于你自己的版本就对了。
返回列表