`,标题链接在
`h2.item-title`,发布时间在 `i.meta-time`(近一周为「刚刚 / N小时前 / N天前」相对
日期,需归一;更早为 `YYYY/MM/DD`);封面为 `image.uisdc.com` 直链。每页 40 条,
`/tag/aigc/page/N` 上游翻页(109 页,注册表限 20 页)。
- 正文:常规文章页(`/{slug}`)与灵感卡片页(`/group/{id}.html`)由
`extractUisdcBodyHtml` 抽取(避开 Readability 把 `.uisdc-none` 当隐藏节点、
以及 group 图集落在 `.group-singular-images` 兄弟节点的问题);文中「阅读文章」
相关卡(`.tuwen_link`)会剥离。`
` 包图在排版规整时会解包保留
`
`(不得当空 span 删掉)。图片懒加载 `data-src` 仍由 `normalizeContentImages`
统一提升。
- 同站其他候选 tag:`/tag/ai绘画`、`/tag/ai视频` 等结构相同,`uisdc` kind 可直接
复用,暂只注册 AIGC 一个入口避免同站内容刷屏。
**人人都是产品经理 · AI(kind `feed`,`woshipm-ai`)**
- `https://www.woshipm.com/category/ai/feed`:WP 分类 feed 正常,`content:encoded`
全文(~4.7k 字/篇),含大模型横评、Agent 架构拆解等评测/深读内容。全站 feed
(`/feed`)混入运营/电商话题,故只收 AI 分类。
### 4.3 落选记录(2026-08-25 实测)
| 候选 | 探测结果 |
|---|---|
| 归藏 AIGC Weekly(重评) | 公众号不在 wechat2rss 免费列表;Quaily 路径维持 §3 结论(SSR 仅 ~1000 字预览 + PREMIUM 付费墙),仍无全文可达路径 |
| 数字生命卡兹克 | 公众号不在镜像免费列表;其 AIHOT(aihot.virxact.com)是资讯聚合平台而非本人文章存档,不能替代公众号长文 |
| Founder Park | 维持 §3 结论:无独立站点,且不在镜像免费列表 |
| 集智俱乐部(镜像可用) | feed 达 5.7MB 且内容偏复杂科学/学术交叉(生物、数学物理),与「AI 产品深度解读/评测」定位不符。**2026-08-25 硬科普轮按科普定位重评后收录(`swarma`),见 §6** |
| Datawhale(镜像可用) | 教程/训练营向,深度解读密度低 |
| 数英 digitaling.com | `/feed` 返回 HTML(无 RSS);内容偏营销创意案例,AI 深度评测密度低,需专用解析性价比不足 |
| 站酷 zcool.com.cn | 列表页为阿里云 WAF JS 挑战壳(无 JS 客户端拿不到内容),且以作品图集为主非图文长文 |
| sogou 微信搜索 / feeddd / RSSHub 微信路由 | 搜狗验证码墙(2026-08-25 复测:数据中心 IP 拿到的公众号搜索结果页为空壳);feeddd 项目已停更;RSSHub 公共实例对通用抓取返回 403、微信路由长期不可用——均不满足「稳定公开聚合入口」 |
| profile_ext / homepage(微信官方页) | `mp/profile_ext?action=home` 无会话返回「请在微信客户端打开」;`mp/homepage?f=json` 仅对开通页面模板的号有效(抽样 `ret:5`)——与无账号定位冲突 |
| freewechat.com(自由微信存档) | `profile/` 可按 biz 直出存档页,但 `?rss` 同为 content:encoded 全文(抽样 3MB)、站内搜索 403;可达性与合规敏感度不适合内置 |
验证方式:新增源均用 `parseSourcePayload`(新 kind 解析器)对线上响应做端到端冒烟
(uisdc 两页 40+40 条、重叠 1 条、日期/封面齐全;4 个镜像与 woshipm 全部条目带真实
日期、全文比例见上表);优设两类详情页用 Readability + linkedom 验证站内抽取。
单测见 `scripts/community-wechat-sources.test.ts`(`npm run test:community-sources`)。
## 5. 私域信源二轮甄选与 AI 分类分层(2026-08-25)
背景:(1)公众号等私域内容必须真优质、不要凑数;(2)AI 场景预设与分类
应按信息层次分层,启用数量足够但不过多。
### 5.1 甄选标准与抽检方法
- 标准:深度解读 / 横向评测 / 产品体验 / 行业洞察,**不是**搬运官宣、刷屏快讯、
营销软文;更新节奏稳定;wechat2rss 清洗后正文实质可用;中文优先。
- 方法:对每个候选拉取 feed 最近 12 条,统计正文纯文本长度中位数与 ≥800 字比例,
逐条判定题材(深度 / 快讯 / 互动帖 / 软文)。
### 5.2 现有私域与社区源结论
| id | 判定 | 依据(最近 12 条抽检) |
|---|---|---|
| `xixiaoyao` 夕小瑶科技说 | **retain** | 中位 2.6k 字、12/12 ≥800 字;「实测扣子桌面端」「连夜实测 DeepSeek V4 Pro,低于预期,不推荐」等一手实测约占半,其余为快讯化解读(偶有「被曝」体标题,已知噪声);镜像池内中文实测稀缺,保留 |
| `paperweekly` PaperWeekly | **retain** | 中位 3.9k 字、11/12 ≥800 字,论文深读题材专一、质量稳定;taxonomy v3 归「AI研究工程」 |
| `42zhangjing` 42章经 | **retain** | 中位 6.8k 字深度访谈/长文(「泡沫的四个必要不充分条件」「Agent 动力学」),月 2–3 篇低频高信噪;3/12 为短活动帖,可接受 |
| `chaping` 差评 | **remove** | 每日固定「今日最佳」「聊一聊」互动帖(51–101 字),题材泛科技吃瓜(速成车 / 东方甄选 / 社会报道),4/12 <800 字;既非 AI 深读也非顶尖评测,注册表整条移除 |
| `uisdc-aigc` 优设 AIGC | retain | AIGC 教程/实测图文 4k–10k 字,「体验解读」价值成立;taxonomy v3 归「AI产品实践」 |
| `woshipm-ai` 人人PM AI | retain(不进默认预设) | 中位 4.2k 字,含真横评(「横评 GLM-5.3 / DeepSeek-v4-pro / K3」)与 Agent 落地实战;UGC 质量波动、单日可达 6 篇,默认关 |
### 5.3 新候选探测(wechat2rss 免费列表 395 个号全量比对)
免费列表以安全类公众号为主,AI 相关候选有限;逐一实测结论:
| 候选 | 结果 |
|---|---|
| 海外独角兽 / 数字生命卡兹克 / 归藏 / Founder Park / 硅星人 / 张小珺 / 腾讯科技 / 甲子光年(公众号) | 均不在镜像免费列表,无稳定全文入口,无法收录(甲子光年已有官网源 `jazzyear`) |
| 傅盛 | 镜像可用;中位 2.0k 字、12/12 ≥800 字,AI 体验/观点向更新稳定;但篇幅偏短、标题营销腔明显(「干翻」「引爆」「掀翻」),整体弱于现存三源,落选 |
| 机器之心 / 量子位 / 新智元 / 极客公园(镜像) | 与既有站点源(`jiqizhixin` / `qbitai` / `aiera` / `geekpark`)内容重复;量子位镜像另混入每周多条招聘帖,不收 |
| Datawhale(复测) | 教程 + 营销帖(大会门票 / 企业落地班 / 培训生招聘),维持 §4 落选结论 |
| 集智俱乐部(复测) | 中位 6k 字但复杂科学/学术交叉(玻尔兹曼方程推导 18k 字、集智百科 42k 字),与 AI 产品深度定位离题——**不进 AI 分层**;2026-08-25 硬科普轮按科普定位收录进 `science` 分类(见 §6) |
| 我爱计算机视觉 | CV 论文解读向,题材窄且与 PaperWeekly 重叠,落选 |
| 腾讯技术工程 / 阿里技术 | 大厂工程博客,非 AI 深度解读定位,落选 |
### 5.4 AI taxonomy v3(2026-09-24)
AI 不再按“厂商品牌 / 中文外刊 / 社区”交叉建栏,而是在唯一的 **AI 前沿** 预设里按阅读任务分 7 类:
- `ai-labs` **模型厂商与实验室**:OpenAI News、Anthropic News、Claude Blog、Google AI、DeepMind。
- `ai-ecosystem` **开源生态与评测**:Hugging Face、PyTorch、Arena。
- `ai-practice` **产品实践**:OpenAI Cookbook、Claude Customers / Academy、优设 AIGC、人人 PM AI。
- `ai-media-cn` **中文AI媒体**:量子位、机器之心、新智元、雷锋网、智东西。
- `ai-media-en` **海外AI媒体**:Synced、MIT TR AI、Verge AI、IEEE、VentureBeat、MarkTechPost。
- `ai-engineering` **AI研究工程**:PaperWeekly、夕小瑶、Simon Willison、Latent Space、Interconnects、Lil’Log。
- `ai-thinking` **AI思想产业**:宝玉、One Useful Thing、Understanding AI、Zvi、42章经。
- `ai-watch` **AI周报观察**:Last Week in AI、Import AI、Ahead of AI。
V2 的内置 taxonomy 是全局互斥分区:一个内置信源只属于一个预设、一个分类。Hacker News / V2EX / InfoQ / 阮一峰因此统一进入「科技数码 → 开发者社区」,不会再同时出现在 AI 社区栏。旧用户布局升级时会物化为自定义分类/预设,不按新 taxonomy 猜测重排。
## 6. 硬科技 / 科普信源扩充(2026-08-25)
背景:用户点名收录 **集智俱乐部 / 长尾科技 / 地球知识局** 及同档硬科普号。
甄选标准与 §5 不同:本轮要的是**深度科普 / 硬核解读 / 科研进展**(不是 AI 产品评测档),
拒绝营销软文与课程招生刷屏;taxonomy v3 中分别归属 **基础科学 / 科研前沿 / 地理观察 / 技术深读**,不进 AI 分层。
### 6.1 收录(5 个)
| id | 源 | 路径 | 抽检(2026-08-25) | 结论 |
|---|---|---|---|---|
| `swarma` | 集智俱乐部 | wechat2rss 镜像(feed ~5.7MB,列表剥离全文兜住) | 20 条中位 4.1k 字、20/20 ≥800 字,最新 2026-08-24;复杂系统 / 统计物理 / AI 交叉深读 | 收录。官网 swarma.org `/feed` 404、`/?feed=rss2` 可用但停更于 2025-10,只能走镜像;默认关(镜像政策),taxonomy v3 归「科学知识 → 科研前沿」 |
| `qianhei` | 浅黑科技 | wechat2rss 镜像(feed ~4.4MB) | 20 条中位 12.1k 字、20/20 ≥800 字;硬科技长文特稿(国产制造 / 安全 / 基础设施),月更 1–2 篇,最新 2026-06-01 | 收录进 **科技深度**。低频大体积默认关,分类内可见 |
| `netease-fanpu` | 返朴 | 网易号 `T1551235486149`(dy TID 列表) | 20 条/页、offset 翻页正常、日更 1–3 篇;脑科学 / 数学 / 物理严肃科普 | 收录。官网 fanpu.cn 域名不可达;默认开(与果壳 / 泛科学等科普源一致) |
| `netease-wuli` | 中科院物理所 | 网易号 `T1479706079278` | 20 条/页、日更;生活物理问答 + 科研进展科普 | 收录,默认开 |
| `netease-diqiu` | 地球知识局 | 网易号 `T1479097401984` | 20 条/页、日更约 1 篇;人文地理科普,正文实测 2k+ 字带图 | 收录,默认开;taxonomy v3 归「科学知识 → 地理观察」 |
网易号正文路径实测:`c.m.163.com/nc/article/{docid}/full.html` 对地球知识局直接返回 JSON 正文;
返朴 / 物理所偶发 204(既有已知行为,`resolveBody` 注释有记录),
由 `m.163.com/news/article/{docid}.html` 与 `www.163.com/dy/article/{docid}.html` 落地页 +
Readability 兜底(实测正文块 2.4k–10.6k 字),站内全文成立。
新源 id 保持 `netease` 前缀(正文兜底按前缀路由),列表 UA 固定 `NewsApp`。
默认 `enabled` 判断:网易号三源接口与既有网易频道同稳,比照果壳 / 泛科学 / 环球科学 / 知识分子
默认开;两个 wechat 镜像源沿用「第三方镜像默认关」的既有政策(§4.1)。taxonomy v3 唯一归属:返朴 / 物理所 →「基础科学」,集智 →「科研前沿」,地球知识局 →「地理观察」,浅黑 →「技术深读」。
### 6.2 落选记录
| 候选 | 探测结果 |
|---|---|
| **长尾科技**(点名) | 技术上不可达:不在 wechat2rss 免费列表;官网 changweikeji.com TLS 证书过期且首页为空壳 SPA(无列表数据);数据中心 IP 抓 `mp.weixin.qq.com/s?__biz=…` 与合集入口全部命中验证壳,拿不到 `__biz`/`album_id`;freewechat 存档文章页被 Cloudflare 拦截;`mp/homepage` 仅有栏目列表、无日期无合集 id。**兜底**:用户可在微信内复制其公开合集分享链接,走「自定义源」粘贴收录(`isWechatAlbumUrl` 路径) |
| 利维坦 | 网易号可达(`T1466496362808`)但最近 20 条中 6 条为店铺清仓等推广帖,信噪比不足 |
| 星球研究所 | 重心已转视频,无可达的图文全文流 |
| 科学大院 | 无独立网易号(内容经物理所等号转载),缺独立入口 |
| SME科技故事 | 网易 / 搜索均无法定位其原创号,无稳定入口 |
| 小火箭 | 镜像可用但停更于 2020 年底 |
| 空天防务观察 / 方方的航空小筑 / 温哥华的鱼 | 镜像可用但军工 / 防务向 + 转载与推广填充,与科普定位不符 |
| 中科院之声 / 果壳(公众号) / 酷玩实验室 / 丁香医生 / 把科学带回家 / 科研圈 / 赛先生 / 原理 | 均不在 wechat2rss 免费列表,也未找到可编程的网易号 / 官网 feed 入口(果壳已有站点源 `guokr`) |
验证:`npm run test:community-sources`(新源 kind / URL / UA / 默认启用 / 分页策略 / 分类归属断言),
`npm run test:layout-presets`(预设互斥与 mix 重叠不变量)。
## 7. AI 一手官方源扩充(2026-08-26)
背景:补齐 OpenAI / Anthropic(Claude)官方一手内容并默认启用;既有 `anthropic` /
`openai-news` 保留不动(后者由默认关改为默认开)。taxonomy v3 中模型厂商/实验室内容归 `ai-labs`,Hugging Face / PyTorch / Arena 归 `ai-ecosystem`,教程/案例归 `ai-practice`;
分页策略 `client-catalog`,正文走通用 Readability;`claude.com` 加入智能分流国际域名
(`academy.claude.com` 由后缀匹配覆盖;`developers.openai.com` 已被既有 `openai.com` 覆盖)。
### 7.1 收录(5 个新源 + 1 个启用)
| id | kind | 探测要点(2026-08-26 实测) |
|---|---|---|
| `claude-blog` | claude-webflow | claude.com 是 **Webflow** 站(非 anthropic.com 的 Next.js/Sanity),无 RSS(`/blog/rss.xml` 等均 404)。CMS 集合服务端渲染:网格条目带隐藏元数据 `fs-list-field="heading"` / `fs-list-field="date"`,首页跑马灯条目(`marquee_cms_blog_list_item`)只有 `` 标题 + 英文日期文本;两处合并去重后 25 篇全带日期。同一篇会渲染多遍,去重时**带日期版本优先**。标题含 `'` 等十六进制实体,解析器先解码。正文页服务端渲染约 2 万字符文本,Readability 正常 |
| `claude-customers` | claude-webflow | 同上 Webflow 集合(`stories_cms_item`);标题优先取 `fs-list-field="title"`(故事标题),缺失退回 `client`(客户名);21 篇全带日期 |
| `claude-academy-use-cases` | claude-academy | academy.claude.com 为 TanStack SSR 站,无 RSS,sitemap 无 lastmod。卡片 `标题
` 静态渲染;列表与详情均无日期 → `hasRealDate=false` + 递减伪时序(同 `paulgraham`,feed 层会排在有日期条目之后)。详情页为完整文字指南(实测 5.9k 字符文本),Readability 正常 |
| `claude-academy-tutorials` | claude-academy | 同上卡片结构(31 条)。**详情为视频教程**,服务端只渲染标题 + 简介(约 375 字符),正文偏薄、播放器为客户端 SPA 组件;站内可读标题/简介,深入观看需打开原文,属已知限制 |
| `openai-cookbook` | openai-cookbook | developers.openai.com 为 Astro 站。站级 `/rss.xml` 混入 YouTube 与 platform.openai.com 文档链接,不适合做列表源;解析 `/cookbook` 列表行(`line-clamp-1` 标题 + `text-right` 日期),Featured 卡片与列表行重复时带日期版本优先,90 条全带日期。详情页服务端渲染全文(实测 5.6 万字符),Readability 正常 |
| `openai-news`(既有) | feed | RSS 复测正常(约 700KB 全量目录,`lastBuildDate` 当天);由 `enabled: false` 改为 `true`。详情页 SSR 全文在 ``,但多层 Tailwind 栅格会让 Readability 只抽导语;`extractOpenaiNewsBodyHtml` 走 article 定制抽取 |
尾斜杠陷阱(与 `anthropic` 同类,代理 rewrite 不跟随重定向,注册 URL 一律无尾斜杠):
`academy.claude.com/use-cases/` 307 → 无斜杠;`developers.openai.com/cookbook/` 308 → 无斜杠;
claude.com 两个路径带不带斜杠均 200。
### 7.2 taxonomy v3 分类与预设
- 五个新源与 `openai-news` 全部默认启用。
- `openai-news`、`anthropic`、`claude-blog` 与 Google AI / DeepMind 进入 `ai-labs`「模型厂商与实验室」。
- Hugging Face / PyTorch / Arena 进入 `ai-ecosystem`「开源生态与评测」,不再混入“实验室”。
- `openai-cookbook`、`claude-customers`、Claude Academy 用例/教程进入 `ai-practice`「产品实践」。
- 两类都只出现在 **AI 前沿** 预设;不再为 OpenAI / Claude 各建一级分类,从而保持“分类表达阅读任务、频道表达品牌”的信息架构。
验证:`npm run test:ai-firstparty`(注册 / 分类 / 分流 / 分页断言 + 三个解析器 fixture 与兜底路径),
`npm run test:high-signal`、`npm run test:layout-presets`、`npm run test:category-source-usage`。