Skip to content

全文抓取

RSS 摘要过短(<100 字符)时,可抓取原文到本地缓存:

bash
sip --fulltext <>            # 抓取全文(首次需输入同意短语;--yes 跳过同意/确认)
sip --fulltext <> --json     # 结构化输出 {itemId, cached, content}
sip --purge-fulltext [编号]      # 清缓存(不传编号 = 全清)
  • 全文存 readwithhotsoup/fulltext/<itemId>.md(文件缓存,不改数据库);该源已索引时,全文向量存 vecs.json 并并入语义搜索;--index/--reindex 会自动给已有全文缓存的文章回补全文向量(先抓全文后索引也不再漏)
  • Content 永远是主内容,全文只做补充;显示时原文在上、全文在下,中间分界
  • 抓取不产生新版本、不参与 diff/更新
  • 抓取安全边界(SSRF 防护):只允许 http/https 链接;回环(127.0.0.1/::1)与链路本地/云元数据地址(169.254.0.0/16)一律拒绝;私网段(10/8、172.16/12、192.168/16、100.64/10)默认拒绝——确需抓取内网源时,在 ai_config.json"allowPrivateNet": true 放行
  • sip --show <编号> --json 在已有全文缓存时输出 fulltext 字段(AI/脚本读全文无需先跑 --fulltext 再单独读文件)
最近更新

遵循 GNU General Public License v3.0 (GPL-3.0)