全文抓取
RSS 摘要过短(<100 字符)时,可抓取原文到本地缓存:
bash
sip --fulltext <编号> # 抓取全文(首次需输入同意短语;--yes 跳过同意/确认)
sip --fulltext <编号> --json # 结构化输出 {itemId, cached, content}
sip --purge-fulltext [编号] # 清缓存(不传编号 = 全清)- 全文存
readwithhotsoup/fulltext/<itemId>.md(文件缓存,不改数据库);该源已索引时,全文向量存vecs.json并并入语义搜索;--index/--reindex会自动给已有全文缓存的文章回补全文向量(先抓全文后索引也不再漏) - Content 永远是主内容,全文只做补充;显示时原文在上、全文在下,中间分界
- 抓取不产生新版本、不参与 diff/更新
- 抓取安全边界(SSRF 防护):只允许 http/https 链接;回环(127.0.0.1/::1)与链路本地/云元数据地址(169.254.0.0/16)一律拒绝;私网段(10/8、172.16/12、192.168/16、100.64/10)默认拒绝——确需抓取内网源时,在
ai_config.json设"allowPrivateNet": true放行 sip --show <编号> --json在已有全文缓存时输出fulltext字段(AI/脚本读全文无需先跑--fulltext再单独读文件)