高级用法
基础见快速开始。这里讲一些「再往下挖」的东西——数据、配置、自动化、边界。
数据都在哪
所有数据在 exe 同级的 readwithhotsoup/ 文件夹:
| 文件 | 是什么 |
|---|---|
rss.db | 主库(SQLite):Feeds / Items / Models / Vectors |
telemetry.db | 遥测独立库(默认关闭) |
ai_config.json | AI 配置(端点 / 模型 / 维度 / 阈值;API Key 不在文件里,在系统凭据库) |
sip_settings.json | 应用设置:报告间隔、高频源阈值、去重阈值 |
source_policy.json | Source Policy(你确认的处理规则) |
dedup.json | 跨源去重规则 |
article_signals.json | ♥ / 🤖 标记 |
reading_progress.json | 阅读进度 |
simon_events.json | 孟思琳事件记录(数据库修复 / 拦截 / 挡位变更,最近 200 条) |
fulltext/ | 全文抓取缓存 |
templates.json | Onboarding 推荐源模板 |
默认都是明文、开放格式,拷走整个
readwithhotsoup就是迁移;也随时能被其它工具读取。注意:孟思琳挡位 3 开启数据加密后,rss.db、fulltext/与dedup.json变为密文(见安全)。
让 Agent 调用 sip
sip 不止给人用,也给了 Agent 调用能力:任何 Agent 都能通过 CLI(配合 sip-rss skill)调用 sip,能力与 TUI 近乎一致。接入见 Bot 接入。
数据目录与迁移
- 单文件 exe 会在自己旁边自动创建
readwithhotsoup/。 - 迁移:把整个
readwithhotsoup/文件夹拷到新机器的 exe 旁即可。 - 换软件核心:因为是 SQLite + 明文 JSON 的标准格式,你可以随时用其它工具/程序读取这些数据,不会被锁死。
进阶配置项
ai_config.json 里可调:
Embedding.Model/Dimensions:向量化模型与维度(换模型后需sip --reindex)Embedding.SearchThreshold:默认语义搜索相似度阈值(本地 bge-m3 建议 0.5,云端 0.7)AllowPrivateNet:全文抓取是否放行内网地址(默认 false,SSRF 防护)
sip_settings.json 里可调:
insightsInterval:阅读报告提醒间隔(7d/30d/off)floodThresholdPerDay:今日高频源阈值(默认自动)dedupThreshold:跨源去重段落重合度阈值(默认 0.8)
命令行进阶
bash
sip --today --json # 结构化今日清单
sip --insights --window 7d # 近 7 天阅读报告
sip --dedup scan # 跨源重复簇
sip --policy set 3 tag important # 给源 3 打标签
sip --onboarding add AI all # 一键加 AI 类推荐源性能与极限
--today/--dedup用「段落倒排索引 + 重复簇」,大批量也不爆输出。- 并发读 / 写 / 混合均安全,WAL 崩溃可自愈。
- 大库常规操作秒级(百万级适配:FTS5 全文搜索 ~0.5s、TUI 侧栏懒加载,见功能总览 · 百万级性能);全文抓取有 25s 超时。