BabataBot Inslight · 行业情报雷达与自进化认知知识库
一句话量级
人一天能认真读 20 篇。这条管线一天筛 500 篇,只把 8 分以上的 5–10 条放到你桌上——时间从「筛」变成「判断」,而每条入库成本是千分之几美元。
20 篇 = 一个人一天「认真读」的量级(深度阅读经验基线)。500 篇/天 = 按管线节拍设计的日吞吐上限,不是实测。8 分以上才推 = 打分阈值路由,落到桌上通常 5–10 条。千分之几美元 = 模型单价 × 平均 token ÷ 条数(本地部署 Qwen2.5-7B,只算电费 + GPU 折旧)。
你买的到底是什么
你买的不是又一个订阅阅读器,是一条自己会跑的管线:Producer 抓取清洗、Consumer 独立消费、Dify 冷酷打分——早上打开看板,看到的是当天 8 分以上的那几条,而不是 200 条未读。信噪比由架构决定,不是由关键词决定。
它替代的是什么
- 早上 8:40,行业情报群又刷出几百条链接。你从第 1 篇点起,一路点到第 47 篇才发现是标题党;真正讲清底层逻辑的那篇,下午 3 点才被你翻到——它一直都在,只是排在后面。高管每天固定 3–4 小时在做「泛读+筛选+打标」(作者自测 n=1,口径=泛读+筛选+打标),这不是顺手看看,是每天一笔固定支出。
- 人一天能认真读完的约 20 篇(深度阅读经验基线)。信源翻十倍,你的阅读量不会翻十倍——筛不完的那部分,就是你漏掉的机会成本。
- 抓取 → 分析 → 入库挤在一条单线流里:任一长文解析超时即拖垮整条链路,没有异步削峰,也没有独立消费节奏。打分还依赖固化 Prompt,好文章的标准写死在提示词里,不随行业认知演化。不是模型不够强,是管线没解耦、评判基准不可演化。
架构
四段自左到右:Producer 抓取清洗 → PostgreSQL 缓冲池 → Consumer / Agent A 打分 → Action 阈值路由,底部虚线标注状态迁移 pending → scored → routed。图上必须画出两个结构,不是旁注:人工复核死信队列(模型判不动的东西不会静默消失),以及从 Action 回到 Dify 向量知识库的反哺闭环(成为下一轮打分基准)。
防护栏
- 大模型幻觉剥离——路由代码节点先用正则剥掉模型输出外层 Markdown 的 json 外套与反引号,再 trim,然后才解析。模型爱穿外套,管线不认它。
- 不断带降级——JSON 解析发生致命错误时不抛错中断,而是给默认分并标注「JSON 解析失败,进入默认通道」,让数据流继续流转;这类件同时落人工复核死信队列,不静默消失。
- SSOT 全局配置流——核心鉴权 Token(如 dify_feed_token)与模型参数收拢在独立的全局配置流 Get Master Config (SSOT) 中,所有 Consumer 节点热读取;轮换密钥、调整参数不动工作流,也不重新部署。
- 基于 content_id 的 Hash Upsert——Producer 用 crypto.createHash("sha256") 对源 URL 生成 content_id 作主键,写入依托 n8n 的 Auto-Map Upsert,摒弃脆弱的「先查重再写入」双步操作;并发压力下关系库依然保持唯一性与干净度。
- 异步削峰是结构,不是补丁——Producer 只管抓取+清洗+入库,Consumer 独立轮询消费,两者通过 PostgreSQL 缓冲池解耦;长文解析超时只影响单条消费,不拖垮抓取侧。
- Epsilon-Greedy 探索-利用路由——高分直入核心看板,3–6 分区间保留一个随机探索窗口(is_exploration: true),用可控的随机打破信息茧房,而不是把阈值调死。
- 知识库反哺闭环——8 分以上的内容自动向量化、经 Webhook 写回 Dify 向量知识库,成为下一轮打分的判断基准;评判标准随行业认知一起长,而不是写死在提示词里。
你最终拿到手的东西
- 分布式解耦自动化蓝图——可一键部署至企业内网的 n8n 工作流 DSL 文件(独立 Producer 抓取流 + Consumer 批处理流)。
- Dify 认知智能体架构配置——冷酷人格 System Prompt、结构化输出 Schema、挂载知识库的 RAG 编排配置。
- 关系型数据库与向量引擎配置——PostgreSQL feed_items / rss_sources 状态迁移建表语句,及对应的向量持久化 Schema。
标准模块化部署 2 至 3 周,按「信源矩阵梳理 → 异步队列解耦 → RAG 回写链路打通」推进。这是排期估算,不是合同承诺。
技术栈
- 编排层
- n8n — Schedule Trigger · HTTP Request · a heavy JS code node for regex stripping and fallback handling
- 数据层
- PostgreSQL buffer pool and state base (feed_items / rss_sources) · crypto.createHash("sha256") over the source URL yields the content_id primary key · writes through Auto-Map Upsert
- 认知与知识层
- Dify · Qwen2.5-7B deployed locally (API compatible), so marginal cost per item is electricity plus GPU depreciation (= model unit price × average tokens ÷ items) · vector knowledge base on Qdrant
数字,以及它的算式
- 人工筛选 3–4 小时/天
- 作者自测 n=1(口径=泛读+筛选+打标)。这是人工基线,不是客户实测。这是一个高管每天的固定支出;自动化后这段时间从「筛」转为「判断」。
- 人一天深度读 20 篇
- 深度阅读经验基线(外部量级,非我方实测)。对照系统 500 篇/天的设计容量,输入侧高一个量级。
- 系统 500 篇/天 —— 设计容量
- 设计容量,不是实测——按管线节拍设计的日吞吐上限。人一天深读 20 篇;瓶颈是服务器,不是人。
- 单条入库边际成本 千分之几美元
- 算式:模型单价 × 平均 token ÷ 条数(本地部署 Qwen2.5-7B → 电费 + GPU 折旧);具体金额以你的账单为准。对比人工读一条的时间成本。
- 8 分以上才推送(落到桌上通常 5–10 条)
- 打分阈值路由:≥8 分进推送队列,低于阈值进人工复核队列。你的注意力从「筛」变成「判断」。
同一个形状,另外三个问题
如果你的事不是上面那个场景,这一段才是重点:同一套架构指向三个互不相关的场景,都不是上一个案例的变体,也不需要从零重建。这些是**可平移的方向,不是已交付的项目**——上面那套系统是我们真跑过的,下面这三条是它的形状接下来能解决什么。这个区别我们标出来,不含糊过去。
一级市场投资标的扫描
监控赛道内初创公司的 PR 稿、招聘变动与专利申请,按机构内部投资逻辑库打分,只把具备护城河与融资信号的项目推到合伙人桌面;验证过的判断逻辑写回知识库。
高频 B2B 客户全网声量监控
抓取竞对与自身在平台、论坛的长尾 Review,剔除无意义的刷单评论,提纯「产品材质缺陷」「特定国家物流痛点」,自动生成研发迭代看板。
企业级法务与政策合规雷达
抓取多国监管机构的政策文件,比对企业的业务红线,只把可能触发罚款的合规变动提纯为三句人话,推送至法务负责人。
有系统要做?
把情况写下来。你拿到的是针对你情况的书面回复——没有日历、没有 discovery call、没有十五分钟的寒暄。
状态
自研系统。这是我们给自己造的能力——不是客户案例,也不是客户交付,没有任何外部组织在用它。它证明了我们「给自己造工具」的能力。它在我们自己的环境里运行中。
自研系统,在我们自己的环境里运行。