Agent 做研究,先把“搜索”和“读取”分开

yichen-web-research把公开搜索、已知链接、授权收藏和音视频转写拆成独立路由,让研究过程更容易追踪、验证和收口。

AIAgent研究工作流

Agent 能打开网页,不代表它已经完成研究。真正容易出错的地方,是搜索、原文读取、下载、归档和转写经常被一个“万能工具”混在一起。yichen-web-research 选择了另一条路:先把研究任务分阶段,再让每个阶段使用自己的入口。

搜索结果只是候选

yichen-unified-search负责公开网页和平台发现,交接内容包括原始 URL、标题、来源平台、时间、后端和限制,而不是只有一串标题。候选清单的作用,是让研究者知道哪些内容只是线索,哪些内容已经被打开并核验。

这对写技术文章尤其重要。搜索摘要可以帮助定位 README、release、官方文档或项目主页,但不能自动升级成正文里的确定事实。只有经过确认的来源,才应该进入后续归档和引用。

已知链接不应触发开放式爬取

用户直接给出一个 GitHub、X 或公众号链接时,yichen-content-archive 只处理这个已知对象。它不会顺手浏览作者主页、相关推荐或相似内容。这样既控制范围,也避免一次简单读取变成不可预期的站点扩展。

授权边界要跟动作一起走

私人书签导出需要当前任务、平台和范围的明确授权,导出授权也不会自动变成媒体下载授权。微信桌面端和移动端 UI 不在操作范围内;验证码、登录墙、付费墙和限流也不会被绕过。缺少后端时,覆盖范围下降,但安全边界不应该放宽。

为什么需要总路由

顶层 yichen-web-research 只服务跨阶段任务,例如先发现项目,再确认官方资料,最后归档或转写。单纯搜索、读取单个已知 URL 或处理本地视频,都应直接进入对应子 Skill。总路由的价值不是增加一层形式,而是在多阶段任务中保存交接和停止条件。

验证规则也要能运行

仓库提供离线验证和只读 doctor,用来检查 Skill 家族是否完整、路由契约是否存在、搜索是否误触发归档、书签导出是否夹带下载行为,以及 ASR 是否会跨服务商重复提交。对 Agent 工具来说,这比在提示词里写一句“请注意安全”更可靠。

研究自动化真正成熟的标志,不是永远能返回结果,而是能清楚说明来源、核验状态、失败原因和未获授权的下一步。