十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

Hyperresearch OA全文恢复:Unpaywall→Europe PMC→CORE三级回退链完整指南

Hyperresearch OA全文恢复:Unpaywall→Europe PMC→CORE三级回退链完整指南 Hyperresearch OA全文恢复Unpaywall→Europe PMC→CORE三级回退链完整指南【免费下载链接】hyperresearchAgent-driven research knowledge base. Agents collect, search, and synthesize web research into a persistent, searchable wiki.项目地址: https://gitcode.com/GitHub_Trending/hy/hyperresearchHyperresearch是一个 Agent 驱动的研究知识库AI Agent 负责收集、检索并综合网络研究沉淀为持久可搜索的 wiki。它的 **OA 恢复Open Access 全文恢复**功能专门解决一个研究场景中的经典痛点——付费墙。当抓取论文只拿到 1~3k 字符的摘要时Hyperresearch 会按Unpaywall → Europe PMC → CORE的顺序自动查询三个免费 API找到合法的开放获取全文并替换进笔记如果源站直接 403 或人机验证它还能抢救出整篇论文。整个三级回退链零依赖本地网络代理开箱即覆盖生物医学文献。为什么付费墙论文需要 OA 恢复想象一下报告引用了一篇付费论文但 Agent 实际只读了摘要——这就像引用了却没读过。Hyperresearch 用一句诚实的话描述了这个问题一篇付费论文否则会作为摘要进入知识库而报告却像完整读过论文一样引用它。OA 恢复功能就诞生于此给一个 DOI向三个免费 API 询问是否存在合法的开放获取副本有则重新抓取全文存入笔记。全文质量的提升也反映在产出上在 DeepResearch-Bench RACE 榜单上hyperresearch 以 57.8 分领先见 README.md。三级回退链谁先谁后为什么是这个顺序核心逻辑在 oa.py 的iter_oa_candidates中实现它不是问到一家就停而是产出一个按质量排序的候选副本列表逐份尝试默认最多 3 次oa_max_attempts。第一级Unpaywall——覆盖面最广但需要邮箱覆盖面最广的 OA 元数据 API会给每个副本标注版本正式版 / 接收稿 / 预印本和许可证按使用条款必须提供真实联系邮箱contact_email默认留空 自动跳过——因为共享占位符会被集体限流候选排序先所有 PDF 链接、再落地页同分优先publishedVersion版本正式版第二级Europe PMC——零配置生物医学专属无需 API Key、无需邮箱开箱即用但只覆盖生物医学领域全文以JATS XML结构化格式返回/fullTextXML接口自带真实章节边界解析效果优于双栏 PDF 的文本抽取——无页眉串扰、无栏序错乱只服务版本正式版因此它的结果版本最可信惰性解析只有 Unpaywall 的副本全部用尽后才会发起这次 API 调用第三级CORE——最大的 OA 聚合器直接托管全文覆盖机构仓储中的海量论文是生物医学之外的大网与前两级最大的不同CORE 直接托管正文fullText字段就是论文本身而不是指向一个可能 403 的第三方仓储需要环境变量CORE_API_KEY没有就静默跳过版本无法确定时诚实记录为未知版本并在笔记中提醒读者核对引文完整解析链与候选排序逻辑可参见 oa.pyCORE 接口的适配层在 core_oa.py。两种触发场景替换 vs 抢救OA 恢复有两个入口对应两种受伤程度接线点在 fetch.py 与 fetch_batch.py场景函数说明抓到了薄页面摘要/付费墙插页recover_full_text用更长的 OA 全文替换笔记正文源站完全不可读403、登录墙、人机验证rescue_full_text整篇笔记由 OA 副本抢救而成第二个场景更极端笔记里的标题、作者、正文全部来自 OA 副本没有任何一个字节来自原始 URL。Hyperresearch 会在 frontmatter 中打上oa_recovery_kind: rescued标记让这种差异能被note show识别。两条铁律永不降质、必有披露️恢复永远不会让笔记变差候选副本必须同时跨过两道门槛——比已有的文本更长宁要摘要不要烂 PDF且长度达到oa_min_full_text_chars默认 6000 字符防止仓储记录页冒充全文。所有错误路径都静默降级恢复失败绝不会拖垮一次正常的抓取。替换必然被披露来自哪里的正文必须在四处说清楚——笔记正文顶部的醒目横幅写明真实来源 URL 和版本frontmatter 的oa_url/oa_source/oa_version/oa_recovery_kind字段hpr note show id --json中的oa块hpr fetch/hpr fetch-batch的命令行输出另外所有由第三方 API 返回的 URL 都会先经过 SSRF 安全检查check_oa_url防止被污染的 DOI 记录把抓取器指向内网。快速上手30 秒启用 OA 恢复克隆仓库git clone https://gitcode.com/GitHub_Trending/hy/hyperresearch默认配置下contact_email为空只有 Europe PMC 在工作覆盖生物医学。想让三级链全部生效只需两步在.hyperresearch/config.toml的[scholar]段填入真实邮箱设置环境变量CORE_API_KEY相关配置项一览定义在 config.py[scholar] oa_recovery true # 总开关 contact_email # Unpaywall 必需空则跳过 oa_min_full_text_chars 6000 # 低于此长度视为薄页面 oa_prefer_published true # 优先版本正式版而非预印本 oa_max_attempts 3 # 最多尝试几个候选副本 oa_rescue_blocked true # 源站完全不可读时是否抢救零配置 → 生物医学加上邮箱 → Unpaywall 全域再加 Key → CORE 机构仓储。降级干净逐级加宽覆盖面。延伸阅读核心模块src/hyperresearch/core/oa.py配置定义src/hyperresearch/core/config.py功能说明README.md回归测试tests/test_core/test_oa_recovery.py、tests/test_core/test_oa_core_resolver.py发布记录CHANGELOG.md一句话总结Unpaywall 给广度、Europe PMC 给零配置的生物医学保底、CORE 给机构仓储的最后一张网——三级回退让付费论文被读完而不是被略过而且每一次替换都留有完整证据链。【免费下载链接】hyperresearchAgent-driven research knowledge base. Agents collect, search, and synthesize web research into a persistent, searchable wiki.项目地址: https://gitcode.com/GitHub_Trending/hy/hyperresearch创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表