十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

claude-obsidian defuddle 技能实战:把网页变成干净可读的 Markdown

claude-obsidian defuddle 技能实战:把网页变成干净可读的 Markdown claude-obsidian defuddle 技能实战把网页变成干净可读的 Markdown【免费下载链接】claude-obsidianSelf-organizing AI second brain for Obsidian Claude Code. Drop any source and Claude reads, links, and files it into one connected knowledge graph of plain Markdown you own. AI note-taking, personal knowledge management (PKM), and an open-source Notion alternative. Based on Karpathys LLM Wiki pattern.项目地址: https://gitcode.com/GitHub_Trending/cl/claude-obsidianclaude-obsidian 是一款运行在 Obsidian Claude Code 上的开源本地 AI 第二大脑能把各种来源整理成互相链接的 Markdown 知识库。它的defuddle 技能专门负责网页清洗给一个 HTTPS 链接就能把导航栏、广告、侧边栏统统剥掉只留下正文输出干净可读的 Markdown为后续入库存档做好准备。本文带你实战走一遍这条网页 → 干净 Markdown → 知识库的完整链路。 为什么网页需要先清洗直接在剪贴板里复制网页通常会混进导航菜单、推荐位、评论区等大量噪音。把这种脏文本喂给 AI 做笔记结果往往是重点被稀释、token 被浪费。defuddle 的定位就是一个可选的外部网页提取器extractor只接受 HTTPS 链接作为输入提取文章型正文标题、段落、链接、代码块、表格、引用都会保留输出标准 Markdown可直接阅读也可直接作为知识库来源项目里对它的定义写得很清楚清洗clean、原始捕获raw capture、wiki 入库ingest是三个互相独立的操作defuddle 只负责第一步。技能说明位于 skills/defuddle/SKILL.md核心命令入口在 scripts/claude-obsidian.py。 快速上手3 步把网页变成 Markdown第 1 步克隆项目并初始化 vaultgit clone https://gitcode.com/GitHub_Trending/cl/claude-obsidian cd claude-obsidian仓库本身就是产品不是你的知识 vault。初始化一个独立 vault 的完整流程见 docs/install-guide.md。第 2 步先生成无害预览计划python3 scripts/claude-obsidian.py capture external-plan url https://example.com/article这条命令只做 URL 校验不发出任何网络请求。它会告诉你规范化后的主机名、网络出口策略、重定向策略以及execute: false状态——先看清计划再决定要不要执行这是 claude-obsidian 一贯的预览优先设计。第 3 步确认授权后执行清洗检查清洗器是否可用python3 scripts/claude-obsidian.py contracts --verify --capability defuddle --vault VAULT得到available表示没找到可执行文件应停在预览阶段configured表示已找到但需要你人工审查其来源和版本后再运行。确认网络授权后实际执行的等价命令是defuddle parse HTTPS_URL --md清洗结果会先以临时草稿形式呈现你可以先预览、确认提取质量再决定去留。如果退出码非零、输出为空或返回的是登录页/错误页流程会直接失败关闭绝不会被当成正文。 安全设计网络访问必须先授权网页内容属于不可信数据defuddle 内置了一套安全契约对新手非常友好安全规则说明仅限 HTTPS拒绝带凭据、锚点、内网/本地主机、控制字符的 URL显式同意网络请求必须在你当前请求中明确授权不会偷偷联网重定向受限跳转到新域名视为拒绝除非你显式批准该域名不伪造结果没有清洗就不声称已清洗不承诺固定的压缩比例简单说它什么时候联网、把什么发出去你始终有决定权。细节可参考 config/capabilities.json 中对 defuddle 能力边界的声明。 清洗之后从干净 Markdown 到知识图谱defuddle 只管清洗不自动创建 wiki 页面。当你想让清洗结果沉淀进知识库时原始捕获对清洗后的字节计算 SHA-256以内容寻址方式存入.raw/captured/sha256.md同内容绝不覆盖天然去重且不可变wiki 入库单独调用 wiki-ingest 技能见 skills/wiki-ingest/SKILL.md把捕获的来源变成带引用、带溯源链接的 wiki 页面。这样每一篇笔记都能回溯到哪个网页、哪天抓的、哪个版本知识是有据可查的而不是 AI 的复述。 常见问题与实用建议Q找不到 defuddle 可执行文件怎么办项目会给出诚实的降级方案自己安装/配置外部清洗器、把本地 HTML 或 Markdown 放进inbox/目录、或先把 URL 挂起稍后处理——而不会假装完成了清洗。Q只想快速读一篇文章不想入库完全可行。清洗结果保持临时状态读完即弃vault 不会被污染。Q清洗质量如何保证保留原始措辞与结构不发明缺失内容提取有限时如页面强依赖 JS会如实报告。小结defuddle 技能解决的是 AI 笔记流程的第一道关卡把网页变成干净的 Markdown。它的三步链路——预览计划 → 授权执行 → 独立入库——把安全、可控、可溯源做成了默认行为。配合 claude-obsidian 的 wiki-ingest 与检索技能你获得的不仅是一篇干净文章而是一张持续生长的个人知识图谱。【免费下载链接】claude-obsidianSelf-organizing AI second brain for Obsidian Claude Code. Drop any source and Claude reads, links, and files it into one connected knowledge graph of plain Markdown you own. AI note-taking, personal knowledge management (PKM), and an open-source Notion alternative. Based on Karpathys LLM Wiki pattern.项目地址: https://gitcode.com/GitHub_Trending/cl/claude-obsidian创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表