十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

为什么claude-video只传音频不传视频?揭秘隐私与成本的权衡设计

为什么claude-video只传音频不传视频?揭秘隐私与成本的权衡设计 为什么claude-video只传音频不传视频揭秘隐私与成本的权衡设计【免费下载链接】claude-videoGive Claude the ability to watch any video. /watch downloads, extracts frames, transcribes, hands it all to Claude.项目地址: https://gitcode.com/GitHub_Trending/cl/claude-videoclaude-video 是一款让 Claude 拥有看视频能力的视频技能Skill。通过内置的/watch命令它会自动下载视频、抽取关键帧、生成带时间戳的转录文本再交给 Claude 回答你的问题。不少用户会好奇既然要转录语音为什么 claude-video 只把音频传给 Whisper API而不把整个视频文件上传这背后是隐私保护与调用成本的一次经典权衡设计。先搞懂claude-video 是怎么看视频的要理解为什么只传音频先看它的完整工作流。整个管线分为五步其中绝大部分都在你的本机完成步骤在哪里执行说明① 下载视频本机yt-dlp下载到临时工作目录本地文件则跳过② 抽取关键帧本机ffmpeg按时长大小自适应的帧预算抽 JPEG③ 获取转录本机 / 云端优先用平台原生字幕免费没有时才提取音频调 Whisper④ 喂给 Claude本机上下文帧图像 时间戳文本一起进入 Claude 的上下文⑤ 清理本机工作目录用完即删关键点在于真正看到画面的是 Claude 本体——它通过 Read 工具直接读取本地抽出的 JPEG 帧而真正需要听的部分只需要音频轨道。两条通道各司其职视频文件从头到尾都不需要离开你的机器。核心编排逻辑见入口脚本 scripts/watch.py只有当字幕缺失、且未禁用 Whisper 时才会进入提取音频 → 上传转录的分支。唯一出网的数据一段压缩过的音频当视频没有字幕轨道时本地录屏、部分 TikTok / Vimeo / YouTube 视频claude-video 会执行一次非常瘦身的音频提取。看 scripts/whisper.py 中extract_audio的实现参数是精心计算过的单声道-ac 1人声转录不需要立体声16 kHz 采样率-ar 16000语音识别的够用标准64 kbps MP3-b:a 64k有损但极小最终得到的是一段每分钟仅约 480 KB的音频文件它才是唯一可能被上传的内容。上传目标按优先级为Groq 的whisper-large-v3更便宜更快优先→ OpenAI 的whisper-1兜底由 scripts/whisper.py 中定义的两个端点决定。SKILL.md 的Security Permissions一节把这个边界写得非常明确见 SKILL.mdDoes not upload the video itself to any API — only the extracted audio goes out, and only when native captions are missing.不会把视频本身上传到任何 API——只有提取出的音频会出网且仅在原生字幕缺失时。为什么不能直接上传整个视频这里有三层原因一层比一层硬。1️⃣ 上传限制视频根本传不动Whisper 系列 API 有25 MB 的上传上限。而 claude-video 提取出的音频是 64 kbps每分钟约 0.5 MB25 MB 大约能装下50 分钟的语音——这是项目 README 中写明的容量设计。反过来算一笔账一段 1080p 的 10 分钟视频通常在 100 MB 以上秒超上限。也就是说上传整段视频这条路在 API 层面物理上就走不通。2️⃣ 能力边界Whisper 本来就只听不看Whisper 是纯语音识别ASR模型它的输入就是音频流。画面信息对它而言毫无意义——claude-video 需要的是每一句说了什么 时间点一段压缩音频已完整包含这些信息。把几 GB 的视频送过去得到的转录结果和送 10 MB 音频完全一样纯属浪费。3️⃣ 成本音频比视频便宜好几个量级转录费用按音频时长计费。每分钟 480 KB 的单声道 MP3与上传 100 MB 的高清视频相比传输时间、带宽成本、API 计费都低得多。这也是 claude-video 默认优先使用免费原生字幕的原因绝大多数公开视频有字幕轨道时一次云端 API 调用都不需要。隐私设计最小化数据出网把上面的机制串起来claude-video 的隐私边界可以总结成一张出网清单数据类型是否出网目的地视频文件本体❌ 永不出网—始终留在本机临时目录抽取的 JPEG 帧❌ 不出网由 Claude 在本地上下文读取压缩音频片段⚠️ 条件出网仅在无字幕时 → Groq 或 OpenAI平台请求下载⚠️ 直连源站由yt-dlp直接请求视频所在主机配套的细节还包括SKILL.md不登录任何平台无账号、无 Cookie、不发帖公共 URL 和本地文件是全部输入API 密钥隔离Groq 密钥只发往api.groq.comOpenAI 密钥只发往api.openai.com互不串用密钥不落日志不写入 stdout / stderr / 任何输出文件不持久化除工作目录和~/.config/watch/.env权限 0600外不留痕迹换句话说claude-video 遵循的是最小必要数据外发原则——能让本机做的绝不出网必须出网的只出最瘦的那份数据。用户能如何控制这条边界claude-video 把选择权完全留给了用户参见 scripts/watch.py 的参数定义--no-whisper彻底禁用 Whisper 兜底。无字幕的视频将只返回画面帧零云端上传--whisper groq/--whisper openai强制指定转录服务商避免意外调用非预期端点--start/--end只截取视频片段处理进一步缩小出网数据的范围对隐私敏感的场景比如处理内部录屏推荐组合是本地文件 --no-whisper整个流程完全不产生任何第三方 API 调用。小结一次教科书级的权衡回到标题的问题——claude-video 只传音频不传视频不是偷懒而是三个约束共同作用下的最优解API 限制25 MB 上传上限决定了传视频不可行能力匹配Whisper 只需要音频画面由 Claude 本地读帧承担隐私与成本64 kbps 单声道音频是信息量与数据量的最佳平衡点这个设计给所有做多模态 AI 工具的朋友一个启发在数据出网之前先做一次瘦身能本地处理的内容绝不交给云端——既省了钱也守住了用户的隐私底线。如果你对具体实现感兴趣可以深入阅读项目文档 SKILL.md 了解完整技能契约或查看版本历史 CHANGELOG.md。【免费下载链接】claude-videoGive Claude the ability to watch any video. /watch downloads, extracts frames, transcribes, hands it all to Claude.项目地址: https://gitcode.com/GitHub_Trending/cl/claude-video创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表