十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

Anarlog 1.4.22 版本全解析:离线同步增强、Google Cloud 长录音转录与桌面导航体验升级

Anarlog 1.4.22 版本全解析:离线同步增强、Google Cloud 长录音转录与桌面导航体验升级 Anarlog 1.4.22 版本全解析离线同步增强、Google Cloud 长录音转录与桌面导航体验升级【免费下载链接】anarlogOpen source Granola AI Alternative项目地址: https://gitcode.com/GitHub_Trending/hy/anarlog导读本文基于 Anarlog 开源仓库的 1.4.22 版本发布说明系统拆解本次更新的两大主题同步与转录离线编辑保留、Google Cloud Speech-to-Text 长录音转录、自定义 Deepgram 兼容端点、设备槽位可视化以及导航与设置Windows 标题栏快捷入口、非拉丁字符标题适配、设置项归类与提供商能力标识。通过对照仓库中的 Rust 源码与前端实现帮助开发者理解每项改进的底层机制、配置方式和适用场景。版本概览1.4.22 是 Anarlog开源 Granola 替代方案的一次功能迭代版本发布说明将更新划分为同步与转录与导航与设置两大板块。整体上本次更新强化了离线工作流的数据一致性、扩大了云端转录的音频时长支持并对桌面端的导航入口与设置结构做了精细化调整。date: 2026-09-07 summary: Anarlog 1.4.22 improves offline sync, supports longer Google Cloud recordings, and refines Windows navigation and provider settings.同步与转录重连时保留离线编辑同步笔记渐进式加载1.4.22 对同步体验做了两项关键改进重连时保留离线编辑当设备断网后重新连接时此前在离线状态下对笔记做出的修改不再丢失而是被完整保留并合并回同步状态。这意味着移动办公、飞行模式等弱网场景下你可以放心编辑笔记重连后由 Anarlog 负责将本地变更与云端数据对齐。同步笔记渐进式加载同步回来的笔记不再一次性全部拉取阻塞界面而是按需、分批渐进加载降低了大笔记库首次同步时的内存与渲染压力提升打开应用后的响应速度。从仓库结构看离线编辑与重连合并逻辑由 crates/db-core/src/cloudsync 下的同步运行时runtime与操作层ops承载其中 payload.rs、transport.rs 等模块分别负责变更负载的构造与传输runtime/background.rs 则处理后台同步任务的调度配套测试位于 runtime/tests 下覆盖了生命周期、编排与结果状态等场景。Google Cloud Speech-to-Text 支持更长录音1.4.22 允许使用 Google Cloud Speech-to-Text 转录更长的录音核心突破在于对 Google Cloud同步synchronous转录接口限制的规避。底层限制与分片策略Google Cloud 同步转录接口对单次请求有明确约束内联音频不超过 10 MB 且时长约一分钟。如果直接把整段会议录音提交上去会被接口拒绝。仓库在 crates/listener2-core/src/batch/simple/google_cloud.rs 中实现了专门的分片转录流程关键设计如下// Stay below the synchronous APIs 60-second limit. Mono 16 kHz PCM segments // also fit comfortably within the 10 MB request limit after base64 encoding. const SEGMENT_DURATION: Duration Duration::from_secs(55);将原始录音按55 秒一段切分为 60 秒上限预留缓冲每段被重采样为单声道 16 kHz、16 位 PCM WAVTARGET_SAMPLE_RATE并注释说明 PCM WAV 在 Google 稳定版 v1 端点上的兼容性优于共享的 MP3 切分方案采用有界分块解码/重采样for_each_resampled_channel_block避免将整场会议一次性读入内存每段单独提交转录后再调用merge_segment_responses合并结果并修正各分段时间戳保持说话人标签与声道信息的连续。对应的测试用例同一文件的mod tests部分验证了 125 秒的双声道录音会被切成 555515 秒三段、每段大小低于 10 MB合并后第 2 声道能还原出 0.25s、55.25s、110.25s 的时间戳序列且任一 55 秒段失败时整场会议直接失败、不返回部分转录结果。请求参数与适配器实现单段请求由 crates/owhisper-client/src/adapter/google_cloud/mod.rs 中的GoogleCloudAdapter完成请求端点默认https://speech.googleapis.com/v1附加路径speech:recognize模型默认latest_long长录音模型配置中开启enableAutomaticPunctuation、enableWordTimeOffsets、enableWordConfidence当提供说话人数量参数时写入diarizationConfig启用说话人分离提供关键词时写入speechContexts短语提示认证方式为Authorization: Bearer access_token对应环境变量为GOOGLE_CLOUD_ACCESS_TOKEN见 crates/owhisper-client/src/providers.rs 的env_key_name定义响应解析支持channelTag多声道、speakerTag说话人标签与startTime/endTime时间戳测试覆盖了 0.1s 时间偏移与声道索引转换的正确性。桌面端在 apps/desktop/src/settings/ai/stt/shared.tsx 中将该提供商注册为google_cloud显示名 Google Cloud Speech-to-Text默认模型latest_long并标记为After recording录制后转录提供商。录制后使用自定义 Deepgram 兼容端点转录1.4.22 支持在转录设置中配置自定义 Deepgram 兼容端点让使用自建网关或兼容服务的用户也能复用 Deepgram 通道。从实现看crates/owhisper-client/src/adapter/deepgram_compat/mod.rs 提供了端点 URL 构造逻辑pub fn listen_endpoint_url(api_base: str) - (url::Url, Vec(String, String)) { // api_base 解析失败时回退到 https://api.deepgram.com/v1 // 自动追加 /listen 路径并保留原有查询参数 }关键行为配置的api_base若无法解析为合法 URL会回退到 Deepgram 官方默认地址https://api.deepgram.com/v1见 providers.rs 的default_api_baseURL 会自动补全/listen路径且不会重复追加已有/listen时保持原样已有的查询参数如providerdeepgram会被保留并合并进最终请求批量转录默认使用nova-3模型并开启diarize、punctuate、smart_format、utterances、numerals等参数同时关闭profanity_filter等非必要选项认证沿用 Deepgram 的Authorization: Token api_key头部格式对应环境变量DEEPGRAM_API_KEY。配套测试同一文件的mod tests验证了https://api.deepgram.com/v1→/v1/listen的路径追加、查询参数保留、尾部斜杠与重复 listen 的去重以及非法 base 的回退行为。Sync 设置中的设备槽位可视化1.4.22 在 Sync 设置中新增了设备槽位device slots使用情况的展示用户可以直接看到已使用与可用的设备数量当套餐配额达到上限时会给出更清晰、更明确的提示消息避免用户在不明原因的情况下无法继续添加设备或同步数据。导航与设置Windows 标题栏集成搜索、新建笔记与笔记筛选1.4.22 将常用操作入口搬进了 Windows 的标题栏搜索、新建笔记、笔记筛选均可在标题栏直接访问减少鼠标在窗口内的移动路径。仓库中对应组件与测试位于 apps/desktop/src/main/windows-title-bar.test.tsx测试断言标题栏渲染了侧边栏与应用菜单并验证了从标题栏切换时间线分组Sort notes 按钮的交互流程说明该标题栏是一个可拖拽区域内的应用壳层shell frame承载了应用级菜单与笔记操作。笔记标题按实际文本自适应尺寸针对包含非拉丁字符如中文、日文、韩文等的笔记标题1.4.22 修复了标题尺寸计算问题使标题框宽度与实际可见文本匹配避免长标题被截断或溢出。大纲图标与设置项归类大纲图标更一致文档大纲outline中的图标风格与语义得到统一视觉上更易辨识层级与条目类型转录与智能设置区分更清晰设置页面中对转录transcription与智能intelligence相关配置做了更明确的分组与表述避免用户混淆两类功能如录音转录引擎 vs. 摘要、纪要等智能处理能力。识别录制后转录提供商BYO-model 集中管理本地模型文件1.4.22 在提供商列表中加入了转录时机的显式标识标注哪些提供商是在录音结束后才执行转录After recording方便用户理解实时转录与事后转录的差异。在 apps/desktop/src/settings/ai/stt/shared.tsx 中可以看到openrouter、zai、siliconflow、groq、together、speechmatics、azure_speech、google_cloud、revai、pyannote等提供商均带有badge: After recording标记。同时本地模型文件被统一收纳到BYO-modelBring Your Own Model条目下该条目在源码中对应id: local_file、模型标识local-file显示为 whisper.cpp .bin标注为On device本机设备端让自带模型文件的用户能够集中找到并管理本地模型资源。小结与升级建议Anarlog 1.4.22 是一次以离线可靠性与转录能力扩展为主线的更新离线编辑在重连后得到保留、同步笔记渐进加载Google Cloud 转录通过 55 秒 PCM 分片突破了同步接口的时长限制自定义 Deepgram 兼容端点让自建网关成为可能Sync 设置中的设备槽位信息则让配额使用一目了然。在桌面端Windows 标题栏承载了搜索/新建/筛选入口转录与智能设置、After recording 标识与 BYO-model 归类的调整也让整体导航与配置结构更加清晰。对于开发者与自托管用户建议重点关注以下几点若使用 Google Cloud 转录确认已正确配置GOOGLE_CLOUD_ACCESS_TOKEN环境变量并可参考 google_cloud.rs 的分片合并实现理解长录音转录的时间戳行为若接入 Deepgram 兼容网关可利用自定义端点配置并参照 deepgram_compat/mod.rs 了解/listen路径与查询参数的拼接规则在弱网场景下放心编辑笔记重连后的变更合并与渐进式加载由 crates/db-core/src/cloudsync 同步运行时保障。参考文件版本发布说明packages/changelog/content/1.4.22.mdGoogle Cloud 长录音分片转录实现与测试crates/listener2-core/src/batch/simple/google_cloud.rsGoogle Cloud 转录适配器crates/owhisper-client/src/adapter/google_cloud/mod.rsDeepgram 兼容端点 URL 构造crates/owhisper-client/src/adapter/deepgram_compat/mod.rs提供商注册表与默认配置crates/owhisper-client/src/providers.rs桌面端 STT 提供商与 BYO-model 注册apps/desktop/src/settings/ai/stt/shared.tsxWindows 标题栏交互测试apps/desktop/src/main/windows-title-bar.test.tsx【免费下载链接】anarlogOpen source Granola AI Alternative项目地址: https://gitcode.com/GitHub_Trending/hy/anarlog创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表