十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

畅联云平台丨新一代 AV2 视频编码标准发布,压缩效率提升约 30%,将带来哪些改变?

畅联云平台丨新一代 AV2 视频编码标准发布,压缩效率提升约 30%,将带来哪些改变? 干安防集成这行多年从 H.264 熬到 AV1 大规模落地亲眼见过每一代编码标准出来时的行业热闹也踩过不少 “追新翻车” 的坑。今年 5 月 28 日 AOMedia 把 AV2 v1.0.0 规范正式定稿6 月初官方官宣之后同行群和朋友圈直接炸了好多开发商、集成商上来就问码率省 30%是不是下个月就能把项目全换成 AV2 降成本说实话我第一反应不是兴奋是心里咯噔一下 —— 得又得挨个跟客户解释 “为啥不能明天就全量切换” 了。先给大伙交个底AOMedia 官方的说法是同画质下 AV2 比 AV1 省约 30% 的码率屏幕内容、HDR、8K 这类特定场景能接近 40%Netflix 的工程师 Norkin 放出的实测数据PSNR-YUV 下 BD-rate 改善约 28.7%VMAF 下约 32.6%和官方口径基本对得上。但公道话得说在前头独立第三方的全场景验证还在推进真实业务里的收益会跟着画面场景浮动别被厂商宣传里的 “暴降 30%” 带跑了节奏。今天就跟同行说点实在的这 30% 到底是从流水线哪一环抠出来的落到咱们做 AIoT、做智慧安防的项目里到底是红利还是坑架构上该怎么准备。尽量说人话不绕没用的术语。先掰扯最容易被炒歪的一点AV2 不是 “AI 编码器”这两天刷到不少自媒体喊 “AV2 用上 AI 编码了”—— 别闹真不是这么回事。AV2 v1.0 的底层仍然是传统混合块编码的老路子画面切块、预测、变换、量化、熵编码、环路滤波和三十多年来所有主流编解码器的核心框架没区别。规范本身没有把 AI/机器学习放进核心编码流程里核心目的就是保证解码器足够轻普通消费级芯片就能跑不用额外搭 NPU。它所谓的 “数据驱动”是离线用机器学习训练出变换核、预测矩阵这些参数把训练好的固定结果固化到标准里。解码的时候跑的还是经典流水线不会实时跑神经网络。说白了是用 AI 辅助制定标准不是让设备跑 AI 编码这俩完全是两码事。当然它也适合和外部 AI 模块搭配比如在编码器前面挂个 AI 降噪、超分的预处理层喂给 AV2 更干净的源画面整体压缩效果还能再往上提一截。但这是两套独立的东西别混为一谈。先泼完冷水再讲更现实的代价按照 VideoLAN 负责人 Jean-Baptiste Kempf 对参考软件的实测AV2 软件解码的复杂度大概是 AV1 的 5 倍编码器复杂度只会更高。眼下没有任何量产芯片带 AV2 硬件解码能力行业普遍预期硬件解码器要到 2027-2028 年才会出现在商用芯片里真正大规模普及得等到 2028 年之后。也就是说未来三五年里AV1 和 AV2 一定是长期共存的状态这点做技术选型的心里得先有数。30% 的码率节省到底是怎么抠出来的很多人只记住了 30% 这个数字不知道收益是散在整条编码流水线的每一个环节里每一处改动都带着明确的取舍。挨个拆开说都是做工程的看懂了底层逻辑才好算自己项目里的真实收益。块划分超级块翻一倍大块省比特、小块保细节AV1 的最大超级块是 128×128AV2 直接拉到了 256×256。做安防的都懂监控画面里大半是天空、墙面、停车场这种大面积平滑区域用小块切的话块边界多、额外开销大换成 256×256 的大块一整块平滑区域可能就一个划分开销直接降下来。遇到文字、人脸、移动物体这种细节密集的地方再逐级往下拆成小块。光做大块还不行容易把解码端的带宽和算力拉爆。所以 AV2 加了个半解耦划分SDP搭配好几种非对称划分模式大尺寸块里亮度和色度共享划分策略省掉重复计算到 64×64 及以下的小块又允许各自独立划分保住细节。做过边缘设备优化的都懂这种 “编码端使劲卷、解码端能省则省” 的设计有多重要 —— 直接关系到边缘网关的硬件成本不是纸面参数那么简单。预测参考帧变多预测越准残差越小压缩的核心逻辑就是预测当前这块画面能不能用旁边的块、或者前面几帧的画面拼出来。拼得越准剩下的残差就越小要编码的数据就越少。帧内预测这边AV2 用了数据驱动帧内预测DIP不是老一套的几何角度插值而是用海量真实画面离线训练出投影矩阵面对墙面、纯色背景这种重复单调的纹理预测精度提升很明显。CfL 亮度推导色度也做了优化夜视低照度的 HDR 画面适配性更好。帧间预测的改动更实在参考帧上限从 AV1 的 2 帧拉到了最多 7 帧还加了时间插值、光流运动微调、简化多参考帧这些工具。像慢云台、移动车辆这类画面运动补偿能贴得更准残差进一步收缩。还有帧内块拷贝IBC的优化对监控里反复出现的标牌、围挡这类静态图案压缩效率提升很直观。当然代价也有编码器的搜索空间变大了复杂度又涨了一截。但解码端只是按语法解析不用做复杂搜索咱们做平台、做终端的解码侧压力不会因为预测工具变多就暴涨这点还算厚道。变换数据驱动变换是这代最核心的改动这块我得多说两句个人觉得这是 AV2 和以往所有编码标准最不一样的地方。传统编码用的 DCT 离散余弦变换变换核是固定的数学公式。AV2 引入了 DDT 数据驱动变换 —— 提前用 KLT 算法拿海量真实视频的残差数据离线训练出多套变换核直接固化到标准里。说人话就是这个变换核是 “从真实视频里学出来的”不是凭空推导的数学公式所以对真实场景残差的能量集中能力比 DCT 强得多。同样一块残差过一遍 DDT大部分能量都会塌缩到少数几个低频系数上后面量化的时候就能放心扔掉更多高频细节又不怎么影响主观画质。配合 DDT 的还有两个辅助工具IST 二次变换给低频系数再做一次降维进一步挤掉无效信息CCTX 跨色度分量变换利用色度之间的相关性做联合编码。三者搭配下来残差能量的集中程度比 AV1 高一大截这也是 30% 总收益里贡献最大的单项技术之一。顺带提一句AV2 还把原生 64 点 DCT 给砍了换成 32 点逆变换加残差上采样。看着像是 “减配”实际上 256×256 大块普及之后大尺寸变换的需求本身就在减少用极小的画质损失换来了硬件实现难度的大幅下降 —— 标准制定的人是真懂芯片设计的难处。量化扔掉查找表用网格找最优解AV1 的量化靠好几张查找表映射步长维护起来繁琐。AV2 直接换成统一的指数公式做步长映射逻辑干净了很多。真正的升级是 TCQ 网格编码量化。它搞了 Q0、Q1 两个子量化器重建电平错开半个步长。编码器用 Viterbi 动态规划在 8 个状态的网格里找率失真最优的路径 —— 说白了就是把 “每个系数量化用 Q0 还是 Q1” 变成了一个最短路径问题找全局最优解而不是逐系数单独决策。单个系数看差别不大整帧算下来码率和失真的平衡能做得更精细。同样复杂度涨在编码端解码端只需要按语法查表重建感知不到 TCQ 的存在。熵编码三个毫米级优化积少成多熵编码是压缩的最后一公里单个工具提升幅度都不大但几个小优化叠起来对总收益的贡献不容小觑。AV2 底层还是沿用 MS-AC 多符号算术编码器没换引擎只在 “怎么把数据喂给编码器” 上做了三处微调。PARA 概率自适应率调整通过偏移参数动态调节 CDF 概率表的收敛速度监控画面经常有场景突变、光线切换这个工具能让概率模型更快贴合一新画面的符号分布少浪费比特。FSC 前向跳过编码专门针对屏幕内容。电脑屏幕、工控界面这类有大量锐利文字边缘的画面走频域变换反而会打散能量AV2 干脆跳过变换直接对空间残差做旁路编码 —— 这也是 AV2 在屏幕内容场景能省近 40% 码率的核心原因做指挥大厅大屏、工业 HMI 的同行可以重点关注。还有个很巧的 PH 奇偶校验隐藏当 AC 系数不少于 4 个时编码器微调这些系数的奇偶性让它们和 DC 系数的符号位保持一致。解码端只要算一下 AC 系数的奇偶就能隐式推出 DC 的属性直接省掉一个比特的显式信令。这三项单个可能也就贡献 0.5%-1% 的收益但架不住多。干过编解码优化的都懂到了 AV1 这个成熟度再想抠 30% 不可能靠某一项黑科技全是几百个 0.1% 的优化堆出来的AV2 干的就是这个笨功夫。环路滤波统一链路给解码端减负AV1 的环路滤波是多级串联去块、CDEF、环路恢复一路算下来模块多逻辑杂。AV2 换成了统一的通用去块滤波器新增 GDF 导向细节滤波器和 CCSO 跨分量采样偏移。CCSO 用亮度信息校正色度误差对安防常用的 4:2:0 采样格式特别友好夜视画面的色度噪声能压得更干净。整体思路和块划分的设计一脉相承编码端可以使劲堆复杂度解码端能省就省尽量控制硬件实现的门槛。落到安防场景红利和坑各占一半讲完技术原理还是得落回咱们的老本行。AV2 对智慧社区、园区安防、高空抛物这类项目的影响得拆开四个维度看不能只盯着码率下降瞎乐。带宽侧的利好最直观。比如 4K 高空抛物摄像头单路上行码率原本 4-8Mbps几十路同时回传的话公网带宽是一笔不小的固定开销。同画质下码率约降 30%跨公网的带宽成本、4G/5G 的流量成本都能明显压缩。但要注意这是理想场景的均值夜间低照度、车流密集的路口这类画面实际节省会打折扣做预算别直接按 0.7 倍硬套。存储侧的收益也很实在。边缘 NVR、云端冷存储、取证片段归档的占用量都会同步收缩同样的硬盘容量录像留存周期能拉长一截。对有明确合规留存要求的项目成本压力会小很多。但同样别直接拿 30% 去做存储规划拿自己项目的真实样本跑一遍实测最稳妥。最容易踩坑的是边缘侧甚至有点反直觉码率是降了但智能分析网关的整体算力压力反而可能涨。原因很简单 —— 现在没有硬件解码全靠 CPU 软解复杂度是 AV1 的 5 倍。如果网关既要做 AV2 解码又要并行跑高空抛物轨迹识别、周界入侵检测这类 AI 推理很容易出现解码把 CPU 占满AI 推理算力不够、延迟飙升的情况。我当年 H.265 刚普及的时候就踩过类似的坑软解吃满处理器智能分析直接卡成 PPT。所以智能分析网关的硬件选型必须重新评估算力余量不能看见 “码率降 30%” 就盲目乐观。平台侧的改动相对可控。GB28181、RTSP 这些传输协议本身不用变但 AIoT 平台的多媒体接入层、转码流水线、解码库都要做升级必须支持 AV1/AV2 双栈兼容向下还要兼容 HEVC。毕竟未来三五年新老设备混装是常态不可能一刀切全换成 AV2。物联底座的价值把编码迭代的成本收到底层编码标准是隔几年就迭代一次的东西如果每个项目、每代标准都从零重写解析、转码、调度逻辑时间长了全是技术债。成熟的做法是把多媒体底层能力做抽象让业务层专心做告警、做流程、做 AI 应用不用跟着编码标准反复改底层。像美畅智能物联中台UCC核心定位就是设备层和业务层之间的抽象层。向下把不同厂商的设备协议做归一把 AV1、AV2、HEVC 多格式解析、转码调度都封装到底层向上输出标准化的事件和媒体接口还能给分布式的智能分析网关统一调度媒体处理任务。开发团队不用每一代编码都重做一遍底层适配能省不少重复劳动。但边界也得说清楚这类中台能解决软件层面的格式适配、调度管理问题解决不了芯片没有硬解单元的硬件短板。软解带来的高算力消耗平台再优化也绕不开最终还是得等芯片厂商的硬件生态跟上来。别指望买一套中台就能抹平硬件代差那不现实。给集成商的话Codec 升级避坑指南踩了这么多代编码的坑总结几条落地建议都是实打实的经验大伙当个参考。第一双栈兼容渐进迁移别搞一刀切。未来 3-5 年 AV1 和 AV2 必然共存架构上一定要做 Codec 抽象层把编解码模块和业务逻辑解耦。后续不管是 AV2 迭代还是再出更新的标准改动都收拢在底层不用动业务代码。边缘设备的固件也要支持动态加载双解码库根据码流自动切换。第二边缘算力账要重新算别想当然。AV2 软解复杂度是 AV1 的 5 倍边缘网关如果既要解码又要跑 AI 推理算力配比要重新评估。个人建议实时分析类的边缘节点等 2027-2028 年硬件解码器普及了再规模化上 AV2现阶段用 AV1 过渡最稳妥。第三纯存储、纯转发的场景可以先吃红利。比如云端冷存储、跨机房备份这类不需要实时解码的场景AV2 的压缩收益可以直接兑现风险也低。这类后端存储环节可以先迁前端实时分析环节暂缓分阶段来最稳。第四别信 “AV2 立即可用” 的宣传。规范发布不等于设备就绪不等于生态成熟。官方自己都承认第三方验证还在进行中。咱们做落地的把它当成 2-3 年后的技术储备就行先做 POC 验证别急着上生产。第五做屏幕内容、工业 HMI 的团队可以提前布局。FSC 工具对屏幕类画面的优化是实打实的接近 40% 的码率节省不是虚的这类场景可以早做 POC收益会比普通监控场景更明显。写在最后干了这么多年 codec越来越觉得每一代编码标准的迭代从来不是什么颠覆性革命都是工程上一点点抠出来的进步。AV2 这 30% 的增益是 256×256 大块打底DDT 主攻残差压缩TCQ 优化量化PARA/FSC/PH 在熵编码里抠每一个比特再加上环路滤波给解码端减负几百个小优化堆出来的结果。它的长期潜力毋庸置疑免专利费的特性也让它对商用项目很友好。但落地这件事从来不是纸面参数说了算得看芯片、固件、终端、平台整条链的成熟度。对咱们做 B 端项目的人来说最理性的做法就是架构上提前留好 AV2 的位置现阶段用 AV1 扛住业务等硬件解码成熟了再逐步切换。技术是用来解决问题的不是用来追新的。真正的工程智慧从来不是选最新的标准是选最合适的标准。AV2 是未来但未来还没到。咱们做落地的总得在前沿和务实之间给自己留一条稳妥的路。
返回列表