Debargha Mukherjee解读AV2:下一代编解码器的目标、工具与挑战

The VideoVerse

总结:

Debargha Mukherjee(Google首席工程师)在本期节目中深入探讨了AV1的继任者——AOM Video Model(AVM,或称AV2)视频编解码器。主要内容包括:

  • AVM的愿景与目标:旨在实现下一代压缩效率,同时严格控制解码器侧的复杂性,以确保在移动芯片组等多种设备上轻松部署。
  • 测试条件与内容焦点:开发初期投入大量时间确定测试条件和数据集,重点关注1080p和4K等更高分辨率内容,并专门优化了针对屏幕内容(如演示文稿、窗口移动)的编码工具。
  • 现有改进与性能提升:与AV1相比,AVM在自然内容上的编码效率提升约24-25%,屏幕内容提升超过30%。主要得益于帧间编码(如时间插值图像模式、光流、改进的扭曲模式)和帧内编码(如帧内二次变换、半解耦分区)工具的创新。
  • AI/ML在视频压缩中的应用:讨论了将AI/ML技术(特别是循环内滤波)集成到标准中的潜力。虽然全ML模型效果显著,但其巨大的硬件成本(解码器硅面积翻倍仅带来3-4%增益)目前尚不可行。AVM正探索微型ML模型,目标是实现1.5-2%的增益,同时控制解码器复杂性。
  • 未来展望:展望了未来编解码器将采用传统与ML工具相结合的混合模式,并探讨了多视角视频、更高位深、Alpha通道和无损编码等新应用场景。

介绍与AVM项目概述 [00:00:00]

AVM的测试条件与内容类型 [00:08:15]

AVM中的新工具与性能提升 [00:13:35]

AI/ML在视频压缩中的应用与未来展望 [00:27:10]