← 返回项目列表

显著性引导的 HEVC 感知编码

标准 HEVC(x265 quantOffsets)· 显著性源 TASED-Net / ViNet-S · 评估 PSNR + VMAF

研究项目 · 实验结果
诚实声明(2026-07-02):本页数字为研发期历史结果。 项目随后引入了更严格的可复现性审计(输入哈希、工具链版本、held-out 测试集要求), 本页所有数字尚未在新规范下重跑,暂不能作为最终结论引用;重跑完成后本页会整体更新。 另外,页面中的「显著区质量」由模型预测图加权计算,衡量的是「质量是否移动到模型指定区域」, 人眼主观实验尚未进行。

★ 主结果:等码率公平对比(iso-rate)

baseline 与显著性版编码到相同码率,x265 AQ 对两者均开启。 衡量「显著性分配相对编码器自带 AQ 的额外增益」。数据:sample.mov,2000 kbps。

+2.49 dB
显著区 PSNR 提升
−0.07
全局 VMAF(几乎不变)
−0.34 dB
背景 PSNR(轻微代价)
0.24%
码率差异(视为等码率)

相同码率下,比特被精准搬到人眼关注区域 —— 显著区质量大幅提升,整体感知质量几乎不变。

并排对比:等码率下 baseline vs 显著性

普通 x265(AQ) · 均匀分配 · 同码率
显著性分配 · 比特集中显著区 · 同码率

两段码率相同。留意主体区域在右侧更清晰,背景略有牺牲。

显著性可视化:模型在看哪里

TASED-Net 显著性热力图叠加
ViNet-S 显著性热力图叠加

暖色 = 高显著性(预测人眼注视区),逐块 ΔQP 据此分配。

码率点扫描(savings 模式,sample.mov,TASED-Net)

CRF码率节省显著区 ΔPSNR背景 ΔPSNR全局 ΔPSNR

码率节省幅度

38–50% 码率节省,显著区加权 PSNR 损失始终 < 0.2 dB(账面指标;主观感知等价性未经真人实验验证)。

消融一:显著性模型(CRF 28)

模型参数量码率节省显著区 ΔPSNR背景 ΔPSNR

管线对显著性来源鲁棒 —— 换更轻量、更新(2025)的 ViNet-S 方法照样成立。

消融二:多线索深度融合(CRF 28,TASED-Net)

配置码率节省显著区 ΔPSNR背景 ΔPSNR
融合后显著性(70% 显著 + 30% 深度)
深度图(近=高重要性)

深度融合提高显著区保护(损失减半),代价是部分码率节省 —— α 是可调权衡。

跨视频泛化(CRF 28,TASED-Net)

视频分辨率帧率帧数码率节省显著区 ΔPSNR

两个不同分辨率/帧率/场景的视频方法均成立,且增益存在内容依赖性。

Yuli Dai · yulid.org/saliency