2025-2026 音视频论文与开源算法
一、神经音频编解码器:从"压波形"到"教 LM 说音频"1.1 WavTokenizer — 40 tokens/秒够不够?ICLR 2025 的工作,浙大和阿里联合提出。之前 EnCodec/SoundStream 用 RVQ(残差向量量化),一秒 24kHz 音频要 8 层 × 75Hz = 600 个 token。WavTokenizer 砍到单层量化器,每秒只要 40 或 75 个 token。做法上几个关键点:拓宽 VQ 空间:码本容量从常规的 1024 扩到更大,降低量化碰撞扩展上下文窗口:encoder 看更长的时序上下文再决定量化多尺度判别器:不同时间分辨率下的对抗训练逆傅里叶结构:decoder 用 iFFT 替代纯卷积上采样效果上 UTMOS 分数在低比特率下仍然很高,而且 token 里隐含语义信息更丰富——这对下游的音频语言模型(GPT-4o 那个路子)很关键,因为 token 少了,LM 的序列长度压力就小了。代码:https://github.com/jishengpeng/WavTokenizer我的判断:40 token/s 是一个有工程意义的数字。一个 30 秒的音频