YOLOv13最新创新改进系列:合轻量级卷积LightConv,特征提取采用共享卷积核,采用更少的参数完成对YOLOv13的轻量化设计,创新点神器!

购买相关资料后畅享一对一答疑

详细的改进教程以及源码,戳这!戳这!!戳这!!!B站:AI学术叫叫兽 动态中有链接,感谢支持!祝科研遥遥领先!

lightconv

一、简介

最近的研究表明,ASR 和 TTS 模型的组合在标准语音转换任务(例如 2020 年语音转换挑战赛 (VCC2020))中产生了极具竞争力的性能。 为了获得良好的性能,这两个模型都需要对大量数据进行预训练,从而获得使用效率可能低下的大型模型。 在这项工作中,我们提出了一个明显更小的模型,因此在获得同等性能的同时处理速度更快。 为了实现这一目标,所提出的模型 Dynamic-GAN-VC (DYGAN-VC) 使用非自回归结构,并利用从 VQWav2vec 模型获得的矢量量化嵌入。 此外,引入动态卷积来改进语音内容建模,同时需要少量参数。 使用VCC2020任务进行客观和主观评估,MOS分数高达3.86,字符错误率低至4.3%。 这是通过大约一半的模型参数数量和高达 8 倍的更快解码速度实现的。

最近,最先进的(SOTA)语音转换(VC)模型[1,2,3,4,5,6]取得了良好的性能,生成的样本已达到接近人类语音质量的水平。 在最近的 Voice Conversion Challenge 2020 [7] (VCC2020) 中,Cascade ASR-TTS [1] 获得了有竞争力的表现。 它由自动语音识别(ASR)模型和文本转语音(TTS)模型组成。 ASR 和 TTS 模型都是大型预训练自回归 (AR) Transformer [8] 模型。 最近,有几项工作表明 Transformer 模型在 ASR [9, 10] 和 TTS [11, 12] 领域都存在参数和解码效率问题。 因此,在内存和计算资源有限的实际情况下,部署级联 ASR-TTS 模型效率很低。 表 1 概述了级联 ASR-TTS [1] 和所提出的模型。 [1]总共有超过100M(百万)个参数。 还值得注意的是,级联 ASR-TTS 仅支持多对一转换方向,这意味着每个模型仅支持多个源和一个目标扬声器。 因此,在多个目标说话人的场景下,级联ASR-TTS的参数效率低于支持多对多转换方向的模型。 本文重点关注提高级联 ASR-TTS 的效率 [1]。 DYGAN-VC没有使用AR模型,而是采用非AR模型结构,应该具有更好的解码效率。 本文建议使用VQWav2vec,而不是使用Transformer ASR模型。 VQWav2vec [13] 是一种将语音编码为特征的语音自监督学习模型 [14,15,16]。 VQWav2vec 旨在学习有利于多个下游任务的无监督语音表示。 基于Wav2vec [14],引入了矢量量化[17]模块,这是一种可微分聚类方法。 由于模型引入了离散性,VQWav2vec 特征应该包含语音内容信息并且是说话者不变的。 如表1所示,与级联AST-TTS [1]中使用的ASR模型相比,作为非AR模型,VQWav2vec更小。 此外,最近的 VC 工作 [18] 使用 VQWav2vec 功能来提高数据效率。 为了提高 Transformer TTS 模型的效率,本文提出使用动态卷积 [19] 作为替代,而不是使用计算成本高昂的自注意力层。 为了提高大型 Transformer 模型的效率,提出了轻量级卷积和动态卷积[19]。 它们可以被视为 Transformer 计算昂贵的注意力机制的轻量级替代品。 此外,在最近的语音合成工作[20]中,引入了轻量级卷积以获得更好的参数和解码效率。 本文提出了 DYGAN-VC,一种基于生成对抗网络(GAN)的新型 VC 模型 [21]。 DYGAN-VC 使用轻量级的 VQWav2vec,而不是像 [1] 中那样使用大型 ASR 模型。 作为自注意力层的替代,引入动态卷积[19]以获得更好的参数三效率。 DYGAN-VC模型尺寸小,解码速度快,达到了与级联ASR-TTS相当的性能。

二、 亮点

贡献可概括如下:
• 本文提出了 DYGAN-VC,一种高效的 GAN VC 模型,其性能与 SOTA 相当。
• 本文首次将自监督特征(VQWav2vec)与GAN VC 模型相结合。
• 本文首次将动态卷积引入到VC中,提高了参数效率

轻量级卷积和动态卷积轻量级卷积是一维卷积的变体,它比普通一维卷积具有更少的参数。
给定一个特征矩阵 X ∈ Rb×t×c,其中 b、t、c 表示批量大小、分段长度和通道数。 轻量级卷积具有内核 K ∈ Rk×h,其中 k 是内核大小,h 是头数。 输出 O ∈ Rb×t×c 由 oi,j,p = k q=1 Kq,( pc h ) · Xi,(j+q− k+1 2 ),p, (1 ) 其中 oi,j,p 是 O ∈ Rb×t×c 的元素。 轻量级卷积将 X 的特征维度分割为 h 组,其中一组中的特征共享一个内核。 通过这样做,一个轻量级卷积层的参数数量为 k × h,少于传统的一维卷积层。 动态卷积在轻量级卷积的基础上引入了额外的核生成机制,根据输入特征X生成核,使得动态卷积的核K的形状变为[b,t,k,h]。 下面展示了内核生成机制的形成。 经过线性层和GLU层后,可以得到特征矩阵X
注意:上述为机翻,详情请大家看完视频后,根据B站视频进行原文阅读!

三、 改进源码

B站私信 Ai学术叫叫首 即可!
本UP主 B站链接 戳这里!!!

详细的改进教程以及源码,戳这!戳这!!戳这!!!B站:AI学术叫叫兽 动态中有链接,感谢支持!祝科研遥遥领先!

四、验证是否成功即可

执行命令

python train.py

改完收工!
关注B站:AI学术叫叫兽
从此走上科研快速路
遥遥领先同行!!!!

详细的改进教程以及源码,戳这!戳这!!戳这!!!B站:AI学术叫叫兽 动态中有链接,感谢支持!祝科研遥遥领先!

写在最后

学术因方向、个人实验和写作能力以及具体创新内容的不同而无法做到一通百通,所以本文作者即B站Up主:Ai学术叫叫兽
在所有B站资料中留下联系方式以便在科研之余为家人们答疑解惑,本up主获得过国奖,发表多篇SCI,擅长目标检测领域,拥有多项竞赛经历,拥有软件著作权,核心期刊等经历。因为经历过所以更懂小白的痛苦!因为经历过所以更具有指向性的指导!

祝所有科研工作者都能够在自己的领域上更上一层楼!!!

在这里插入图片描述

Logo

加入社区!打开量化的大门,首批课程上线啦!

更多推荐