声明:语音合成(TTS)论文优选系列主要分享论文,分享论文不做直接翻译,所写的内容主要是我对论文内容的概括和个人看法。如有转载,请标注来源。

欢迎关注微信公众号:低调奋进

Location-Relative Attention Mechanisms for Robust Long-Form Speech Synthesis

本篇文章是google在2020.04.22更新的文章,主要提出了基于energy_base的dynamic convolution attention,使语音合成系统可以对长句子进行推理。文章的具体链接:https://arxiv.org/pdf/1910.10288.pdf

1 背景

现在的语音合成系统虽然可以合成较高音质音频,但基于attention的对齐依然存在许多问题,比如使用短句子语料训练模型,该模型无法进行长句子的推理。本文对比了两类attention:location-relative gmm-based attention和additive energy-based attention,并提出了一种新的attention:dynamic convolution attention(DCA),实验结果显示,该attention可以合成较长的句子。

2 详细设计

encoder-attention-decoder的模型通用的公式表达为公式1-4:先使用encoder对输入进行处理,输出固定长度的特征h。对于decoder的每一帧输出,先使用attention求取对特征h的对齐,然后求取context vector。最后使由decoder输出该帧。其中attention决定了输入和输出的对齐情况。

接下来介绍两类attention:location-relative gmm-based attention和additive energy-based attention。

其中,gmm-based 基础的attention为公式5-6,参数w,∆,σ可以使用MLP进行估算,如公式7所示。最终的参数计算如table1所示,不同函数的转换为不同版本的gmm-attention。另外对v1和v2的∆i=1和σi=10的初始值设置则标注为版本v1b和v2b。

additive energy-based mechanisms的attention的公式统一表示为公式8-12。其中Wsi 和 V hj分别为query/key的计算,Ufi,j为历史对齐的累计,Tgi,j 和pi,j 为本文提出的dynamic convolution attention添加的两个部分,其值都是从decoder的状态求取,其结构都是卷积结构。对公式8的每个部分是否存在分为了table 2展示的几个版本attention。(其中本文的dca的图我使用tensorboard看了一下,结构从图和代码中看较为简单明了,这需要使用者去研究代码,其中图中1,2,3则为Ufi,j,Tgi,j 和pi,j)。其中pi,j的prior filter对输入encoder的分布如图一所示。

3 实验结果

首先对比一下这几种attention的收敛速度和收敛情况,结果如图2所示,在lessac数据集中,DCA和gmmv2b的效果最好,其它版本gmm都不太好。对数据集LJ上,location-sensitive效果较好,DCA,GMMv2b只存在一次对齐失败(本文说的原因是由于文本较长导致),但收敛速度比location-sensitive较快。

接下来,对比一下mos值,table 3可以看出,DCA和其它版本的效果相当,没有造成MOS下降。

最后比较长句子的CER(character error rate),由图3可以看出,gmmv2b和DCA的错误率不管合成句子长短都很低。

4 总结

本文提出了一种新的attetion:dynamic convolution attention,该种attention可以合成较长的句子。

语音合成(TTS)论文优选:Location-Relative Attention Mechanisms for Robust Long-Form Speech Synthesis相关推荐

  1. 语音合成TTS论文优选:A HYBRID TEXT NORMALIZATION SYSTEM USING MULTI-HEAD SELF-ATTENTION FOR MANDARIN

    声明:语音合成(TTS)论文优选系列主要分享论文,分享论文不做直接翻译,所写的内容主要是我对论文内容的概括和个人看法.如有转载,请标注来源. 欢迎关注微信公众号:低调奋进 A HYBRID TEXT ...

  2. 语音合成(TTS)论文优选:Accent and Speaker Disentanglement in Many-to-many Voice Conversion

    声明:语音合成(TTS)论文优选系列主要分享论文,分享论文不做直接翻译,所写的内容主要是我对论文内容的概括和个人看法.如有转载,请标注来源. 欢迎关注微信公众号:低调奋进 Accent and Spe ...

  3. 语音合成(TTS)论文优选:ByteSing: A Chinese Singing Voice Synthesis System Using Duration Allocated Encoder-De

    声明:语音合成(TTS)论文优选系列主要分享论文,分享论文不做直接翻译,所写的内容主要是我对论文内容的概括和个人看法.如有转载,请标注来源. 欢迎关注微信公众号:低调奋进 ByteSing: A Ch ...

  4. 语音合成(TTS)论文优选:End-to-End Code-Switching TTS with Cross-Lingual Language  Model

    声明:语音合成(TTS)论文优选系列主要分享论文,分享论文不做直接翻译,所写的内容主要是我对论文内容的概括和个人看法.如有转载,请标注来源. 欢迎关注微信公众号:低调奋进 End-to-End Cod ...

  5. 语音合成(TTS论文优选:VocGAN: A High-Fidelity Real-time Vocoder with a Hierarchically-nested Adversarial Netw

    声明:语音合成(TTS)论文优选系列主要分享论文,分享论文不做直接翻译,所写的内容主要是我对论文内容的概括和个人看法.如有转载,请标注来源. 欢迎关注微信公众号:低调奋进 VocGAN: A High ...

  6. 语音信号处理论文优选:神农Shennong: a Python toolbox for audio speech features extraction​

    声明:平时看些文章做些笔记分享出来,文章中难免存在错误的地方,还望大家海涵.搜集一些资料,方便查阅学习:http://yqli.tech/page/speech.html.语音合成领域论文列表请访问h ...

  7. 【论文学习】《“Hello, It’s Me”: Deep Learning-based Speech Synthesis Attacks in the Real World》

    <"Hello, It's Me": Deep Learning-based Speech Synthesis Attacks in the Real World>论文 ...

  8. 语音合成 | 精选论文汇总(197篇)

    ​语音合成 | 精选论文汇总(197篇) 本文为大家整理了语音合成相关论文197篇,共分为12部分,分类如下: (转至文末链接,免费获取源码链接及PDF版论文) Journal and confere ...

  9. 语音信号处理(DSP)论文优选:Interactive Modeling for Speech Enhancement

    声明:语音合成(TTS)论文优选系列主要分享论文,分享论文不做直接翻译,所写的内容主要是我对论文内容的概括和个人看法.如有转载,请标注来源. 欢迎关注微信公众号:低调奋进 Interactive Sp ...

最新文章

  1. python文本数据转换数值矩阵_python numpy矩阵的数据类型转换
  2. 如何获取所有Git分支
  3. 以太网接口保护方案设计图
  4. 头条的_signature这个如何_今日头条详细页面的cookie加密
  5. 【Boost】系列02:内存管理之scoped_ptr智能指针
  6. 【排序】算法(python实现)
  7. hive分区用2个字段有何限制_[特性]Hive动态分区功能使用
  8. 北斗b2频点频率_北斗系统中“三”的奥秘
  9. pagefile.sys这个文件怎麽能删除
  10. unity3d烘焙教程 持续更新中【2020】
  11. 计算机专业小米笔记本推荐,小米笔记本哪款好
  12. 【FastDFS】分布式文件系统FastDFS之FastDHT文件去重
  13. hbase二级索引解决方案
  14. 基于复化辛卜生求积公式的变步长求积算法
  15. 重磅开源!平安产险提出TableMASTER:表格识别大师
  16. TL-WR720N路由器Android安卓不能连接外网问题解决
  17. java中换行字符怎么用?
  18. 「题解」300iq Contest 2 B Bitwise Xor
  19. 关于onMeasure(转载)
  20. vue实现二维码识别功能 读取二维码内容

热门文章

  1. 360 os android m,搞机者福音?360 OS让手机能玩三个系统
  2. mysql 查询多个号段_数据库中如何使用SQL查询连续号码段(转载)
  3. 命令行静默安装msu格式的Windows更新离线安装包
  4. 张小龙-年薪近三亿的微信之父
  5. 重大要素改变中的机会选择包括_CCAA12月5日下午ISO90012015转版考试题A答案
  6. Ubuntu(LTS)
  7. 年底前端面试题总结(下)
  8. 什么是决策能力?HR人才测评
  9. ①隔若干行插入分页符②排签排版③按条件分页④按行拆分工作表
  10. 计算机博士复试英语自我介绍,博士复试英语自我介绍