0
  • 聊天消息
  • 系统消息
  • 评论与回复
登录后你可以
  • 下载海量资料
  • 学习在线课程
  • 观看技术视频
  • 写文章/发帖/加入社区
会员中心
创作中心

完善资料让更多小伙伴认识你,还能领取20积分哦,立即完善>

3天内不再提示

Facebook机器学习模仿真人声音,安全性引人担忧

hl5C_deeptechch 来源:YXQ 2019-06-13 09:46 次阅读
加入交流群
微信小助手二维码

扫码添加小助手

加入工程师交流群

机器语音系统一直有点令人失望:即使是最好的文本语音转换系统也摆脱不了机械的特性,缺乏人类说话时的基本语调变化。斯蒂芬·霍金使用的语音系统就是一个很好的例子。

但近年来,机器学习取得了巨大进步,也改善了机器语音系统的一些缺点。

最近,Facebook 人工智能研究中心的 Sean Vasquez 和 Mike Lewis 发现了一种可以克服从文本到语音系统转换限制,完全由机器生成而且音频片段极其逼真的方法。这一系统被称为 MelNet,它不仅可以复制人类的语调,而且可以用与真人相同的声音。于是,研究小组开始训练该系统,让它模仿出比尔·盖茨等人的说话。这项工作让人类和电脑之间更真实的互动成为可能,不仅如此,它的逼真程度,很可能引发虚假音频内容骗术的新问题。

图丨比尔·盖茨(来源:麻省理工科技评论)

现实中的文本—语音转换系统进展缓慢并非是因为缺乏尝试。许多团队一直在尝试训练深度学习算法,利用大型音频数据库重现真实的语音模式。

Vasquez 和 Lewis 说,这种方法的问题在于使用的数据类型。到目前为止,大多数工作都集中在音频波形记录上。这些音频波形显示了声音的振幅如何随时间而变化,它每秒记录的音频包含数万个时间步长。

这些波形能在许多不同的尺度上显示出特定模式。例如,在几秒钟的讲话中,波形反映了与单词序列相关的特征模式。但是在微秒级的片段中,波形显示了与声音的音高和音色相关的特征。在其他尺度上,波形反映了说话人的语调、音素结构等。

另一种方法是将波形在一个时间步长和下一个时间步长之间的关联性考虑进来。所以,在给定的时间范围内,一个单词开头的声音与后面的声音是有关联的。

深度学习系统理应善于学习这些类型的关联性,并对它们进行复制。但问题出在不同时间尺度的关联性上,深度学习系统只能在有限的时间尺度上研究这些关联性。这是因为深度学习使用了一种叫做反向传播的学习过程,这种学习过程不断地重新连接网络,根据所看到的示例改进其性能。

重复率限制了系统学习关联性的时间尺度。因此,深度学习网络可以学习长时间或短时间内音频波形的关联性,但不能同时兼顾两者。这就是为什么它们在复制语音方面表现如此糟糕的原因。

Vasquez 和 Lewis 则有不同的方法。他们使用声谱图而不是音频波形来训练他们的深度学习网络。声谱图记录了整个音频频谱及其随时间的变化。所以当波形捕捉到随时间变化的一个参数,例如振幅时,光谱图则捕捉到了不同频率范围内的振幅变化。

这意味着音频信息被更密集地打包到了这种类型的数据中。研究者认为:声谱图的时间轴比波形的时间轴紧凑几个数量级,这意味着在波形中跨越数万个时间步长的依赖关系只跨越声谱图中的数百个时间步长。

这使得深度学习系统更容易获得关联性。他们说:“这使得我们的声谱模型能够在数秒内产生一致的无条件语音和音乐样本。”

图丨声谱图 VS 波形图(来源:Facebook)

最后的结果令人印象深刻。通过使用 TED 演讲中的普通语音训练系统,MelNet 能够在几秒钟内复制 TED 演讲者的声音,或多或少地说出一些内容。Facebook 的研究人员利用比尔·盖茨的 TED 演讲来训练 MelNet,然后用比尔·盖茨的声音说出一系列随机的短语,以此展示了 MelNet 的灵活性。

当然,该方法也有一些限制。普通言语包含了更长时间尺度上的相关性。例如,在几十秒或几分钟的演讲进程中,人们会使用语调的变化来表示主题或情绪的变化。Facebook 的机器系统似乎还无法做到这一点。

因此,尽管 MelNet 可以创造出非常逼真的短语,但团队还不能让机器完成较长的句子、段落或整个故事。这个目标似乎不是很快就能实现。

然而,这项工作可能会对人机交互产生重大影响。人机交互中许多对话只包含简短的短语。电话接线员和服务台尤其可以使用一系列相对简短的短语。因此,这项技术可以用一种比当前系统更接近人类的方式来优化这些交互。

不过,目前 Vasquez 和 Lewis 对潜在的应用前景守口如瓶。

当然,自然发声的机器也存在潜在的问题,尤其是那些能够逼真模仿人类的机器。很容易想象,这种技术可能被用于恶作剧的场景。正因为如此,这是人工智能的又一进步,它提出的伦理问题比它所能回答的问题要更多。它所能回答的问题要更多。

声明:本文内容及配图由入驻作者撰写或者入驻合作网站授权转载。文章观点仅代表作者本人,不代表电子发烧友网立场。文章及其配图仅供工程师学习之用,如有内容侵权或者其他违规问题,请联系本站处理。 举报投诉
  • Facebook
    +关注

    关注

    3

    文章

    1432

    浏览量

    59334
  • 机器学习
    +关注

    关注

    67

    文章

    8561

    浏览量

    137208

原文标题:Facebook 的 AI,已经可以用比尔·盖茨的声音说话

文章出处:【微信号:deeptechchina,微信公众号:deeptechchina】欢迎添加关注!文章转载请注明出处。

收藏 人收藏
加入交流群
微信小助手二维码

扫码添加小助手

加入工程师交流群

    评论

    相关推荐
    热点推荐

    Microchip ATSHA204A:高安全性硬件认证设备的深度解析

    Microchip ATSHA204A:高安全性硬件认证设备的深度解析 在当今数字化时代,数据安全至关重要。Microchip的ATSHA204A作为CryptoAuthentication™家族
    的头像 发表于 04-06 14:55 658次阅读

    从 M0 到 M3丨笙泉32 位 MCU:高效能、安全性与多元应用兼具

    从 M0 到 M3丨笙泉32 位 MCU:高效能、安全性与多元应用兼具 笙泉32位MCU打造多元应用控制方案 32 位 MCU(单片机 / 微控制器),如 Arm® Cortex®-M0
    发表于 03-10 15:29

    请问VisionFive 2 的热安全性如何?

    我的 VisionFive 2 目前没有风扇。如果我开始以 100% 的速度使用 CPU,我应该担心它过热吗? 为了安全起见,它会进行热节流吗? 如果是这样,如何查看它是否处于热节流状态?
    发表于 02-27 06:31

    自动驾驶中常提的模仿学习是什么?

    当谈及自动驾驶模型学习时,经常会提到模仿学习的概念。所谓模仿学习,就是模型先看别人怎么做,然后学着去做。自动驾驶中的
    的头像 发表于 01-16 16:41 2132次阅读

    机器人用霍尔电流传感器,能提升操作安全性么?

    安全。霍尔电流传感器作为机器人电力系统的“感知核心”,通过实时监测电流信号、精准反馈运行状态,为机器人构建全链路安全防护体系,成为提升操作安全性
    的头像 发表于 12-22 09:04 1524次阅读
    <b class='flag-5'>机器</b>人用霍尔电流传感器,能提升操作<b class='flag-5'>安全性</b>么?

    请问CW32L052C8T6这种安全性低功耗MCU的安全固件部分怎么实现?

    请问,CW32L052C8T6这种安全性低功耗MCU的安全固件部分怎么实现?
    发表于 12-05 07:19

    车规级与消费级芯片的可靠安全性与成本差异

    引言在汽车电子和消费电子领域,"车规级"与"消费级"芯片代表了两种截然不同的设计理念和技术标准。车规级芯片专为汽车应用设计,强调在极端环境下的可靠安全性
    的头像 发表于 11-18 17:27 1534次阅读
    车规级与消费级芯片的可靠<b class='flag-5'>性</b>、<b class='flag-5'>安全性</b>与成本差异

    有哪些技术可以提高边缘计算设备的安全性

    边缘计算设备的安全性面临分布式部署、资源受限(算力 / 存储 / 带宽)、网络环境复杂(多无线连接)、物理接触易被篡改等独特挑战,因此其安全技术需在 “安全性” 与 “轻量化适配” 之间平衡。以下从
    的头像 发表于 09-05 15:44 1765次阅读
    有哪些技术可以提高边缘计算设备的<b class='flag-5'>安全性</b>?

    如何验证硬件加速是否真正提升了通信协议的安全性

    验证硬件加速是否真正提升通信协议的安全性,需从 安全功能正确、抗攻击能力增强、安全性能适配、合规一致 等核心维度展开,结合实验室测试与真
    的头像 发表于 08-27 10:16 1316次阅读
    如何验证硬件加速是否真正提升了通信协议的<b class='flag-5'>安全性</b>?

    如何利用硬件加速提升通信协议的安全性

    产品实拍图 利用硬件加速提升通信协议安全性,核心是通过 专用硬件模块或可编程硬件 ,承接软件层面难以高效处理的安全关键操作(如加密解密、认证、密钥管理等),在提升性能的同时,通过硬件级隔离、防篡改等
    的头像 发表于 08-27 09:59 1166次阅读
    如何利用硬件加速提升通信协议的<b class='flag-5'>安全性</b>?

    请问DM平台访问安全性如何控制?

    DM平台访问安全性如何控制?
    发表于 08-06 06:01

    SD-WAN供应商在安全性方面有哪些差异?服务商安全性排行

    市场报告,2022年该市场增长达25%,预计2027年规模将突破75亿美元,而**安全性差异**成为企业选型的首要考量。以下从技术架构、行业适配等维度解析头部服务商
    的头像 发表于 07-29 10:14 345次阅读
    SD-WAN供应商在<b class='flag-5'>安全性</b>方面有哪些差异?服务商<b class='flag-5'>安全性</b>排行

    NVIDIA Isaac Lab可用环境与强化学习脚本使用指南

    Lab 是一个适用于机器人学习的开源模块化框架,其模块化高保真仿真适用于各种训练环境,Isaac Lab 同时支持模仿学习模仿人类)和强
    的头像 发表于 07-14 15:29 2604次阅读
    NVIDIA Isaac Lab可用环境与强化<b class='flag-5'>学习</b>脚本使用指南

    无刷直流电机控制系统的建模仿真分析

    控制逆变器开关的导通与关断。通过试验结果可以看出系统能够稳定适行,进而验证了该方案的可行。 纯分享帖,点击下方附件免费获取完整资料~~~ *附件:无刷直流电机控制系统的建模仿真分析.pdf 【免责声明
    发表于 06-27 16:52

    品英Pickering公司仿真方案和测试系统满足航电设备可靠安全性等更高要求

    ,英国Pickering集团将于2025年5月28-29日在上海举办的2025第十四届飞机航空电子国际论坛中展示多款领先的开关、仿真方案和测试系统,满足国内外航空电子设备的性能、可靠安全性和经济
    发表于 05-22 09:20 1186次阅读
    品英Pickering公司<b class='flag-5'>仿真</b>方案和测试系统满足航电设备可靠<b class='flag-5'>性</b>和<b class='flag-5'>安全性</b>等更高要求