0
  • 聊天消息
  • 系统消息
  • 评论与回复
登录后你可以
  • 下载海量资料
  • 学习在线课程
  • 观看技术视频
  • 写文章/发帖/加入社区
会员中心
创作中心

完善资料让更多小伙伴认识你,还能领取20积分哦,立即完善>

3天内不再提示

你知道屏幕后是谁在和你对话吗?新研究开发仿真面对面对话系统

Hf1h_BigDataDig 来源:TW 2019-09-02 15:48 次阅读
加入交流群
微信小助手二维码

扫码添加小助手

加入工程师交流群

基于深度神经网络仿真面对面对话系统

近日,CloudMinds和北京航空航天大学的研究人员基于深度学习提出了一种新的仿真面对面对话系统。CloudMinds是一家在机器人和云服务领域的领军企业,致力于成为针对各种机器人模型需求的供应商。

该会话系统包括用于收听和说话的两个序列到序列模型以及基于虚拟代理合成器的生成性对抗网络(GAN)模型。

当虚拟代理与人通信时,语音音频和面部图像被输入到系统中。面部图像由面部解析模块处理,产生面部动作和姿势。然后将生成的信息传递到基于序列到序列的收听模型中。当虚拟代理在收听时,输出被馈送到合成器中以产生逼真的面部图像作为非语言反应。

语音识别模型将语音音频变换为文本,然后传递到会话模块中以生成响应语句,该响应语句被传递到文本到语音(TTS)模块以合成语音。响应语句被传递到序列到序列的说话模型,其输出也被输入到虚拟合成器中以产生逼真的面部图像,从而呼应语音内容。头像合成器则用于在整个对话期间收听和说话。

本文显著改进了传统的基于3D模型的成果。为了训练模型,研究人员收集了大约700个ESPN视频,其中包含来自YouTube的面对面对话场景。

与传统3D模型的生成结果相比,该模型所生成的面部图像更接近现实。毋庸置疑的是,在使得会话更加逼真自然的领域上,该系统还有很大的潜力可供挖掘,未来它还可用于实现个性化表情会话。

原文:

https://arxiv.org/abs/1908.07750

使用DISCo方法改进钙成像分析

本文中,德国海德堡大学跨学科科学计算中心(IWR)的研究人员介绍了DISCo方法,这是一种使用深度学习,实例分割和相关性研究的新方法,可用于钙成像分析中的细胞分割步骤。

DISCo将深度学习网络的优势与最先进的实例分割程序相结合,允许直接提取单元实例而无需任何复杂的后处理步骤。他们还以非常有效的方式利用钙成像视频的时间背景来计算像素之间的分段相关性。然后以摘要图像的形式将此时间信息与基于形状的信息相结合。

DISCo的最大优势在于能够结合相关性和图像特征,而不只依赖于其中一种方法。因此,DISCo可以通过在Neurofinder数据集上仅使用单个模型来使神经研究人员获得良好的整体性能。此外,当在几个数据集系列上训练单个网络时,研究人员能够超越在Neurofinder数据集上训练的所有其他方法。

原文:

https://arxiv.org/abs/1908.07957

用于科研教育的低成本开源机器人赛车平台

华盛顿大学保罗G.艾伦计算机科学与工程学院的研究人员最近介绍了MuSHR,即多代理的非完整赛车系统。MuSHR是一个低成本、开源的机器人赛车平台,致力于教育和研究,由MuSHR的个人机器人实验室开发,旨在促进机器人领域的公民化。作为一个低成本的平台,参与者可以通过说明,开源文档和动手教程参与其中。

赛车的硬件设计基于一系列现成的组件,这些组件可以从世界各地的线上和线下硬件商店中轻松地找到,而软件架构则是在个人机器人实验室中开发的。该平台为华盛顿大学的移动机器人课程开发了一套演示系统和许多宝贵的实践经验,是机器人平台开发的里程碑。

MuSHR的低成本开发模式和综合的文档记录是宝贵的机器人研究资源。该平台向学术研究实验室,机器人研究者及机器人爱好者等展示各种机器人研究项目提供了一个出色的测试平台。

MuSHR具有开源指令和教程带领用户完成硬件开发。文档托管在Github上,免费供一般公众下载使用。

代码:

https://github.com/prl-mushr

原文:

https://arxiv.org/abs/1908.08031

三维扫描与CAD对象的联合嵌入

近日,慕尼黑工业大学、斯坦福大学以及 Facebook 人工智能研究所共同提出了一种学习三维扫描和CAD之间的联合嵌入空间的技术。而在这两者中有很多联系紧密且十分相似的事物。这一学习方法基于一种全新的3D CNN 技术,通过学习联合嵌入空间中事物的相似性来实现嵌入。

为了学习一个扫描对象和CAD模型可以相互交织的共享空间,研究人员提出使用堆叠沙漏的方式将前景、背景与扫描对象分开,并将其转换为完整的类CAD表示,以此将它整合到共享嵌入空间中。这样操作得到的嵌入空间可以用于CAD模型检索。为了更好地完成这一任务,研究人员引入了一个全新数据集,其中包括了扫描CAD相似性注释。在这一数据集的帮助下,他们能够对CAD模型检索进行细粒度的评估,并对杂乱、嘈杂部分进行扫描。

这一新型学习方式比现有的CAD模型在实例检索上的准确率高出10% 以上。

因此,它在CAD模型检索方面的表现比原有模型更好。学习这样的联合扫描- CAD嵌入空间不仅为CAD模型检索提供了新的解决方案,也为这两个领域之间的知识映射提供了新的可能性。

当然,虽然这个技术在扫描与学习CAD对象空间方面非常有效,但它仍然有很多局限性——目前研究人员仅考虑了扫描和CAD对象领域中对象的几何形状;而这篇论文中未提及的颜色信息可能是联合嵌入或CAD模型检索的另一强大信号

原文:

https://arxiv.org/abs/1908.06989

Google发布Turbo,可视化工具的里程碑式突破

Turbo 是由Google研究人员提出的一种着色工具,它既有Jet的优势功能,同时也解决了Jet的一些短板,例如细节错误、条带、和颜色混淆等。

在开发人员的精心调试下,Turbo的强大性能能够胜任各种可视化任务。在开发过程中,研究人员们制作了一个简单的交互界面,在其中他们能够使用7节立方条来调整RGB曲线,同时将样本结果与其他知名彩绘程序的结果进行比较。

Turbo可以作为顺序和发散的可视化工具,因此它很适合开发人员保存在自己的“工具箱”中。它用于解决均匀性不那么重要的数据可视化任务非常有效,尤其是在需要展现强烈对比的情况下。

Google的团队将这个工具用于实现视差贴图、误差贴图以及许多其他标量的可视化中。您可以在下方链接中找到在Python和C/C++ 中的使用这几技术的方法,以及多项式逼近的方法——用于可能查表查询不太方便的情况中。

Python:

https://gist.github.com/mikhailov-work/ee72ba4191942acecc03fe6da94fc73f

C/C++:

https://gist.github.com/mikhailov-work/6a308c20e494d9e0ccc29036b28faa7a

Polynomial approximation:

https://gist.github.com/mikhailov-work/0d177465a8151eb6ede1768d51d476c7

原文:

https://ai.googleblog.com/2019/08/turbo-improved-rainbow-colormap-for.html

声明:本文内容及配图由入驻作者撰写或者入驻合作网站授权转载。文章观点仅代表作者本人,不代表电子发烧友网立场。文章及其配图仅供工程师学习之用,如有内容侵权或者其他违规问题,请联系本站处理。 举报投诉
  • 神经网络
    +关注

    关注

    42

    文章

    4827

    浏览量

    106797
  • AI
    AI
    +关注

    关注

    89

    文章

    38103

    浏览量

    296627

原文标题:狗还是机器人?谁在屏幕后和你对话?新研究开发仿真面对面对话系统 | 一周AI最火论文

文章出处:【微信号:BigDataDigest,微信公众号:大数据文摘】欢迎添加关注!文章转载请注明出处。

收藏 人收藏
加入交流群
微信小助手二维码

扫码添加小助手

加入工程师交流群

    评论

    相关推荐
    热点推荐

    AI教父Hinton对话云天励飞陈宁

    ,围绕算力效率、AI 向善与普惠未来展开了一场高密度对话对话由硅谷著名计算机科学家、硅谷高创会大会主席吴军博士主持。
    的头像 发表于 12-03 14:04 316次阅读

    思必驰任务型对话算法通过国家备案

    近日,国家网信办公开发布第十四批境内深度合成服务算法备案信息,思必驰任务型对话算法正式通过备案。这是思必驰第八项通过备案的算法,进一步巩固了在对话式人工智能领域的技术与合规优势。
    的头像 发表于 11-20 10:33 560次阅读

    2025年RT-Thread开发者巡回培训报名正式启动!

    与RT-Thread技术专家面对面答疑解惑的绝佳机会。在这里将体验丰富的理论课程、精彩Demo演示与动手实践!欢迎报名参加,与我们携手探索技术的更多可能!日期城市10月
    的头像 发表于 09-27 10:39 1141次阅读
    2025年RT-Thread<b class='flag-5'>开发</b>者巡回培训报名正式启动!

    system view 不能recorder是怎么回事?

    点击recorder按钮弹出下面对话框,不晓得配置问题还是操作问题
    发表于 09-22 06:02

    与作者面对面丨英飞凌IPAC直播间即将亮相PCIM Asia 2025

    PCIMAsia展会现场!直播主题:与作者面对面,深度解读2025PCIMAsia论文直播时间:2025年9月24日1500扫码立即报名将可以看到英飞凌资深“攻城狮
    的头像 发表于 09-16 17:06 1018次阅读
    与作者<b class='flag-5'>面对面</b>丨英飞凌IPAC直播间即将亮相PCIM Asia 2025

    【应用方案】“会呼吸”的洗衣机:艾为灯语®让光与对话

    是否想过,洗衣机会用光的语言与您对话?当科技被赋予温度,最日常的洗衣时刻也开始有了诗意。艾为灯语助力智能家电系列,让洗衣机从冰冷的金属外壳中苏醒,用光的语言与温柔对话。这不是一次简
    的头像 发表于 09-11 18:56 521次阅读
    【应用方案】“会呼吸”的洗衣机:艾为灯语®让光与<b class='flag-5'>你</b>“<b class='flag-5'>对话</b>”

    米尔RK3576部署端侧多模态多轮对话,6TOPS算力驱动30亿参数LLM

    ]。 RK3576 工作状态 本文目录 本文目录 一、引言 1.1 什么是多轮对话? 1.2 多轮对话系统鸟瞰:三颗“核心”协同驱动 1.3 核心逻辑:多轮对话的处理流程 二、工程化
    发表于 09-05 17:25

    广和通发布自研端侧语音识别大模型FiboASR

    7月,全球领先的无线通信模组及AI解决方案提供商广和通,发布其自主研发的语音识别大模型FiboASR。该模型专为端侧设备上面临的面对面实时对话及多人会议场景深度优化,在低延迟语音交互、实时语音转录
    的头像 发表于 08-04 11:43 1372次阅读

    直播预告|与往届紫光同创国一选手面对面交流参赛经验

    再说一遍:2025年3月17日周一晚1900B站UP主“小眼睛半导体”直播间与2024集创赛紫光同创杯国一选手面对面交流参赛及获奖经验哦有任何疑问联系微信客服:17665247134原文标题:直播
    的头像 发表于 04-14 09:53 342次阅读
    直播预告|与往届紫光同创国一选手<b class='flag-5'>面对面</b>交流参赛经验

    单次、多次对话与RTC对话AI交互模式,如何各显神通?

    在这个充满无限可能的AI时代,这些奇妙场景正逐步走进我们的生活。可曾想象过,有一天家里的智能设备会化身相声演员,和你幽默对答?或者,的玩具能像知心好友一样,陪你畅聊心事?单次对话
    的头像 发表于 04-02 18:18 1927次阅读
    单次、多次<b class='flag-5'>对话</b>与RTC<b class='flag-5'>对话</b>AI交互模式,如何各显神通?

    能和Ai-M61模组对话了?手搓一个ChatGPT 语音助手

    起猛了, 安信可的Ai-M61模组能说话了! 超低延迟实时秒回 ,对话超丝滑的那种,先来看一段VCR: 小安派+ChatGPT语音实测:对话丝滑到忘记对面是AI_ 人工智能的应用日益广泛。 各家模型
    的头像 发表于 03-12 11:57 1w次阅读
    能和Ai-M61模组<b class='flag-5'>对话</b>了?手搓一个ChatGPT 语音助手

    摩尔线程Round Attention优化AI对话

    摩尔线程科研团队发布研究成果《Round Attention:以轮次块稀疏性开辟多轮对话优化新范式》,该方法端到端延迟低于现在主流的Flash Attention推理引擎,kv-cache 显存占用节省55%到82% 。
    的头像 发表于 03-06 09:39 897次阅读
    摩尔线程Round Attention优化AI<b class='flag-5'>对话</b>

    HarmonyOS NEXT 原生应用开发:社交聊天对话过程实现

    一、实现思路 本DEMO旨在展示如何在HarmonyOS NEXT平台上,利用ArkTS开发语言构建一个简易的社交聊天对话界面。用户可以在此界面上查看聊天记录,并发送新的消息。此示例中,聊天记录
    发表于 01-07 10:55

    HarmonyOS NEXT 应用开发练习:AI智能对话

    一、练习内容 在这个HarmonyOS NEXT原生应用DEMO中,我们将使用ArkTS开发语言创建一个功能更为丰富的AI智能对话框。这个对话框不仅具备基本的聊天功能,还能展示图片消息、表情符号,并
    发表于 01-03 11:29

    TIKOOL太酷信息无线内部通话系统允许多个人一起讲话,频道内会不会很吵?

    传统的对讲机声音采样率普遍是4K,音质差,往往音量大但稍有干扰就听不清内容;TIKOOL太酷无线内部通话系统音频采样率可达16K,音质数倍的提升,具备极高的声音还原度,如同面对面聊天,多人讲话也不会
    发表于 12-18 09:07