电子发烧友网 > 人工智能 > 正文

怎样让人工智能模型快速的忘记你

2020年04月05日 21:58 次阅读

隐私,在这个时代早已是伪命题。

为了在一定程度上重建隐私保障,近期一系列立法举措(包括欧洲的〈通用数据保护条例〉以及美国的〈加利福尼亚州消费者隐私法〉)对于清除个人信息做出了相关规定。但是,要想让经过训练的AI模型“忘记你”,传统的方法,只能是从零开始利用新数据进行重新训练——整个过程可能耗时数周,且成本相当高昂。

怎样让人工智能模型快速的忘记你

最近新发表的两篇论文,带来了高效从AI模型中删除记录的方法,有望节约巨量能源并真正为合规性带来保障,一篇来自斯坦福大学,另一篇(预印本)来自多伦多大学。斯坦福大学计算机科学家、第一篇论文的联合作者Melody Guan表示,“我们似乎需要一些新的算法,来简化企业之间的实际合作,确保实现难度不会成为他们违反隐私规定的借口。”

由于关于高效数据删除的文献非常有限,因此斯坦福大学的作者们首先对问题做出明确定义,并提出有助于缓解问题的四项设计原则:

第一项原则为“线性度”:简单的AI模型只需要对数字进行加法与乘法运算,这就避免了所谓非线性数学函数的介入,保证步骤分解更加简单易行;

第二项则是“惰性”原则,尽可能推迟计算操作,除非确实需要做出预测;

第三项为“模块化”:如果可能,尽量以可拆分的形式进行模型训练,而后组合结果;

第四项是“量化”,即只要平均值能够定在特定的离散区间之内,则删除其中对于平均值结果影响不大的数值。

斯坦福大学的研究人员们将其中两项原则应用到一种名为k均值聚类的机器学习算法当中。此算法用于将数据点分类为自然聚类,例如用于分析密切相关的种群之间的遗传性差异。(在UK Biobank医学数据库中,该聚类算法已经得到实际应用。而且有部分患者已经向数据库作者提出通告,要求将自己的记录从数据库中删除。)研究人员利用量化技术开发出一种Qk均值算法,并立足六套数据集进行了测试,分别对单元格类型、手写数字、手势、森林覆盖率以及联网设备黑客入侵情况进行分类。他们在每组数据集内各删除1000个数据点,每次1个。结果证明,Q-k均值算法的速度达到常规k均值算法的2倍到584倍,且准确性几乎没有任何损失。

利用模块化方法,他们又开发出DC-k均值(用于实现分治法)。数据中的各个点被随机划分为多个子集,且各个子集将独立进行聚类。接下来,再将这些子集构成新的集群,依此类推。事实证明,从单一子集内删除一个点,并不会影响到其他子集的结果。新算法的加速水平在16倍到71倍之间,且准确性同样几乎不受影响。该项研究被发表在上个月的加拿大温哥华神经信息处理系统(NerulPS)大会上。

多伦多大学以及Vector研究院计算机科学家Nicolas Papernot指出,“这篇论文中的亮点,在于利用算法中的某些基本面(k均值聚类)完成了以往无法实现的目标。”但是,其中某些方法在其他算法类型中无法确切起效,例如在深度学习中使用的人工神经网络。上个月,Paernot以及其他联合作者在网站arXiv上发表一篇论文,提到一种适用于神经网络的训练方法,名为SISA(分片、隔离、切片以及聚合)训练。

这种新方法采取两种不同的模块化实现方式。首先,在分片部分中将数据集划分成多个子集,并立足每套模型建立独立的训练模型副本。当需要进行预测时,各模型的预测结果将被汇总为统一的整体。利用这种方式,删除数据点时,我们只需要重新训练其中一套模型。第二种方法则是切片,即对各个子集做出进一步细分。该子集的模型会首先在切片1上训练,而后同时在切片1与切片2上训练,接下来在切片1、切片2以及切片3上训练,依此类推。最后,在完成各个步骤后对训练完成的模型进行归档。如此一来,如果删除切片3中的数据点,则可快速返回至训练的第三步中,并以此为起点继续训练。Papernot表示,分片与切片方法“相当于为我们的模型训练流程提供了两个调整旋钮。”Guan也称赞称,这种方法“非常直观”,只是“使用的记录删除标准还不够严格。”

来自多伦多的研究人员们通过两套大型数据集训练神经网络,希望测试这种方法。其中一套数据集包含超过60万张与家庭住址编码相关的图像,另一套则包含30多万条购买历史记录。他们从各个数据集中删除0.001%的数据量,而后重新训练,并发现分片技术(20个分片)使得地址相关任务的重新训练速度提高 了3.75倍,购买记录相关任务的重新训练速度提高 8.31倍(与标准模型重新训练方法比较),而且几乎不会对准确度造成影响。在配合切片方法之后,地址相关任务的速度进一步提高 了18%,购买记录相关任务的速度提高 43%,准确度同样没有降低。

公开发布的数据显示,仅删除0.001%的数据似乎太过温和,但Papernot表示谷歌搜索等服务的重新训练规模要比这个数字还低出几个量级。另外,18%的速度提升看似有限,但对于大型机使用场景来讲,已经能够节约海量时间与金钱。另外,在某些情况下,我们也许能够发现某些更有必要忽略的数据点——例如来自少数族裔或者患有特定疾病的人群,确保他们免受隐私侵犯的影响。将这些数据点集中起来,将进一步提高删除效果。Papernot表示,他们也在积极整理数据集知识,希望进一步提高SISA方法的定制化水平。

Guan解释道,某些AI方法虽然在设计上就考虑到隐私性要求,但有时候使用者仍然需要删除其中的某些特定数据点。举例来说,有些人可能不想把自己的数据交给某家声名狼藉的企业,科学家们有时候也可能需要删除引发问题的数据点(例如黑客用来「毒化」数据集的伪造记录)。无论是哪一种情况,对AI模型中的数据进行删除都将成为一种必要的手段。

Guan总结道,“很明显,我们还没有构建起完整的解决方案。但我们认为对问题做出明确定义,是解决问题的重要前提。希望人们能够在算法设计之初,就充分考虑到数据保护方面的需求。”

责任编辑:ct

下载发烧友APP

打造属于您的人脉电子圈

关注电子发烧友微信

有趣有料的资讯及技术干货

关注发烧友课堂

锁定最新课程活动及技术直播

电子发烧友观察

一线报道 · 深度观察 · 最新资讯
收藏 人收藏
分享:

评论

相关推荐

【5月12】不懂编程没关系,邀请您来学AI

不懂编程没关系,邀请您来学AI活动概述:本活动是现场讲座,由台湾知名AI教育专家、金门创新学院院长、台湾Android技
发烧友学院发表于 2019-05-24 00:00 2389次阅读
【5月12】不懂编程没关系,邀请您来学AI

人工智能对于销售行业有什么影响

人工智能和机器学习现在很容易采用,并且人们也知道可以使现在执行的许多重复性任务和过程实现自动化。
发表于 2020-04-05 21:57 0次阅读
人工智能对于销售行业有什么影响

人工智能和金融行业没有关系?

人工智能通过对金融财务数据和投资者相关风险的分析,可以判断用户处于的潜在风险类别。
发表于 2020-04-05 21:56 0次阅读
人工智能和金融行业没有关系?

机器学习可以准确的预测股市?

机器学习是一种数据分析技术,它可以借鉴使用计算数据的经验,直接从数据中“学习”信息,而无需依赖预先确....
发表于 2020-04-05 21:53 5次阅读
机器学习可以准确的预测股市?

统计学对于机器学习有什么作用

统计学和机器学习是两个密切相关的领域。实际上,两者之间的界限有时可能非常模糊。
发表于 2020-04-05 21:51 6次阅读
统计学对于机器学习有什么作用

怎样的人工智能系统适合城市战环境

美国陆军开展的主要工作是寻找能够成功分析与人认知和行为相关的主观性判断方法,如识别言语模式或与人过往....
发表于 2020-04-05 21:50 12次阅读
怎样的人工智能系统适合城市战环境

人工智能对数据中心有什么影响

人工智能在汽车、制造、医疗和国防行业的应用将最为广泛;数据中心和云计算基础设施将成为人工智能训练的主....
发表于 2020-04-05 21:47 18次阅读
人工智能对数据中心有什么影响

web前端可以在AI时代做一些什么

人工智能是计算机科学的一个分支,它企图了解智能的实质,并生产出一种新的能以人类智能相似的方式做出反应....
发表于 2020-04-05 21:45 6次阅读
web前端可以在AI时代做一些什么

人工智能怎样应对网络欺骗

人工智能分析过去的行为,并使用该信息来评估其正在尝试进行的当前交易的风险。
发表于 2020-04-05 21:45 17次阅读
人工智能怎样应对网络欺骗

人工智能如何让景区拥有智慧

随着5G、人工智能、物联网等技术逐渐成熟,智慧景区成了又一落地应用场景,各地旅游区开始加快智慧景区建....
发表于 2020-04-05 21:42 16次阅读
人工智能如何让景区拥有智慧

人工智能以后会如何影响教育行业

众所周知,人工智能正在改变人类社会的方方面面,无论是自动停车系统、移动支付、社交媒体订阅还是我们每天....
发表于 2020-04-05 21:42 5次阅读
人工智能以后会如何影响教育行业

人工智能什么误区你可能会相信

总而言之,过早地采用人工智能可能会很有趣,就像人们在数据中心消亡之前就试图将其埋葬一样。
发表于 2020-04-05 21:36 6次阅读
人工智能什么误区你可能会相信

人工智能数据存储的选择有哪些准则

企业选择错误的人工智能存储平台可能会产生严重影响。因此,人们需要了解可能影响企业选择人工智能数据存储....
发表于 2020-04-05 21:27 27次阅读
人工智能数据存储的选择有哪些准则

大规模存储基础设施对于AI有着怎样的要求

人工智能/机器学习环境创建使用内部或直接连接存储(DAS)的计算服务器集群的情况并不少见。
发表于 2020-04-05 21:23 20次阅读
大规模存储基础设施对于AI有着怎样的要求

哪一些行业需要人工智能带来颠覆

以消费者为中心的人工智能和自动化应用正在帮助消除一些公众的误解,即这些技术只会对企业有益,而对就业和....
发表于 2020-04-05 21:12 59次阅读
哪一些行业需要人工智能带来颠覆

机器设计会受到AI技术的影响吗

人工智能如今应用越来越广泛。在大多数情况下,健壮和自适应的人工智能可以为人类的专业知识提供补充,而不....
发表于 2020-04-05 21:09 9次阅读
机器设计会受到AI技术的影响吗

人工智能真的可以和人类一样学习吗

随着企业将人工智能集成到自己的系统中,科技人员将目光投向了人工智能创新的新领域。
发表于 2020-04-05 21:04 59次阅读
人工智能真的可以和人类一样学习吗

为什么要采用人工智能技术

人工智能能够为企业提供更好、更清晰的视野,从而根据客户需求塑造服务和产品。
发表于 2020-04-05 20:58 61次阅读
为什么要采用人工智能技术

不止是5G技术,AI和Wi-Fi6也将推动家庭网...

机器学习、AI和Wi-Fi 6的结合,将为服务提供商带来前所未有的能力,从而推动家庭Wi-Fi网络市....
发表于 2020-04-05 19:34 144次阅读
不止是5G技术,AI和Wi-Fi6也将推动家庭网...

科技改变生活,OE物联网创造新奇迹

10年前,智能手机、数码产品、互联网、数字经济衍生产业还没有形成现在规模,2G还在向3G迭代,但人们....
发表于 2020-04-05 19:06 160次阅读
科技改变生活,OE物联网创造新奇迹

华为云宣布启动全球抗疫行动 将免费开放AI医疗服...

4月3日下午消息,华为云宣布启动全球抗疫行动,用云计算和AI等技术,携手伙伴帮助全球客户共克时艰。本....
发表于 2020-04-03 17:04 184次阅读
华为云宣布启动全球抗疫行动 将免费开放AI医疗服...

多云和AI时代下的新运维,新华三展示“1+1+1...

以“双态IT 数智前行”为主题的第三届双态IT北京用户大会在北京圆满落幕,作为高科技企业代表,紫光旗....
发表于 2020-04-03 17:01 238次阅读
多云和AI时代下的新运维,新华三展示“1+1+1...

IoT技术可以检测病毒?

一种实时跟踪咳嗽和人群规模的物联网设备可能会成为一种有用的工具,用于在大批人群中识别流感样症状。
发表于 2020-04-03 16:59 102次阅读
IoT技术可以检测病毒?

AI数据服务野蛮生长后是怎样的

随着科技技术不断更新迭代,企业变革的方向已由信息化向智能化发展,而在此过程中,如何获取数据成为最重要....
发表于 2020-04-03 16:40 215次阅读
AI数据服务野蛮生长后是怎样的

产业链上下互联互通“三化”战略助力煤炭产业智能化...

4月3日消息,针对煤炭产业的智能化发展需求,找煤网推出了“通过互联网化助推行业交易效率;通过信息化作....
发表于 2020-04-03 16:29 239次阅读
产业链上下互联互通“三化”战略助力煤炭产业智能化...

人工智能如何显示自己的神通

疫情发生以来,企业的生存与发展成为全社会关注的问题。对于大多数企业来说,如何在疫情中变被动为主动,能....
发表于 2020-04-03 16:19 59次阅读
人工智能如何显示自己的神通

在物联网和人工智能的冲击下,嵌入式的前景将会如何

过去的几年里,人工智能(AI)与物联网(IoT)无疑是电子信息行业最热门的话题和关注点。
发表于 2020-04-03 16:18 138次阅读
在物联网和人工智能的冲击下,嵌入式的前景将会如何

人工智能有可能冲击国际安全吗

演进派则认为人工智能更应被看作是武器的“放大器”,其作为武器本身并不是直接引发国际安全范式性变革的主....
发表于 2020-04-03 16:07 43次阅读
人工智能有可能冲击国际安全吗

大数据+AI 的准确性怎么样

针对疫情防控,科大讯飞用人工智能辅助医疗构建基层疫情防线,利用“智医助理”进行病历分析筛查潜在高危患....
发表于 2020-04-03 16:02 37次阅读
大数据+AI 的准确性怎么样

谷歌Art Transfer工具将照片转换

随着机器学习和人工智能技术的发展,搜索巨头谷歌已经将自家研究成果应用于方方面面。比如近日推出的一款名....
发表于 2020-04-03 15:55 174次阅读
谷歌Art Transfer工具将照片转换

人工智能助力新药研发,它的优势是什么

近日,一家英国初创公司表示,该公司成功使用人工智技术开发出了一款药物。据悉,这款借助人工智能而开发的....
发表于 2020-04-03 15:52 159次阅读
人工智能助力新药研发,它的优势是什么

人工智能技术怎样升级

不管是VR逛展或看房能够带来多么真实的体验,还是各式机器人灵活强大的功能,非接触式服务的兴起依靠的是....
发表于 2020-04-03 15:50 79次阅读
人工智能技术怎样升级

阿里云成功打破Google纪录 可提供全球最快A...

近日,斯坦福大学公布了最新的DAWNBench深度学习榜单,阿里云表现惊艳,打破了Google等企业....
发表于 2020-04-03 15:44 366次阅读
阿里云成功打破Google纪录 可提供全球最快A...

人工智能技术如何控制水下机器人

爱丁堡机器人中心提供机器人平台和基于深度强化学习的算法框架指导,沈自所面向机器人平台特点进一步深入进....
发表于 2020-04-03 15:44 43次阅读
人工智能技术如何控制水下机器人

AI赋能新客服可以强化什么

随着“新基建”的提出,给中国的科技发展带来新的发展机遇,人工智能基础设施面临全面升级。
发表于 2020-04-03 15:36 29次阅读
AI赋能新客服可以强化什么

人工智能拓展的领域有哪一些

人工智能是一门贯穿性的综合学科,主要包含计算机、控制论、信息论、神经生理学、语言学,人工智能是从计算....
发表于 2020-04-03 15:33 39次阅读
人工智能拓展的领域有哪一些

人工智能主要在哪一些场景出现

深度学习作为人工智能领域的一个应用分支,不管是从市面上公司的数量还是投资人投资喜好的角度来说,都是一....
发表于 2020-04-03 15:30 30次阅读
人工智能主要在哪一些场景出现

混合方案部署AI / ML并为其提供合理的布线方...

在互联网上通常有这样的一句话:“知识告诉你说应该把鸡蛋放进篮子,智慧则是叫你不要把所有鸡蛋都放进一个....
发表于 2020-04-03 15:26 270次阅读
混合方案部署AI / ML并为其提供合理的布线方...

你有没有发现你身边的人工智能

人工智能是计算机科学的一个分支,它企图了解智能的实质,并生产出一种新的能以人类智能相似的方式做出反应....
发表于 2020-04-03 15:24 30次阅读
你有没有发现你身边的人工智能

康宁光通信与Citadel Analytics展...

人工智能和机器学习正在不断发展,并为采用者带来收益和效率。为此,康宁光通信与达拉斯的Citadel ....
发表于 2020-04-03 15:22 47次阅读
康宁光通信与Citadel Analytics展...

传统产业如何快速驶入数字化新基建,中琛源多重优势...

从传统的“铁公基”,到如今涉及5G、特高压、城际高速铁路和城市轨道交通、新能源汽车充电桩、大数据中心....
发表于 2020-04-03 15:21 147次阅读
传统产业如何快速驶入数字化新基建,中琛源多重优势...

如何让AI走上“高速”

随着国家加速新基建的步伐,人工智能企业即将进入发展的快车道,安顿将直接受益于5G、大数据中心、人工智....
发表于 2020-04-03 15:18 12次阅读
如何让AI走上“高速”

宜家收购Geomagical Labs 拟使用A...

我们知道,瑞典家具巨头宜家(IKEA)在适应影响其业务的技术创新方面一直是零售商的领导者之一。宜家曾....
发表于 2020-04-03 15:17 43次阅读
宜家收购Geomagical Labs 拟使用A...

人工智能产业进入哪里怎样的拐点

近期的AI领域处于震动与酝酿的时期,一些看似寻常的新闻线索,却隐含着不平凡的市场迹象。
发表于 2020-04-03 15:14 292次阅读
人工智能产业进入哪里怎样的拐点

周伯文:新基建浪潮下,建设需要超级平台承上启下

京东有几十亿的SKU,每天高效的送到用户手中,背后移动着各种维度的“比特”,而聪明的移动“比特”,可....
发表于 2020-04-03 15:12 259次阅读
周伯文:新基建浪潮下,建设需要超级平台承上启下

AI应用的落地还需要解决哪一些难题

人工智能的应用落地,需要市场、应用场景、各行各业海量的专业数据和专业人才的共同支持参与,这是人工智能....
发表于 2020-04-03 15:10 107次阅读
AI应用的落地还需要解决哪一些难题

【战疫专题】第五期:智慧物流,疫情之中显担当

2020年,新型冠状病毒席卷了整个中国,同时也在促进着产业的变革与生活变化。 电子发烧友在此期间推出【战疫专题】活...
发表于 2020-03-18 11:00 2095次阅读
【战疫专题】第五期:智慧物流,疫情之中显担当

人工智能、数据挖掘、机器学习和深度学习的关系

人工智能、数据挖掘、机器学习和深度学习之间,主要有什么关系?...
发表于 2020-03-16 11:35 98次阅读
人工智能、数据挖掘、机器学习和深度学习的关系

人工智能侦查有哪些应用

【人工智能侦查的应用领域】
发表于 2020-03-16 11:28 82次阅读
人工智能侦查有哪些应用

人工智能+边缘计算!米尔NXP工业级物联网板卡8M mini资料分享

响应行业应用和满足客户需求,米尔推出了基于NXP公司i.MX 8M Mini系列芯片的MYC-C8MMX系列核心板及开发...
发表于 2020-03-06 11:44 644次阅读
人工智能+边缘计算!米尔NXP工业级物联网板卡8M mini资料分享

红外传感+人工智能,智能机器人红外发送接收电路解析

该移动音乐机器人以英飞凌16 位单片机XE162FN 处理器为核心,英飞凌开发的16/32 位微控制器具有高度系统集成、无需...
发表于 2020-02-28 07:00 564次阅读
红外传感+人工智能,智能机器人红外发送接收电路解析

【战疫专题】第二期:硬核战“疫”,机器人大有可为

2020年,新型冠状病毒席卷了整个中国,同时也在促进着产业的变革与生活变化。 电子发烧友在此期间推出【战疫专题】活...
发表于 2020-02-25 14:24 5563次阅读
【战疫专题】第二期:硬核战“疫”,机器人大有可为

【瑞芯微RK1808计算棒试用体验】机械臂视觉快速识别

折腾了一个新年,总算勉强有点效果了,这个任务真是大坑啊,关键的识别部分没多大难度,但上位机、下位机、机械结构接...
发表于 2020-02-08 18:13 598次阅读
【瑞芯微RK1808计算棒试用体验】机械臂视觉快速识别

2020艾睿电子解决方案展示会

活动简介 艾睿电子解决方案展示会是艾睿电子自主主办的展会,也是每年一度的 ACT (Arrow Centralized Training...
发表于 2020-01-15 09:40 39026次阅读
2020艾睿电子解决方案展示会

内置NPU的Orange Pi 4B,你怎么看

提起单板电脑,树莓派基金会发布的树莓派系列开发板或许是最广为人知的,该公司坚持使用博通的SOC芯片,以实现不断...
发表于 2019-12-23 21:07 1062次阅读
内置NPU的Orange Pi 4B,你怎么看

串口屏应用案例-自助点餐系统

串口屏应用案例-自助点餐系统 自助点餐系统应景而生,彻底打破了传统,能够有效的减少排队使用的时间。在自助点餐机器...
发表于 2019-12-23 13:15 715次阅读
串口屏应用案例-自助点餐系统