0
  • 聊天消息
  • 系统消息
  • 评论与回复
登录后你可以
  • 下载海量资料
  • 学习在线课程
  • 观看技术视频
  • 写文章/发帖/加入社区
创作中心

完善资料让更多小伙伴认识你,还能领取20积分哦,立即完善>

3天内不再提示

DeepMind推出的AlphaFold可以仅根据基因「代码」预测生成蛋白质的3D形状

KIyT_gh_211d74f 来源:lq 2018-12-05 15:51 次阅读

Alphabet(谷歌)旗下公司DeepMind的人工智能AlphaGo曾在国际象棋、围棋等项目中取得了超越人类的表现,其研究不仅震惊世界,也两次登上 Nature。如今,该公司已将人工智能技术应用到最具挑战性的科学研究问题中,其刚刚推出的 AlphaFold 可以仅根据基因「代码」预测生成蛋白质的 3D 形状。

DeepMind 表示,AlphaFold 是「该公司首个证明人工智能研究可以驱动和加速科学新发现的重要里程碑」。看来,人类医学研究要前进一步了。

2017 年 5 月,谷歌 DeepMind 人工智能项目 AlphaGo(执棋者:黄士杰博士)对战当时世界第一的围棋选手柯洁。

周日,在墨西哥坎昆举办的一场国际会议中,DeepMind 的最新 AI——AlphaFold 在一项极其困难的任务中击败了所有对手,成功地根据基因序列预测出蛋白质的 3D 形状。

「蛋白质折叠」是一种令人难以置信的分子折叠形式,科学界以外很少有人讨论,但却是一个非常重要的问题。生物由蛋白质构成,生物体功能由蛋白质形状决定。理解蛋白质的折叠方式可以帮助研究人员走进科学和医学研究的新纪元。

「对于我们来说,这真的是一个关键时刻,」DeepMind 联合创始人兼 CEODemis Hassabis表示,「这个项目就像灯塔,这是我们关于人和资源的首次重大投资,用于解决一个根本性的、现实世界的重要问题。」

在 2016 年 AlphaGo 击败李世乭后,DeepMind 就开始将目光转向蛋白质折叠。尽管实践证明,游戏是 DeepMind AI 项目的优秀试验场,但在游戏中取得高分并非他们的终极目标。「我们的目标从来就不是赢得围棋或雅达利比赛的胜利,而是开发能够解决蛋白质折叠这类问题的算法,」Hassabis 表示。

为什么要预测蛋白质结构

人体能够产生数万甚至数百万的蛋白质。每个蛋白质都是一个氨基酸链,而后者的类型就有 20 种。蛋白质可以在氨基酸之间扭曲、折叠,因此一种含有数百个氨基酸的蛋白质有可能呈现出数量惊人(10 的 300 次方)的结构类型。

蛋白质的 3D 形状取决于其中包含的氨基酸数量和类型,而这一形状也决定了其在人体中的功能。例如,心脏细胞蛋白质的折叠方式可以使血流中的任何肾上腺素都粘在它们上面,以加速心率。免疫系统中的抗体是折叠成特定形状的蛋白质,以锁定入侵者。几乎身体的每一种功能——从收缩肌肉和感受光线到将食物转化为能量——都和蛋白质的形状及运动相关。

通常情况下,蛋白质会呈现出能量效率最高的任何形状,但它们可能会纠缠在一起或者折叠错误,导致糖尿病、帕金森和阿茨海默症等疾病。如果科学家可以根据蛋白质的化学构成来预测其形状,他们就能知道它是做什么的,会如何出错并造成伤害,并设计新的蛋白质来对抗疾病或履行其它职责,比如分解环境中的塑料污染。

AI 如何改变研究方法?

正因为蛋白质的结构如此重要,在过去的五十年中,科学家已经能使用低温电子显微镜和核磁共振等实验技术确定蛋白质的形状,但是每一种方法都依赖大量的试验与误差反馈,每种结构可能需要花费数万美元、历时数年进行研究。因此生物学家转攻 AI 方法,以完成这一困难且单调的过程。

幸运的是,由于基因测序成本快速降低,基因组领域的数据非常丰富。因此在过去几年中,依赖于基因组数据的预测问题正越来越多地借助深度学习方法。DeepMind 非常关注这一问题,并提出了 AlphaFold,这一项工作目前已经提交到了Critical Assessment of Structure Prediction (CASP)。

DeepMind 用 AlphaFold 参加了 CASP,这是一年两次的蛋白质折叠奥运会,吸引了来自世界各地的研究小组。比赛的目的是根据氨基酸列表来预测蛋白质的结构,这些氨基酸列表会在几个月内每隔几天发送给参赛团队。这些蛋白质的结构最近已经通过费力又费钱的传统方法破解,但还没有公开。提交最准确预测的团队将获胜。

尽管是首次参加比赛,AlphaFold 就在 98 名参赛者中名列榜首,准确地从 43 种蛋白质中预测出了 25 种蛋白质的结构。而同组比赛中获得第二名的参赛者仅准确预测出了 3 种。值得一提的是,AlphaFold 关注从头开始建模目标形状,且并不使用先前已经解析的蛋白质作为模板。AlphaFold 在预测蛋白质结构的物理性质上达到了高度的准确性,然后基于这些预测可以使用两种不同的方法预测构建完整的蛋白质结构。

使用神经网络预测物理属性

AlphaFold 构建的模型都依赖深度神经网络,这些经过训练的神经网络可以从基因序列中预测蛋白质的属性。DeepMind 的研究人员表示,神经网络预测的蛋白质属性主要有:(a)氨基酸对之间的距离;(b)连接这些氨基酸的化学键及它们之间的角度。这些方法的首要进步就是对常用技术的提升,它们可以估计氨基酸对是否彼此接近。

为了构建 AlphaFold,DeepMind 在数千已知的蛋白质上训练了一个神经网络,直到它可以仅凭氨基酸预测蛋白质的 3D 结构。给定一种新的蛋白质,AlphaFold 利用神经网络来预测氨基酸对之间的距离,以及连接它们的化学键之间的角度。接着,AlphaFold 调整初步结构以找到能效最高的排列。该项目花了两周时间来预测其第一个蛋白质结构,但现在几小时内就可以完成了。

根据神经网络预测的两种物理属性,DeepMind 还训练了一个神经网络以预测蛋白质成对残基(residues)之间距离的独立分布,这些概率能组合成估计蛋白质结构准确率的评分。此外,DeepMind 还训练了另一个独立的神经网络,该网络使用集群中的所有距离来估计预测的结构与实际结构之间的差距。

预测蛋白质结构的新方法

这些评分函数可以用来探索蛋白质内部,以找到与预测匹配的结构。DeepMind 的第一种方法建立在结构生物学的常用技术上,用新的蛋白质片段反复替换蛋白质整体结构的某个部分。他们训练了一个生成神经网络来创造新的片段,这些片段被用来不断提高蛋白质结构的评分。

先通过神经网络预测氨基酸之间的距离和化学键角度,然后再根据两种物理属性对结构进行评分,最后通过梯度下降优化评分。

第二种方法是通过梯度下降来优化评分,得到的结构高度精确。梯度优化被用在整个蛋白质链,而不是组装前必须单独折叠的片段,这种做法降低了预测过程的复杂性。

未来可期

首次涉足蛋白质折叠领域的成功表明,机器学习系统可以整合各种信息来源,帮助科学家快速找到各种复杂问题的创造性解决方案。人工智能已经通过 AlphaGo 和 AlphaZero 等系统掌握了复杂的游戏,与此类似,利用人工智能攻克基本科学问题的未来同样可期。

雷丁大学的研究人员 Liam McGuffin 在比赛中带领得分最高的英国学术团体。他表示,「DeepMind 今年似乎取得了更大的进展,我想进一步了解他们的方法。我们的资源并不充足,但我们仍然有很强的竞争力。」

「预测蛋白质折叠形状非常重要,对解决很多世纪难题有重大影响。这种能力可以影响健康、生态、环境,基本上可以解决任何涉及生命系统的问题。」

「包括我们在内的很多团队几年来一直都在使用基于机器学习的方法,而深度学习和人工智能的进步似乎也产生了越来越重要的影响。我对这个领域很乐观,我觉得我们会在 21 世纪 20 年代真正解决这个问题。」McGuffin 表示。

Hassabis 也表示还有很多工作要做。「我们还没有解决蛋白质折叠问题,目前只是迈出了第一步。这是一个极具有挑战性的问题,但我们有一个良好的体系,还有很多想法尚未付诸实践。」

蛋白质折叠的早期进展令人兴奋,它证明了人工智能对科学发现的效用。尽管在能够对疾病治疗、环境管理等方面产生量化影响之前,我们还有很多工作要做,但我们知道人工智能的潜力是巨大的。在一个专注于研究机器学习如何推进科学发展的专业团队的努力下,我们期待看到技术能够有所作为。

声明:本文内容及配图由入驻作者撰写或者入驻合作网站授权转载。文章观点仅代表作者本人,不代表电子发烧友网立场。文章及其配图仅供工程师学习之用,如有内容侵权或者其他违规问题,请联系本站处理。 举报投诉
  • 人工智能
    +关注

    关注

    1776

    文章

    43796

    浏览量

    230570
  • DeepMind
    +关注

    关注

    0

    文章

    126

    浏览量

    10709

原文标题:AlphaGo之后,DeepMind重磅推出AlphaFold:基因序列预测蛋白质结构

文章出处:【微信号:gh_211d74f707ff,微信公众号:重庆人工智能】欢迎添加关注!文章转载请注明出处。

收藏 人收藏

    评论

    相关推荐

    洪亮团队在生信期刊JCIM发布最新成果,蛋白质工程迈入通用人工智能时代

    )上发表最新研究成果:“基于微环境感知图神经网络构建指导蛋白质定向进化的通用人工智能”(Protein Engineering with Lightweight Graph Denoising Neural
    的头像 发表于 04-19 17:42 103次阅读
    洪亮团队在生信期刊JCIM发布最新成果,<b class='flag-5'>蛋白质</b>工程迈入通用人工智能时代

    天府锦城实验室在生物传感与蛋白质测序领域取得重要进展

    3月10日,记者从天府锦城实验室(未来医学城)获悉,四川大学华西医院临床检验医学研究中心与生物治疗全国重点实验室、天府锦城实验室(未来医学城)耿佳教授和华西第二医院陈路教授联合团队在生物传感与蛋白质测序领域取得重要进展。
    的头像 发表于 03-17 09:10 519次阅读
    天府锦城实验室在生物传感与<b class='flag-5'>蛋白质</b>测序领域取得重要进展

    对新辅助TCHP治疗响应的HER2+乳腺癌空间蛋白质组特征

    GeoMx IPA可以实现对组织中任何区域(如肿瘤区域、免疫交界区域、肿瘤微环境和正常基质区域等)中的570多种蛋白质进行空间原位的表达检测,快速发现新的蛋白质生物标记物和药物靶点。
    的头像 发表于 12-26 16:52 416次阅读
    对新辅助TCHP治疗响应的HER2+乳腺癌空间<b class='flag-5'>蛋白质</b>组特征

    人工智能驱动蛋白质设计取得重大突破,人类健康和环境监测有望受益

     据华盛顿大学化学与生物工程系的David Baker教授透露,其领导的研究小组整合了深度学习算法和序列设计工具ProteinMPNN,从而实现了高效的蛋白质功能性设计。
    的头像 发表于 12-20 14:32 331次阅读

    双水相电泳分离蛋白质的研究

      本文提出了一种新型的双水相电泳装1并进行了双水相电泳分离肌红蛋白和牛血清白蛋白和细胞色素C及其混合物的实验,研究了电场方向、pH值、电场强度和电泳时间对双水相萃取分离效果的影响,并与不加电场的双水相萃取的结果进行了比较。
    发表于 11-28 14:46 0次下载

    DeepMind最新推出新一代蛋白质结构预测工具,已用于药物设计

    据悉,最新的 AlphaFold 系统由DeepMind及其衍生公司 Isomorphic Labs (专注于利用 AI 做药物发现)共同开发,不再局限于蛋白质折叠,还能够在配体、蛋白质
    的头像 发表于 11-03 15:39 450次阅读

    数智领航:绘制蛋白质行业新型“未来工厂”蓝图

    近年来,随着消费者愈发聚焦食品安全、个性口味、高品质肉类等需求,蛋白质行业拥抱着更大的市场机遇的同时,也面临了更多 产品追溯、柔性生产 等挑战。 在某全球蛋白质行业领军企业国内的新建工厂中,作为十年
    的头像 发表于 10-07 08:25 198次阅读

    如何利用光热泵贴片实现细胞内大分子定向传递?

    将外源性大分子(例如糖类、蛋白质基因等)传递到细胞和组织中近年来被用于细胞和基因治疗。
    的头像 发表于 09-11 10:13 702次阅读
    如何利用光热泵贴片实现细胞内大分子定向传递?

    基于精准聚焦目标空间区域的转录组和蛋白质组一站式解决方案

    。这些研究会帮助人类发现新的药物开发和疾病诊疗相关的靶点,新一代的分子病理产品等等。那么深度空间蛋白组+ GeoMx DSP这对CP能带来哪些惊喜?   让我们一起了解下【精准聚焦目标空间区域的转录组和蛋白质组一站式解决方案】
    的头像 发表于 08-29 11:10 591次阅读
    基于精准聚焦目标空间区域的转录组和<b class='flag-5'>蛋白质</b>组一站式解决方案

    光学3D表面轮廓仪可以测金属吗?

    测量金属制品的长度、宽度、高度等维度参数。 除了测量金属表面的形状和轮廓外,光学3D表面轮廓仪还可以生成三维点云数据和色彩图像,用于进一步分析和展示: 1、三维点云数据
    发表于 08-21 13:41

    预测超长蛋白质这事,CPU赢了

    AlphaFold2这类大型模型这件事上,大众普遍的认知可能就是堆GPU来进行大规模计算。 但其实从去年开始,CPU便开始苦练内功,使端到端的通量足足提升到了原来的23.11倍。 而现如今,CPU让这个数值great again—— 再次提升3.02倍 ! 不论是像抗菌肽这种较短的氨基酸序列,还是像亨氏综
    的头像 发表于 07-08 14:15 194次阅读
    <b class='flag-5'>预测</b>超长<b class='flag-5'>蛋白质</b>这事,CPU赢了

    【AI简报20230707】中国团队推出「全球首颗」AI 全自动设计 CPU!重磅,GPT-4 API 全面开放使用!

    /s/DNBO34Xk2nVwNiEMBjJ-Cg 在这场由 ChatGPT 掀起的 AI 热潮下,越来越多人开始看到如今 AI 的强悍:AI 作图、AI 写论文、AI 编代码、AI 预测完整人类蛋白质组结构、AI 发现速度提升
    的头像 发表于 07-07 18:45 869次阅读
    【AI简报20230707】中国团队<b class='flag-5'>推出</b>「全球首颗」AI 全自动设计 CPU!重磅,GPT-4 API 全面开放使用!

    LasergeneProtein工作流程

    蛋白质序列分析对于研究和预测蛋白质功能和结构至关重要,但蛋白质序列分析工具通常缺乏解释所需的可视化组件,或者需要额外的工具进行下游分析。Protean3D 中提供的
    的头像 发表于 07-03 10:30 426次阅读
    LasergeneProtein工作流程

    通过石墨烯生物传感器同时检测蛋白质和RNA生物信号

    了Cardea Bio),通过在单个基于石墨烯的生物传感器上同时检测蛋白质和RNA生物信号,展示了新的多组学(Multiomics)方法。
    的头像 发表于 06-18 09:20 1107次阅读

    第一个用于电路的基于蛋白质的纳米计算代理

    在该实验中,研究组将工学蛋白质注入到活细胞中,使细胞暴露在刺激下。以前需要两个输入才能产生一个输出,但是新的设计现在可以有两个输出,输出取决于接收输入的顺序。如果先检测出雷帕霉素,再检测出光,细胞就会采取一个方向角度。
    的头像 发表于 05-31 09:27 538次阅读