AI资讯

苹果AI新模型SimpleDesign,直接设计蛋白质序列和结构

智能摘要

通过流匹配模型,根据氨基酸序列直接预测蛋白质三维结构。通过调整序列和结构的破坏程度,模型可以学习不同的蛋白质任务。研究人员还发现,该模型能够生成具有合理形态的蛋白质结构,生成的氨基酸序列整体质量与多数竞品多模态模型相当或更好。

这支苹果公司方才推出的蛋白质设计方向AI格外诱人: 能够同步生成序列搭配结构, 免去常规多环节训练路数。可它暂且未曾开展过实验佐证, 贴合实际用于病患用药还有漫长路程要走。

技术原理与传统方法的区别

早期的蛋白质设计工具大多得先把蛋白质结构转成离散的潜在表示然后训练自编码器、再处理这些中间产物还得训练生成模型, 这一过程需要多个步骤每一个环节都会损失部分信息。

苹果AI新模型SimpleDesign,直接设计蛋白质序列和结构

新模型行的是端到端路径, 直接在原始氨基酸序列和连续三维坐标处训练。省去中间转换, 在理论上能让模型学到更完整的资讯。这类做法更挨近人类明白蛋白质的直觉。

延续苹果此前的研究思路

苹果AI新模型SimpleDesign,直接设计蛋白质序列和结构

今年一月份, 苹果团队发布了名为ProteinMPNN的蛋白质结构预测模型, 它将流匹配方法根据氨基酸序列直接预测为三维结构, 这次的新工作把类似架构扩展到了设计任务。

设计任务比预测更难, 预测只该从序列到结构, 而设计要同时生成, 这样它们才能相互匹配, 模型得在序列和结构之间建立双向联系。

训练数据的来源和处理方式

苹果AI新模型SimpleDesign,直接设计蛋白质序列和结构

使用超过200多万组蛋白序列结构配对数据的团队, 其数据主要来自整合了AlphaFold数据库预测结构与其他样本、覆盖多种蛋白种类的AFESM数据集。

进行训练之际, 模型会对序列内的片段予以随机遮盖, 与此同时给匹配的三维结构添加噪声。依托管控两项要素的破坏水平, 能令模型习得各异的任务。遮盖程度越高, 训练难度就越大。

三种训练任务的灵活切换

苹果AI新模型SimpleDesign,直接设计蛋白质序列和结构

在序列基础完整、结构干扰颇为较大时, 模型执行类似折叠任务, 就据已知序列恢复结构。传统蛋白质预测的是方向。在结构相对完整、序列被大量遮盖之际, 模型执行逆 Fold 任务, 生成能形成所指定结构的氨基酸序列。

两类极端状况混配训练, 使模型能同步处理序列以及结构的关联信息。这类联合训练方式有望抬升设计的整体质量, 规避仅关注一方而忽视另一方的问题。

基准测试结果与实际表现的差距

论文里的计算机评估呈现代出, 模型于数项基准测试中拿到了具备竞争力的成果。生成的蛋白质结构形制吻合逻辑, 序列水平和多数多模态模型平齐或好在其以上。这类指标对算法探究工作者有借鉴价值。

但测试结果主要是来自算法层面的对比, 不涉及湿实验。目前还不清楚模型生成的蛋白质能否真正折叠成功, 能否在细胞内稳定存在, 是否具备预期生物功能, 这些都是后续必须回答的问题。

苹果AI新模型SimpleDesign,直接设计蛋白质序列和结构

对生物医药领域的潜在价值

蛋白质设计技术的推进变化有更改新药研发快慢速度的可能, 如果可以较快设计契合需要要求的蛋白质药物, 研发周期得以从好几年缩短至几个月, 这处在罕见病相应药物以及相关小众市场药品方面尤其有些意义。

不过这项技术距离临床应用还有很长的路子要走。研究人员要先验证生成蛋白质的稳定性、安全性与功能性, 再审慎考虑是否进入动物实验跟临床试验。每一个步骤都不能忽视。

你对这项专属于蛋白质设计领域的AI有什么深度看法? 它后期能真真切切在药物的研发流程中释放出多大实际价值? 特别欢迎各位在下方的评论区里畅快分享你的个人独有观点, 若完全认为这一专门围绕蛋白质生成的写文章内容可以切实帮到你的话, 可一定不要忘了随手进行点赞操作还有对外转发扩散的举动哦!

相关文章

OPPO陈明永谈AI不是替代人 是解决难题以人为本

AI资讯 # AI # CEO # OPPO