本字幕由TME AI技术生成
用声音碰撞世界
生动活泼
与全球创新第一时间同步
这里是科技早知道deep tach 深科技系列
我是雅贤
欢迎跟我一起探索最新最前沿的硬核科技与科技
Hello
大家好
我是雅贤
那我们今天呢
又是一期想要拓展生命科学认知边界的节目哈
This year bel prize in chemistry is about the chemical tools of life proteins
二零二四年的诺贝尔化学奖呢
是颁发给了蛋白质结构预测和蛋白质设计这个领域
那这也标志着ai 呢
已经成为了生命科学的核心工具
正在改变我们理解生命的方式
那也重塑了药物研发的未来
The number one thing i always wanted to do
With these coninn systems was protein voding was was totop of my line
那我们今天的嘉宾呢
是深圳湾实验室的周耀奇教授
他是这场革命的亲历者
也是推动者
他最初呢
在学术界是专注于蛋白质的结构预测
在阿尔法four 出来之前呀
做出了电击性的疗法
到二零一五年呢
将研究方向呢
转向了更具潜力的rna 结构预测方向
现在呢
他又走上了创业之路
带领团队开发以rna 为靶点的小分子药物
探索如何将基础的研究转化为突破性的疗法
那我们今天呢
就想与周耀奇老师一起来聊一聊阿尔法four three
它的突破和局限都在哪里
Rna 为什么成为新一代的药物靶点
以及ai 在新药研发中的作用究竟是什么
那我们在回顾阿尔法four 诞生的过程中呢
周老师聊到了不少技术细节
如果觉得枯燥的听友呢
也可以根据修notes 中的时间戳跳转到自己感兴趣的话题
好了
下面就是我们的节目啦
Hello
周老师好
张老师你好
大家好
我是深圳湾实验室系统与物理生物学研究所的资深研究员
叫周耀奇
二零二一年呢
加入的深圳湾实验室
在这个之前呢
我是印第安纳大学和澳大利亚格里菲斯大学的教授
我长期以来呢
一直从事这个机构生物信息学方面的研究啊
到了澳大利亚以后呢
开始把计算跟实验结合起来来研究这个蛋白质ra 的机构和工人
我和我的长期合作伙伴自然坚博士呢
在回国以前呢
一直想把这个前沿科学转化成真正的药物的
回国以后呢
我接触了一些国内充满活力的科创投资的生态环境
也亲眼看到了资本市场对咱们前沿生物制药方面的一个非常强烈的兴趣
所以呢
就跟自然博呢
一起创办了这个利波生物啊
希望呢
以我们拥有的这个这个差异化的把向rna 的这个创新技术呢
来解决一些还有没有满足这个临床需求
希望能够打开这个个药物开发的新局面吧
我看您这个学术履域
一开始你也是做的是蛋白质的这个结构预测
能不能跟我们说一说
你一开始是为什么决定进入这个蛋白质结构预测领领域
还有为什么我们需要这个预测它的结构
它对这个 呃
不管生命科学的基础研究或者说是药物研发都有一些哪些关键的作用呢
蛋白质呢
其实发现的时间很早
一八三八年左右就发现了
所以呢
长期以来
呃
所有的分子生物学效对蛋白质最感兴趣的
因为它在是我们身体里面呢啊
非常重要的一个一个分子机
它的结构和构造呢
就也就决定了它的功能了啊
比如说我们看见一张桌子啊
就知道这个平面呢
结构呢就是给我们放东西用的
蛋白质本身呢
就很像一串这个
呃
二十种那个乐高积木啊
不同的组合呢
它可以构建成非常不同的结构
这二十种这个乐高插件呢
被称之为所谓的氨基酸
非常奇妙
这些氨基酸啊
它组成这个蛋白质以后
在生理条件下
它自动的的组装折叠成一个三维结构
不同这个三维结构呢
就去执行不同的功能了啊
非常奇妙
其实代表是某种意义可以说是万能的
为什么它的万能呢
它的形状千变万化
光有记载的功能已经超过一万多种了
身体结构支撑啊
物质的因素啊
体温的维输啊
抵抗疾病啊等等等等
嗯
所以我们生命体的这个健康
生病衰老啊
无一不跟啊蛋白质这个密切相关的
所以要想搞清楚他是为什么会做这种事情
怎么做的
就必须把它这个结构给解析出来啊
过去几十年吧
咱们科学家就是依赖于非常昂贵的这个仪器啊
去要把蛋白质放到这个一百万倍
耗费这个呃
受万美金才能解析一个啊蛋白结构
现在全世界每年投入了几亿美金啊
也能解析差不多一万个呃主右的蛋白质机构
按照这个速度的话
可能还需要上千年啊
才能穷尽所有蛋白质的结构的
我们肯定不会去等几千年吧
所以怎么从这个蛋白质若高的插件也就是氨基酸的序列里面去推测它的结构和功能
这是长期困扰咱们科学家的一个蛋白质结构预测的一个问题
解决这个问题呢
也一直使这个计算生物学家这个梦讲
也是分子生物学的这个圣杯
因为呃
高精入机构预测的话
它是进行高效的这个药物设计和研发的一个基础
你在知道它蛋白质这个氨基酸排列的序列以后
它的结构是一定能被计算出来的嘛
原则上是这样的
就是当然有一些排列组合呢
它是不能形成结构的啊
这现在称之为就是说内在无序蛋白
那这些无序蛋白呢
它这个功能呢
又是不一样的功能
但是大多数做功能的代是依赖于机构来去干事情的
所以它必须要一个机构啊
才能干活吧
就像我们这个桌子一样
它没有这个平面
它也没法放松啊
一样的道理一样
呃
我觉得可能是从二零二四年阿尔法fod 拿了诺贝尔奖以后
感觉这个蛋白质结构预测一下就进入到大家的视野啊
但是据我所知
其实蛋白质结构预测它其实已经是有一个挺长的历史了
您刚才也说到其实是
呃
有很多代的结构生物学家一直前赴后继的想要解析大的结构
那能不能给我介绍一下
就是从蛋白质预测的这个角度
它大概经历了一些什么样的阶段
然后您当时的工作是怎么样参与到其中的呢
的确是这样的
就是代表机构预测一直是一个小众的科学
就是很多人认为这个领域啊
计算成为叫玩玩的一个游戏而已
觉得说比较大事情的
最早的代表机构是预测已经差不多是六十年代底跟七十年代初
他的预测方法就是说啊
用同一个家族的机构来作为模来预测的啊
什么意思呢
一个代白白它经常有
在很多动物里面有
比如说有些蛋白质在人身上有
狗身上有都有
假如你在人身上的那个蛋白质结构已经被测定的话
那狗身上的蛋白质呢
可以用人身上的蛋白质去模拟去预测的
这就所谓的基于模板的这个预测方法
你既然是做同样的功能
它的结构应该是类似的
你如果你结构一变的话
它没法作为一样的事情的
所以呢
这个方法还是挺合理的
却精确度也是挺高的
所以长期以来呢
这是精确度最高的方法
但是遗憾的是呢
就是说这个方法它应用范围很窄
只能说他已经某个家族里面已经有一个被机构被解析了
他才能干这个事情
但是绝大多数这个家族呢
我们对呃里边一个代表都没解析出来
那这个的话就就没法做了
在这种情况下就没有模板可用了
那怎么办呢
所以啊
所以科学家呢就想了一个办法
就把这个已知的代表的机构呢
去拆成一个小碎碎片
然后把未知结构的代白质序列呢
也拆成这个小的序列啊
这样的话
从短序列跟短的这个碎片去匹配
看看能够用短的碎片来作为一个模板来
然后再把这些小的模板给拼凑起来
这拼凑呢
就就比较麻烦了
这个拼凑呢
就需要一个打分函数
就是说或者说我们称之为能量函数
因为从物理上来讲
它是 呃
能量最低的状态
就是个最好的结构状态
所以的话
你需要设计一个能量函数
或者叫打分函数
去看怎么样一个组张
怎么样一个匹配
才能把这个碎片呢组装成一个三维结构
来实现这个构构预测
这个呢
相应来说长期以来呢
是一个主流的方向
但是呢
这个主流呢
它有一个问题
就是这方法进度的改进啊
非常非常之慢
在国外呢
有当时有一个国际蛋白质预测机构比赛
每隔两年呢
就所有这些方法就是去打分
看看谁的方法最好
嗯
是casasp 吗
唉 您说这个
对对
就是kasp 对
就是kasp 对
一百分呢
是满分
然后用这个基于碎平的方法呢
到了差不多二零一八年前呢
还在这个四十分左右啊
就是不及格了
就是每做了二十多年
每十年也就提供提高这么几分啊
如果按照这个速度去
要想达到九九十分的话
要差不多要两百年才能实现高精度的预测了
所以我们当年也加入这个行列吧
就是觉得啊
没什么希望
就是在我这个有生之年也许根本看不到这个成功的例子
所以我们团队刚开始呢
也是做基于模板的那个结构预测的
我们也发展了一个方法
叫做sparks
翻中文的话叫星火
二零零六年呢
在开始比赛中呢
也拿了个第一
呃
拿了个第一以后呢
其他组织经开始把玩的方法用到他们的方法上面去
所以也需要比较常用的一个方法吧
呃
在开发这个方法的过程中嘛
我发现如果已经知道这个蛋白质的二级结构的话
也就是说主列那个走像是什么样的
它可能是螺旋状呢
也可能线条状的
或者是没有什么规则的形状
如果我们能用人工智能来预测这个蛋白质的二级结构的话
一个模板的二级结构进行比较
这可以提高这个发现好的模板这个这个能力
所以呢
我们就就开始用人工智能来预测这个蛋白质的机构
那会儿的人工智能还不是我们今天说的这个人工智能是吧
对
还没有深度学习这么复杂
就是现在称之为浅度学习的方法
但后
后来很很快就注意到这个这个二级结构其实是很粗糙的一个分类啊
因为它就把它粗糙的分成什么啊
螺旋啊
线条啊
这个没有什么规则
这很人为的
这个几个状态之间也没什么边界
所以我们当时就想
为什么不就预预测这可以连续描述述个主主走向向的这个面角
这个二面角呢
就是说代代表着主链的话
就是氨基酸连接之后呢
它相邻两个平面直的夹角
因为剑长见角是固定的
所以这个主链的走向就三个二面角就可以搞定了
其中一个二面角是一个平面
所以呢
要么就是一百八十度
要么就是零度
所以有了这个两个二面角
就可以把这个整个主链的框架给搭起来了
一下子把这个变量就变少了
所以这个方法其实当时想想也是挺简单的
但是呢
后来发现这个角度预测不是那么容易
所以我们也奋得了好多年
所以角度的精确度呢
呃 一步步啊
变好变好
就是说零五零六年开始做的
零九年呢
就出现了一个我们做了一个很好的方法
能够比较准确的这个预测这个这个角度
然后预测这个角度以后呢
我们就可以构建这个呃
起始的三级结构了
然后把这个起始三结构加上我们刚才说的这个打分函数
或者是把预测的角度作为一个约缩优化来预测这样结构
我们就开创了一个新的方法
我们称之为不需要这个结构碎片的一个新方法
但这个新方法呢
在主流上没有被认可
因为刚开始做出来嘛
很多东西都没有优化
所以大家都也没怎么个注意到什么这个方法
但没想到十年以后呢
就是通过我们这个方法呢
通向了这个阿尔法f 务一跟阿尔法负二成为其中的关键一一环了
这个我们也没想到
比如说这个阿尔法f 一吧
这是二零一九年出现的
我们做的那个无机构碎片是二零零九年的那个方法
然后在阿尔法f 一出现之前呢
也有另外一个方法
是徐景波
就是现在是分子之星创始人
现在在芝加哥的丰田研究所做教授的一个一个老师
他发提出了一个的方法
他也根据我们这个方法的基础呢
他开创了一这个也不需要结构碎片的方法
在我们的工作基础上呢
就是说多了一步
不不仅仅预测这个二面角
还预测这个距离
所以他把这两个信息来约束这个能量函数来预测这个结构的话
就比我们的方法要好
您说的这个距离是指的是什么距离
是两个氨基酸之间能距离
所以在阿尔法负一呢
其实在它这个工作上非常类似的
也是预测二面角
预测距离
当然这个阿尔法负一这个不一样的地方就是说他用了个大数据啊
工程做的非常之好
而二零二一年又出现这个阿尔法for 二呢
它呢用不一样的工具了
就是用单刀单的
呃
代表的结构训练然后预测
这个单端单呢
也不是他发明的
是二零一八年呃
出现了一篇文章叫rgn
就recurrent geommetric neural network 啊
这个循循环的个经网络
呃 呃
几何神经网络来直接预测二面角
用二面角呢直接产生这个三维结构
产生的三维结构以后呢
它跟以前不一样
就是我像我们以前的话
产生三维机构就用个能量函数去优化它的话
当时在二零一六年呢
出现了一个新的算法
叫可微分审次函数这个算法
通过这个算法呢
可以根据预测这个起始的这个结构跟真实机构进行比对
然后找到其中的错误
然后把这个错误呢
可以反向回去呃
进行反馈调整这个神经网络参数
其以通过这样反复的迭代的话
它就可以直接预测这个三级机构了
就完全不需要在神经网络外边找一个能函数来优化
所有的东西都在神经网络内部做了
这就是所谓的端到端的啊结构预测
所以我们这个二面角预测呢
就啊
导致了这个端到端的预测也无需的啊
无意中呢
为后续这个阿尔法for 二的出现了奠定的基础
当时做的时候还是想不到
当当这这个尔尔法four 出来
就是他们有了这个端到端
相当于是从序列直接到结构结果以后
你们觉得意外吗
那倒没有意外
这个r 阶方法我知道
但是r 阶方法是去参加casp 做了很多败了
因为它
它这个里边还是有很多因素在r 键方法它里面没有考虑距离
只差其中的失败的一个原因
阿尔法f 比那个r 键好的地方就是它不仅仅预测的这个角度
还加了距离
它还用了很多数据
用了很大的模型啊
这个我们一般普通的那个那个课题组没有这么多钱来做这个事情
你看 嘿嘿
所以总结一下就是一开始是基于已经解析的蛋白出现的模板来这个匹配这个一个未知蛋白的结构对吧
然后可能变
呃
出现了这种以碎片为匹配的
后来也不需要碎片了
就是根据序列来预测它的二面角的角度以及氨基酸之间的距离
然后到阿尔法fold 有了真的就是这个比较强大的这个神经网络
然后还有大数据以后
就能真正实现现在这种端到端的
呃
结构预测了
就是从到没有阿尔法的之前的那些工作
到现在有了阿尔法fofold
你觉得最大的飞跃是什么
其实在阿尔法force 前
它已经有一些极限大家其实大家都不知道就是了
大家都没有想到
没有联想到一个一个革命性进展了
就是代表这个一维信息的这个啊
代表这个二级机构的预测大概精确度大幅度提升啊
由原来的百分之差不多七十几吧
一下子接近了到百分之八十五这个理论极限
它为什么有这个理论极限的
因为它这个三个状态都是人为定义的了
所以它有一个理论极限的
第二个呢
是代表这个二维信息的蛋白质这个距离基础图
就是说两个之间氨基酸之间距离的预测呢
也是大幅度提升的
这都是在阿尔法four 出现以前的这个一个效果
从原来百分之二十到三十啊
这样一个非常啊非常差的精确率
一下子提升到这个百分之七十左右
这个一个归功于进化信息能够很好的抓取了
第二个归功于深度学习
就这两个东西
正是因为有这个一维信息二维信息这个
呃
提升的啊这么好
导致这个后来这个阿尔法负就摘狗时的时候
就把这个一维跟二维加起来
呃
它解决了这个一加二等于三的问题
就是一级信息加二级信息的预测
导致了非常好的三维信对这个三维结构的预测
对
这个就是他实现了一加二等于三这个问题
当然了
一加等于三这个实现也不是那么容易就实现了
就是说还对应于这个我称之为涌现这个现象吧
就是说他用了这个超大规模的数据
超大规模的呃
模模型来做这个事情
他当训练的时候
把几乎所有的啊蛋白质的序列
所有的已知的蛋白质结构都放到它的模型里面去了
建造了当时最大的这个模型要几千万这个美金啊
这个我们小颗粒所有几十万美金已经了不起了
所以这个
这个还得
还得感谢
还得感谢这个
呃
这个deep 蚂蚁公司
他愿意投入这么多人力资源呃
来做这个事情
因为大家都觉得这是一个小众科学嘛
都没想到他会花这么多钱来做这样一个小众科学
唉
之所以大家会觉得它是小众科学的原因
是大家对这个事情能做成不抱有信心吗
对
主要就是这个原因啊
他们还是很有远见
就是愿意干这种事情
我的 呃
觉得还是很佩服
哒哒哒哒哒哒
生动活泼正在招聘商务实习生
运营实习生以及支持线上实习的内容实习生
我们的另一档节目生动早咖啡也在寻找实习小伙伴
欢迎对商业科技动态感兴趣的同学加入我们
你将在四个月的线下实习期里积累选题研究和节目制作的经验
还有机会成为我们的全职伙伴
嗯嗯
问你一个尖锐的问题哈
就是在阿尔法four two 刚刚出来的时候
就网上就一直在讨论说结构生物学家是不是要被替代了
你会怎么样回答这个问题
应该还需要一段时间
还需要一段时间
主要问题的话
这个阿尔法four 它还是有不少局限性的
其中的一个一个问题的话
就是阿尔法four 它要预测这个自然维机构的时候
它需要输入这个
呃
所谓的进化信息
它要把一个大家族的所有的代表的序列都输进去
通过比较这个大家族这个在进化过程中有些些丢丢了也些方方是吧吧
通通这过do 的换的信息里面它可以找到它具体信息的
因为比如说它有两个氨基酸
它结构里面是接触的它
所以它突变的时候
它不能两个都变大
它至少要一个变大一个变小
这样的话才能保持继续续错触
不然的话有结构就不稳定了
所以它是依赖于这个进化得到的具体信息啊
才能做这个三维结构的呃预测
假如如个进化信息跟没有它
比如说我只有一条序列
我输进去它的
它的结构其实是经常情况下是很差的
所以它做不出来的
现在结构生物学家还能提供一些什么样新的insight 呢
因为其实他们我们关心的它不仅仅是它一个单体的结构
我们还关心的它这个单体跟其他呃
物质相互重的是显显出什么个状态
那个这状态态有可能会改变的
而且也有可能它是动态的
不是一个静态的过程
所以在阿尔法呢呢
现在是还只能预示这个静态的结构
它对这个呃
动态的结构它也没法做的
所以还有呢
这个蛋白质还有各种各样的修饰啊
这个修饰完了以后它会变成什么样的
它也做不好的
所以他还是有很多东西他现在做不了啊
符合结构啊
特别是我们很多这个呃
生物机器啊
它有七八十个蛋白质都在一起干活的
这协同干活
这样一个协同干活的大型机器
现在这个阿尔法four 差远根本没法弄
刚才您说的阿尔法four 可能一些局限
比如说它不能预测蛋白的动态结构
没有办法预测大型复合物的结构
那是在模型层面还是说在实验层面有一些什么样的进步才能让它能够worker 的更好呢
我们最近做了一个一个简单的一个一个想法
就是说
我们呢
就是说因为实际上比如一个复合合结构的话
它为什么它做复合结构它做不好的原因就是复合物之间的进化信息
或者复合物之间的具体信息它并不是太多
很难在天然的自然界能找到
所以的话
导致它符合结构它是啊
预测不了太整啊
我们呢就动了一个脑筋
就是说既然在天然的这个信息里面呃
同样序列里面找不到的话
我们能不能从实验室里面去创造一些同样序列
所以我们最近就做了一个实验
就是用大肠杆菌去人为的去
呃
在实验室里进化啊
去产生一些啊同样序列
唉 发现唉
用这个人为的同样序列去做就可以做的很好啊
当然这个应该还说一个产暂时的一个方法
因为这个还需要实验来做
天然 呃
人工的同样序列真要想解决这个彻底解决这个问题的话
还需要能够预测
从单序列来预测这个散结结构
这个要想做这个事情的话
必须要深刻理解这个呃
物理的一些相互作用
因为它是靠单序列
它是靠通过物体相互作用来找到最后这个构象的
那这些物体相互作用呢
其实很复杂它因为它有呃
量子的相互作用
有跟水的项目这种
还有离子啊什么各种各样的里边的小容积的项目这种
很多很复杂
导致了一个综合的现象啊
所以呢
现在呢还没有把这个理解透
未来的话
一定要通过物理来预测这个试验结构呢
就是从单序列来预测这个验结构才是最后的一个三极目标吧
就是真正搞清楚蛋白质和或者氨基酸和氨基酸之间的相互作用的原理
对对对对对对对
那这样的话就可以
就可以解决所有的问题了
就对
那其实你在二零一五年
你其实研究主要方向就从蛋白质是转向了rna 的结构预测
那
那个是阿尔法four 的出现
五六年前
对对对
没有想到说阿尔法的会出现
对
那当然没有想到
那时候就是觉得这个
呃 每年呃
长进这么一点点
然后我们这个
呃
做的那个工作也是没有得到主流的认可
呃
拿钱也特别难拿
所以呢
我就得换个方向嘛
呃
因为你在同一个领域做的时间太长了以后
你的思想就会被凝固固了
所以呢
我们当时说我既然蛋白质做的有点慢
我换个方向做个ra
呃
是不是可以做的好一点呢
我们就觉得至少把一部分的人转到这个ra 结构预测
这个ra 结构预测呢
它是有一定的相信的
都都是从序列到结构
所以从转换这个研究方向来讲
B 类还不是太高
所以应该是还比较比较容易吧
当然游其特殊的东西还是需要小心
不然会犯错的
也有个好处就是我们从蛋白质过来
我们会少犯很多错误的
所以我们刚开始做的时候就做ra 的二级构构
R 的二级结构其实跟代白质二级结构也不一样
代白质二级机构是一维的信息
这个ra 的二机构呢
它是一个二维的信息
就是两个碱基呃
是怎么配对的
所以它这个二维信息
所以实际上跟呃预测蛋白质的那个具体基础图有点相关的
所以应该说就做的我觉得一下子比以前的方法好
因为我们以前很多人都没有用深度学习的方法去做这个事情
所以我们开始用深度学习方法用到ra 上面去的
所以一下子就有有所突破了
其实蛋白质和rna 虽然它们都是序列信息啊
但是蛋白质其实是氨基酸序列
然后有二十种氨基酸
然后rna 它其实是碱基序列
而且碱基和结肌之间是会形成配对的
其实这个也是导致了这个rna
呃
某种意义上要比蛋白质难做的很多的一个根本原因吧
因为它这个呃
Rna 的话
它就
就像刚刚才你说了
四个碱基它的信息量太少了
而且四个碱基大小也差不多
都是有那个磷酸根的那个负的电荷
所以它它的差别很少
但是氨基酸呢就不一样了
二十种氨基酸它有长的有短的
有带正电的有带负电的
有清水清油的
差别很大
它的信息量是非常大的
所以你去做做这个数据
那个用深度学液去学写的时候
你学rna 就学到很难学做什么东西
因为它看起来都差不了太多
所以这个就带来一个
带来一个很大的困境
就是说很难做这个ma 那个做实验也很难做
就是说他因为太太相似了
而且这个二级机构的话
你刚才说这个呃
配对
Augc 这些配对能量差很少
所以的话
他也各种各样的可能配对的话
它能量都差不多
所以他有很多亚稳态
所以的话
他为什么ma 基金很难
基金就是亚稳的太多了
他找了他自己的最好的状态是非常困难的
所以整个来说
这个整个领域就是要要要
要难呀
数据也少 对
呃对
我其实挺想问问这个呃数据的问题的
他很困难的一个原因是不是也是因为可能rv 已知的结构是非常少的
对r 已知结构它
它不是没有它是很难去把它基近出来
比如说有一个一千个碱基长的rna
其实真正有构构的部分可能只有几十个碱基
所以它大部分区域都是非常之松松弛吧
比较像面条一样的
所以你去想去测定结构的时候
那这些大部分的这些区间这个都把你的视线给挡住了
所以你就看不到里边这一小块它是有结构的
所以我们经常被以为这个ra 是没有机构的
就是因为被那些假象给蒙骗了
因为我们不知道它机构区在哪
所以导致了我们以为它所有的地区都是没有机构的
这也导致了我们实验数据无很缺乏的
也是一个根本原因吧
呃
阿尔法four
所以他们其实也可以预测呃
核酸的结构
就是dna 或者rna 的结构
嗯
他们在这块做的怎么样啊
呃
阿尔法four 三的话
它就是一个大改进
对阿尔法负二的一个大改进就它不仅仅可以做代表了
也可以做其他的各种各样的分分子类型
因为它用了一个所谓的分子生成模型
就可以生成各种各样的分子
所以呢
它的它的好处是它的应用范围大幅度的扩展
但是呢
它没有解决根本问题
就是说很多这个
呃
其他分子的数据量不够
所以他拿它做训练的时候
他见过的东西他可以预测的很准
他没见过他就预测的很一般
所以他在做这个
呃
比如说cats pp 十五的rn 结构预测的时候
甚至包括在近的十六六
就是去年的始casp 十六这个
呃
用ai 的方法来做的时候
它做的还不如有基于能量函数的方法好就充分体现了这个
它
它的训练是不够充分的
而且更主要的原因就是
我们 我们 呃
研究了一下这个
呃
Rna 的结构空间
就是说我们用三个剪辑的碎片来观察一下最近几年有多少个新的结构形态被出被发现了
我发现这个新的结构形态在最近几年还是指数性的增长
就是远远还没看到
好了
就蛋白质这个结构形态
十几年前已经被穷尽了
嗯
你说结构形态
就是同样的序列
它可能形成一些不一样的结构
就是三
三个剪辑的组合
嗯
它会形成什么样的结构形态啊
现在还没有看到底
对 唉
那有没有可能就是它就是没有一个固定的形态
应该说相当大的部分是没有固定的结构形态了
这个我同意这个观点
但也有不少的部分
我怀疑都比我们已知的那个蛋白质结构要多是有结构形
而且它的结构有可能甚至更稳定啊
也非常稳定
其实我们
我们已经有一些证据了
比如说我们pp 库里面有一些trna 啊
Rebet rna 啊
呃
还有r 瑞斯啊等等
呃 呃
Rebeer 上还有核酶啊
还有这个合合合同开关啊
这些ra 都
都已经在找到它的结构就被解析出来了
所以并不是没有
而是我们不知道到哪儿去找这些
呃
Ra 结构原件
然后把它给解析出来了
是 是
我是应该说还是个黑箱吧
我们不知道到哪儿去找
我们最近做了一个一个一个实验
我们去扫一扫有可能有结构的那个在批我们人类基因组力有可能有结构的ra 原件远远超过我们的想象
几千几万的到处都是
这二是我们
当然我们也不知道它是真的还是假的
第二次
我们从我们计算角度来讲
我们认为是可能性非常之大的
如果让你比较的话
你觉得现在rna 的结构预测处于蛋白质结构预测当年的哪个阶段呀
差不多应该是二零一一四一六年这个这个样子状态
就是说打分打到这个四十分左右的样子
难就是没见过的个ra
它打分只能打到四十分左右
及格都没有
及格就是这是根据去年的那个casaspb 十六的那个评分啊
就说明了这一点
就是说现在难做的只能达到四十分
还没有出现这个阿尔法fo 一
嗯
杰格
但是一四年离现在也没有很远了
你想
其实从一四年到阿尔法four 出现
也就过了五六年的时间
对对对
这个就是看运气了
就是谁有运气来第一个突破
从至少从四十分打到这个六十分
呃
这样阿尔夫一就是第一次从四十分一下跳到及格六十来分
然阿夫夫再从六十来分一下跳到
呃
快九十分了
所以猜才是两个飞跃
但是其实从数据积累的角度来讲
蛋白蛋白质数据库积累的这个数量量远远高安安安维结构构积累的数量
是的
它就差不多是设倍左右吧
有这样一个问题嘛
所以其导致了目前的困境
唉
其实我想倒过来问一个生物学问题啊
就是既然您从一开始说说蛋白质
蛋白质是所有生物学功能的执行者
那为什么我们回要还需要倒过去研究rna 的结构呢
那只要我们能把蛋白的结构研究清楚了
不就能解决很多问题了吗
其实这个现在慢慢的大家都意识到了
蛋白质呢
就是相当于公仪一样的
是干活的
但真正的领导蛋白的呢
是rna
它在后面操纵这些蛋白
所以如果我们能够从领导层次上解决问题的话
那肯定不需要从公益审益平台去解决这个问题
所以为什么我们认我们认为这个rn 呢
是更重要
只不过那我们还没有冰山一角
还没有看到这个真正的面貌
最近也出了一篇sale 文章
二五年几个月前
就是说它叫rebel regulate 和控开关
就是 嗯
Rebel regulator
对
它通过ra 来控制所有的生命的一些现象
蛋白质只不是被控制的一个
一个相当于我们
我们做这个
呃
游戏不是有那个叫提线木偶啊
对
提线木偶吧
就是蛋白质是前面的木偶
对
Ra 是后面的个控制的
你可以举个例子
比如说这个ra 那个那个碱切吧
基因的话
它有所谓的这个内含子跟外含子
外弦子通过把这个内含子剪掉了以后
它的行的成熟了
呃
Ra 这个message ra 然后被
呃翻译出来变成代b
它这个剪切很多是通过这个ra 来来调控的
所以它某种意义上不是ra 告诉你我要变成什么样子就变成什么样子
这个其中的一个原理就是说通过ra 的调控来控制到底它剪切成这个样子还是切成成外外个样样子啊
这个往往是生后死的这个这个关键点
所以很多疾病就是因为减切错了导致的一个该表达蛋白没表达出来
然后就生病了
就是说rna 对于蛋白质的调控非常重要
那 呃
现在已经有很多靶向蛋白的药物了
然后其实效果也不错
那现在为什么要做以rna 为靶点的这么一个药物呢
就是您现在创业的这个公司
其实也是呃
设计以rna 为靶点的药小分子药物嘛
对对对
过去几十年
也就说大家都都在做这个蛋白质做了很很长时间了
传统这些药物研发呢
就跟某种意义之间跟鼠跟钥匙这样关系
就是说你要在靶碘这个蛋白质这个表面上呢
找到一个合适的结构位点
也就是鼠的眼
然后药物分子呢
你像设计呢
就相当于设计一个钥匙
它能够插到这个鼠啊
鼠眼里面才能发挥作用啊
我给你讲一个成功例子
当年这个艾滋病毒那个蛋白酶的抑制剂啊
就是这样发现的
就是说在在这个艾滋病毒这个生明过程中哈
这病毒的基因它会利用咱们人类细胞内部的机械去制造它的蛋白
这样子为了省事呢
它把所有的蛋白都连成一条线
就一次一批新的给制造出来了啊
这个呢对它来说比较经济嘛
比较省事
但是呢
大家也增加一道工序
它需要一个酶在生成以后呢
把它切断
这样切完了以后呢
它这些病毒蛋白才能去分头去干各种各样的活
应该说是这个蛋白酶是非常
如果你这个简单剪刀不工作的话
它没法把这个
呃 这个蛋 呃
其他蛋白能够切开的话
它的这个就死掉了
病毒它也没法传染
也没法
没法继续生存下去了了
所以个呃
设计这这
呃
药药办办法呢
就是设计一个抑制剂
把这个剪刀给关掉
具体关掉了
就是说你找这个蛋白这里面找到一个那个剪刀的那个切割用的那个沟槽里面去
然后去贴到这个沟槽里面呢
它就不能做剪刀的功能了
所以基本上就是这样一个
呃
一支气球基本上这样做的
所以这个代表一支气是当年最早的第一个来抗盖茨病毒的这个小分子药
也就是因为这个小分子药呢
把这个一个美国的这个非常小的一个公司叫当时叫four tax 太制药呢
只用了三四年变成了几千人的这个员工的渣子
但是问题在于
因为大家都做了好多年了
该做的都做完了
剩下的做不出来了
大家都做不出来
因为它里边表面上太光滑了
你找不到一个鼠眼就没法做了
就是说那个索药模型
它是基于你有一个比较清晰的索眼对吧
对
但是低垂的果实已经被摘完了
很多蛋白其实没有一个特别清晰的这个可药物可以靶向的那么一个结构了呀
就其实我给你举一个例子就是说
呃
有一个代表叫carros
这个蛋白四十多年前就知道它是导致癌症的一个非常关键的一个一个分子
它 它很癌
癌症在都是高表达的
什么胰腺癌
结肠癌
肺癌等等等等
它就是促使这个癌细胞的生长增殖的
但是呢
长期来一直没法用它来做药物的靶点
就是因为它这个分子呢
是通过结合这个呃
鸟肝二零三来实现它的功能
但是结合这个鸟肝二零三的地方
它非常平滑光滑
所以你去找一个分子
想着粘在同一个地方
怎么捏也捏不过这个鸟肝二零三
鸟肝二零三结合力非常非非常高
没法做一个更好更超过它的这样一个分子
所以这么多年根本就没有办法发现一个广谱针对这个k lus 这个那个一个一直自己来成药
应该来说还是个没有解决的问题
发现不了所有的这种情况下
我们可能就要找一些替代方案对不对啊
对对对对对
像
像我们公司的话
他我们就对这个k las 做了一个研究
然后想找一些这个ra 分子那个来抑制这个klalus
但是我没有发现k lus 本身
我没发现一个好这个ra 靶点
然后我们就在ra 的上游的一个地方找到了一个另外一个蛋白质的rna
我觉得那个代白质rna 是比较容易啊
可以靶点的靶向的
所以我们在发现了一个很好的小分子来靶向那个蛋白
然后它间接了影响了这个k 拉s 的功能
就可以实现了这个对k 拉s 驱动的这些癌症呢
可以杀死这些癌症
我们啊做了一些细胞的实验啊
做了一些动物实验
都发现我们这个小分子既能够高效
又可以比较特异性的依次这个啊所有k 拉s 驱动的这个癌症
所以应该说还是进展比较快
现在已经推进到
呃
接近这个临床核腺药这个阶段了
充分体现就是说
呃
东方不亮西方亮
就是说你靶向蛋白做不成了
我们可以靶向ra 啊
Ra 呢是刚刚兴起
还有很多地方可以做的
对
你可不可以举一些例子
说现在已经有哪一些比如说已经上市的药物
有没有比如说是靶向rna 的可以治疗一些疾病呢
有了
咱们先不说人类先发现的吧
应该说大自然早就利用成个这个机制了啊
二零零二年
科学家就发现有一类这个分子啊
它叫核糖开关
它就是通过跟小分子用可以打开关闭呃
这个通过变换这个二级机构来打开关闭这个
然后达造这个不同的这个一个控制吧
控制这个表达这个一个效果
它不仅仅是存在存在的细菌里面
在真和里面
生物里面也也
也存在
它主要是跟小分子这个代谢物啊
金属离子啊等这些东西来改变这个二级机构的
当时发现这个现象以后呢
大家并不认为就是说还可以用它来做靶向而为
因为后来呢
出现一个什么形现象呢
就是说在药物筛选里面呢
也有一种所谓的表型筛选
这表型筛选呢
就事先你不去管它它是靶向哪个呃
靶点的
只是看它的结果
它结构好
你就把这个小分子炸到了
这就是所谓的表型筛选
如是跟ptc 这个soper peace 公司合作呢
他就用这个表形筛选去找能够恢复这个一个代表叫smm 这个代表这个表达量这个小分子
它筛选了上百万个
重新找到了一两个小分子
然后就来开始研就这两个小分子到底是怎么回事
万万没有想到
他本来以为是作用在蛋白上面的
没想到是作用在ra 上面的
嗯
这个smn 蛋白其实是因为它的表达量低
所以是导致了一种疾病
叫脊髓心髓性心髓萎缩症
对
比较比比较傲的这样一个疾病
对对对
所以他
他就是实际上是作用在这个ra 上面的
这对他们来说是一个惊讶吧
所以到了二零二零年
那个所有的什么临床实验证明这个东西真真正工作了以后啊
就是哦
原来也可以靶向ra 的
不仅仅可以靶向带来
所以这个呢
就是应该打响这个靶向带来转到靶向ra 这个式转换第一枪
当然这个时候并这打下了第一枪
并不是说以后很快就大家就拥拥而上了
因为这个还是一个比较难的领域吧
就是还是不是很好做
你怎么找到这样一个合适的靶点去靶向
所以最近呢
Fp dc 这个fareirs 公司呢
呃
又做了另外一个病
就是hunting 疼啊
这个疾病也找到了一个小分子可以靶向
然后也得到了一个临床二期的初步实验
发现还是挺挺好的
所以也是过了十来年了
总的来说就是说这个领域还是比较啊
刚开始吧 对
您一开始就是说这个rna 的结构其实比蛋白质还更难解析嘛
然后那想要找到这种靶向rna 的小分子
如果是基于结构的话
是不是更困难
因为rna 本身的结构可能就很难被解析
对
所以你就没有办法去做基于结构的这个方法来做啊
因为一个是呃
库里面结构很少
第二个是你去预测的话
预测的
呃准确的话应该是很差的
那我们怎么筛选出这些靶向ra 的小分子吗
我们公司的话
它就有一个一个idea
就是说虽然说我们不知道这个机构
但是呢
我们可以用ai 的方法来预估哪个地方有结构的
而且这个机构呢
很有可能是比较稳定的
那估计完了以后呢
我们就可以去用实验来验证
然后是不是真的有一个很好的三维结构
而且它比较稳定的
然后一旦这个证实了以后呢
我们就可以用我们一个小分子库
因为现在高通通筛筛还是比比较流行的
因为这个高通量筛选在做蛋白已经做的很成熟了
所以呢
我们就用个高通量筛选的方法去针对这个rn 的那个
呃
我们认为有结构的那个区去做意一个筛选
看看是不是真正有个小分子能够结合在上面的
那这个的话
它也不是那么容易的
就是说ra 相互中的小分子跟蛋白相互中的小分子不是一一类的小分子
所以的话
我们就专为为rna 定生打造了一些有可能跟它结合把这个小分子
然后去用这我们自己的小分子过去去删
基本上找到一个靶点就能删除一个一个分子
所以应该来说还是有一些实验的技巧跟计算技巧和好的小分子库这个东西结合起来才行
嗯
所以其实ai 在这里头成分主要是一方面是可以预测一些可能与小分子结合的rna 的结构域
呃
另外一方面也是预测一下小分子跟ra 的相互作用
看看他们能不能结合啊
这个倒没有去预测这个
我们直接去做实验
高通量筛选
筛选完了以后
然后我们得到一些小分子的那个candidate 啊
然后我们看看有没有可以优化改进这些小分子的
这个呢
有一套工具
就是 呃
基于这个inhibitor 来做这个所谓的sananalsis structure activity relaation 呃
分析
可以去优化你的小分子
就整个临床前的这个阶段
可能是需要比如说三到五年的时间
嗯嗯
然后我不知道有了这一套就是ai 的工具以后
是不是能大幅的加速临床前的这一段呃时间呢
啊 会的 会
应该说缩短
但倒不是革命性的缩短
应该说缩短不少啊
是我们公司的话
是二零二二年底正式成立
然后二零二三年前进来以后开始建实验室
到我们管线里面三个管线开始有这个pcc 接近pcc 的分子
也就用了两年啊
两年多的时间就就做出来了
然后我们现在有一个已经接近mad 了啊
我们钱也就是很有限了
能够做这三个已经是觉得非常快速了
你说已经接最接近的一个已经快要ind 了是吗
就是马上要上临床实验了
对
基本上今年年底或者明年年初吧
你觉得在做这些事情的时候有一些什么样的挑战啊
呃
我觉得还是一开始要走对吧
一开始你就是如果你靶点都搞错的话
你再怎么吭哧吭哧往下做的话
往往就做做不出来
就是你就全功尽弃
因为你一般八点搞错的话
你也许可以找到很好的banner
就是说你可以
呃相互作用可以做的很高
这样子呢
这个这个小分子的成药性就会很差呃
因为它呃相互作用高
也许它仅仅是
就是说很多人就针对这个二级结构
Ra 二级结构来设计小分子
这ra 二级机构的话
它相似的二级结构会很多
所以说你针对某个二级机构去设计小分子
这个小分子也可能跟其他的ra 都会有相互作用
这样会很大的这个副作用就相互成药
这就是为什么我们强调一定要把向这个三级机构的根本原因
因为只有三级机构它才会有一个独特的的口袋
然后你把向它的时候就会有一个特异性啊
不会去跟其他的安慰项目作用的这个
所以这是一个关键点
如果你这个靶点多弄错的话
那后边再怎么辛苦为这是为什么
美国已经有十几个公司已经成立了十多年了啊
到目前为止真正能够做出一两个药
也是已经进入临床的
也除了这个ptc 摄入的这个公司的话
最近还有一家公司进入临床一期
所以大多数还是还没有进进入临场呢
所以我们已经一下子就是说已经跟他们在同一个起跑线上了
呃
像这种ai 工具现在是非常广泛的应用到药物的筛选中吗
啊 是是是是
那个用的是应该说是比较多了
它已经ai 的话
已经渗透到那个呃
药物研发的一个方方面面了
宝典发现验证啊
小分子设计筛选啊
药效毒性啊
人甚至可以在虚拟的筛选这个人体细胞器官水平都在做
还有临床设计优化
就药信用等等都在做
呃
应该说就是说除了这个
呃
呃
在蛋白质这个
呃
结构预测方面进展的确是呃
突飞猛进
其他方面的话
某种意义上有时候还是在一个一个缓慢进步的这个过程
我不认为已经ai 已经带来一个革命性的进展
呃
应该说带来一些便利
然后成功率呢
也会增加一些
但并不是那种
呃
革命性的这种进展了啊
目前的话
也有很多这种语言模型啊
呃 智 Ai 智能体
智能体
但真正重要的这个一些关念技术的话
还是啊
进展还比较慢的
没有那么快
你说的关键性的技术是指哪些
比如说你是去你给一个蛋白质
你马上找到一个新的小分子去跟它相互这种
我认为的话
现在还没有一个很好的工具啊
现在的ai 的话
它对见过的小分子跟蛋白的项目这种它能做的很高
如果它没见过的
它还是预测不出来
因为它它的数据库不够大
因为小分子这个化学空间太大了
因为二十个氨基酸的话
变量变就是二十个氨基酸
但小分子的话
几乎是无穷大的
所以你你这个数据库怎么再怎么建
再怎么建也不可能是呃去满足这个无穷大这个要求
也就是他去呃
去找新分子的时候
他没有这个经验
他就没法去制造出来
那现在很多人用ai 去去做一些小分子那个
呃
也去呃所谓的呃生成模型
Ai 生成模型去设计一些根据他这个几何构象来生成一些小分子
但是往往这些小分子呢
出了出现了一些问题
或者呢
它生成出来小分子那个太复杂了
那个我们去合成都合成不出来
不知道是不是真正的存在都不太清楚
这个某种意义是种幻想嘛
这还有一些呢
小分子你做做出来它成药性对好不好也是个问题
它是不是能够成药
对有没有对其他东西呃起反应啊什么之类很多东西因素它还是没法很好的预测的
因为人体的确是呃
太复杂了
这不是呃一年两年这个就就能搞定的
你觉得想要克服你刚才说的这些困难的话
在未来我们还需要做点什么呀
这个未来的话
应该来说还是要摆脱这个数据依赖吧
我们现在主要的问题就是说我们被这个大数据大模一新给迷糊住了
然后就觉得所有问题就要有了大数据什么问题就包办了
但是有的时候你永远数据永远不够大
呃 没法打
或者是大再大再大也大不过这个无穷大了对吧
所以像这个化一个空间几乎是无穷大的
呃
我个人对这个小分子要我实际就是说真正要解决这个问题
还是要回归到物理上面去
去真正把它那些物理的相互作用给给搞定
你一定要把这个物理相互作用给搞定了以后呢
你就不需要这么多的数据了
因为有一些基本的规律啊
就可以去推演
然后也可以泛化
这像牛顿定理一样的
它就是一个简单的一个牛顿定理是然后就可以把这个地球上的宇宙上的所有的星球的运动这个
呃 估算出来
如果你靠自己观察的数据来来去做ai 的话
那要很多年的时间去搜一点这些数据
所以在未来的话
我觉得就是说怎么找到这个分子相互作用的牛顿定理
也就是在分分子微命方面牛顿定理如果能找到的话
那我们就不会有这么多对数据的这个巨大的需求了
比如说有一些简单的
你像我们看这个视频对吧
我们用ai 来做视频
呃
经常会发生这样问题
就是这个人从一个桌子穿过去的对吧
它没有体现到这个卧底的存在
是同样的
我们做蛋白质做rna 的时候
它也体会不到这两个原子它是没法重叠的
它会这源之间会穿
穿过去的
所以这些基本的东西他都他都学不到
所以如果我们把这些让他自己去体会
两个原子不能够重叠
那有些原子之间它会相互作用会强一点
有些原子之间相互作用会弱一点
诸如此类的
他如果能够自己体会出来的话
那这些问题就可以解决了
我们就省了很多麻烦
那个数据就可以大幅度减少一样
您这边还有什么要补充的吗
我的问题已经问的差不多了
我觉得反正ai 是一个展示一个
呃
一个时代吧
我们应该怎么学会跟ai 共处
怎么利用它
而不是被它所控制
这是一个值得每个人思考的一个问题吧
我觉得ai 的未来既可能变得非常之坏
也可能变得非常之好
这个非常一个
呃
面临着一个变革的时代
某种意义上
如果你是个悲观的一个一个人的话
你会看到非常黑暗的那个未来
因为很多工作就还会丢失
呃
最近我看了一个
呃
哈佛的一个一个研究
研究的很仔细
很多这个中间深层次的那个
呃
工作在美国已经
已经开始出现流失了
就是说这样的话
就带来一个严重的社会问题
呃
大家都要需要动脑筋了
去迎接这个一个店外的时代了啊
好的好的
希望我们能更合理的利用ai
然后希望ai 给我们带来一个更好的未来
哈
好的好的好的好的好的
那非常感谢周老师
对
然后今天聊天非常愉快
那
那我们今天就这样啊
谢谢 谢谢 谢谢
今天的科技早知道就到这里了
听完之后
如果你有任何的想法
欢迎在评论区和我们交流
如果有任何想听的话题
也请告诉我们
如果你喜欢我们的节目
请记得分享给更多的朋友
那我们下期再见
下期再见