本字幕由TME AI技术生成
用声音碰撞世界
生动活泼
与全球创新第一时间同步
这里是科技早知道
Deep tach 深科技系列
我是雅贤
欢迎跟我一起探索最新最前沿的硬核科技
用现在fancy 话来讲就是二零年你们打造了一家ai native 的公司
这种东西其实是ai 比较难的
也是如果要用ai 做真正有创意的科学的需要去突破的一个技术
你觉得为什么ai for science 现在会成为现在这些大公司他们聚焦的一个赛道呀
生物本身就像一个非常复杂的宇宙
它的这个分子的数目
然后可能就和宇宙里面的星星的数目一样
它在这么一个小小的这个个体里面
它就有这么复杂系系统
这么多尺尺度
其实人兴兴奋程度不亚于人类对宇宙的探索
这么一件事情
你
你得未未aa 可以替代人类科学家吗
Ai
Hello
听众朋友们大家好
欢迎来到我们今天的科技早知道
我是雅贤
二零二六年
Ai 驱动的科学发现
也就是ai for science 成为了ai 领域讨论最多
竞争也最激烈的赛道之一
那根据统计呢
仅今年上半年
全球的ai for science 领域融资就超过了加速科点三亿美具
各大的前沿模型厂商也争相发布自己的ai 科学研究平台
比如说四月呢
A open ai 就发布了给生命科学领域使用的推理模型gpt rustland
那anthuropic 也在今年六月推出了为科学家们设计的ai 平台clad science
Class science 呢
是整合了多个科研工具
那前谷歌科学家jeff in 在离职以后
与三位谷歌的元老共同创办了ai for science 的公司discovery loop
希望通过ai 自动化科研流程
加速科学发现
那deep mine 的eeo
Damh
Hasabis 就曾经在拿到诺奖之后说
我一直认为ai 是加速科研发现的终极工具
那我们今天呢
就来聊一聊ai 到底如何加速和驱动科学研究
那我们今天的嘉宾呢
是宋乐老师
宋乐老师是硅谷创业公司je biil ai 的联合创始人兼cto
他曾在呃
Georgia tech
也就是佐吉亚理工学院任终身教授
主导过国内最早的生命科学大模型之一呢
Extremeal 的研发
现在他希望用ai 来打造生命科学的世界模型
Hello
宋乐老师
先跟大家打个招呼介绍一下自己吧
唉 大家好
我叫宋乐啊
我是在这个jam bail ai 作为cto 和方的同时
也是这个中东的莫哈曼比萨coe 大学的一个教授啊
其我高高学和大家认识
其实我看到宋乐老师的这个不管是学术经历也好
还是在工业界经理也好啊
都还挺有意思的啊
因为你一直是计算机背景呢
能不能跟我们说一下
你是怎么样开始用计算机来研究生物学问题呢
对
这个问题非常好
其实也有一些机缘巧合
也有一些必然性啊
机缘巧合就是说在我博士的最后的阶段
其实我是用了这个机器学习的方法来分析即基因表达的数据
那个时候基因表达还不像现在单细胞测序有这么多数据
还是一种技术叫microray
测的样本很少
可能只有几百个
然后你想寻找一些致病的基因
那个时候就用
呃
当时我自己研发的一些这个机器学习的方法去做这个
呃
致病的基因的这个发现
因为这个的缘故呢
所以也就是说继续我的这个博士后的工作
然后在cnu 就是也是用机器学习的方法去研究这么一个生物学的数据
包括基因表达数据
以及就是说基因调控网络这些发现
所以从那里一开始的话
就有对这个生物学数据计算生物学的这么一一个介入和深入的去理解这方面的一些问题
就是我的父母都是医生
从小的时候就看了很多就是说图片
但那个图片是解剖的图谱啊
然后医学的一些介绍的一些书
就是说很神奇
也特别感兴趣
就是说用一些计绍的方式对比如说神经学啊
然后对这就人建建模
直到就是说phc 的后期啊
然后发现啊
这两个问对于其实可以合在一起去做很多交叉性的研究
就从那开始就就开始了这么一个计算
呃
科学或者计算这个生物学的研究了啊
找到教职之前
你有犹豫过是要去工业界还这么学术界了
当时其实我也有
呃
工业界的offer
包括这个谷歌的这个offer
同时也是在找教职
然后那个时候的其实工业界的其实薪资水平会比学校高很多
我也拿到了像google research 那那个时候还没有google deep ma
也没有google brain 这些机构啊
Google research 的这么一个offer
甚至在google 里面待了差不多半年
然后再去george attack 做了我教教职的这么一个角色
因为我看到一种说法
就是说因为现在人工智能火了以后
工业界这个不管从资源来讲
就是个人的薪资待遇或者说能够给到的计算资源都远远大于学界
所以其实在训练界现在做人工智能是一件困难的事情
或者说是这个抽水效应太严重了
是这样的吗
呃
确实是这样的
就是你要做到最前沿的人工智能研究
会需要大量的计算资源
可能至少要几十张卡
甚至几百几千还要更多对吧
呃
在学校里面
其实特别是可能欧美的学校
它挺难去获得这么一个计算资源去做这些前沿大模型的研究
所以 呃
到了现阶段来说
在学校里如果要做大模型基本上是不可能的
然后只能到这个工业界或和工业界合作的方式去做这件事情
可能在十五二十年前
在学校做研究和在
呃
工业界做研究
可能薪资水平就相差两倍啊
工业界是学术界的两倍
但可能现在是十倍甚至更多的一个差距距
嗯
现在学术界做的跟ai 相关的是一些什么样的研究呢
纯粹的就是说ai 方向有更加多的做
比如说trust worse 怎么样是可信的这么一些ai 的模型
或者是怎么样去量化ai 的这么一个不确定性
或者是一些说我怎么样去和一些推理因果的结合
都会跟更前沿的ai 可能还呃缺失的一些能力结合的这么一些研究
当然还有一个新的topic
那在学校里面做的很多的就是
呃
也非常适合学校做的就是ai scims 就是有很多和其他学科的结合
需要很多其他学科
比如说材料
化学 生物 呃
其实在这个学校里面还是变得越来越这个popular
因为多少人在做这个事情呀
明白
所以可能在公司里头你很难找到各个领域的人才
但是在学校里头你们可以合作
对的
体学学校里面还是有这么一个优势
跨学科跨领域的合合作
者者说其他学科的科研的同学
他想更加多用上ai 的这些工具来帮他做科学发现
我看你在georgian attack 一直从一一年待到二一年
十年的时间啊
从助理教授做到终身教职
然后这一段时间你是在研究一些什么样的问题
以像你刚才做cm
在cmu 的时候
主要是这个机器学习为主嘛
你会感受到一个怎么样技术的迭代吗
确实是有
大概是从二零零一年到二零一零年之间
可能有两种技术路径或者是三
三种技术路路径是占主流的
一个是叫做概率图模型哈
另外一个就是可能叫做基于优化或者叫做核的方法
还有另外一个深度学习
其实深度学习或者神经网络那个时候并没有那么火热啊
然 然后 呃
深度学习是在大概是二零一一
二零一二年呃
左右才变得更加之火热的
也是因为这个image nenet 本身那个数据集卷积神经网络在这种image net 上做这种
呃 图像识别
比人工的以前的这些模型好很多
就是jet hinter 它那个alex net 在image net 上得了冠军是吗
就是那
对的是的啊
那个就是一一年左右
嗯 对
那个就是深度学习引爆的一个人工智能的一个节点
当时我做的东西也实际上也挺交叉的
就是把这个什么呃
图学习和深度学习进行结合
叫做图神经网络啊
然后有很多呃
知识其实都可以用图来表示
包括就是说社交网络里面人与人间之间的关系
然后甚至说是在这个呃
生物这么一个网络里面的一个信号通路
甚至小到一个化学分子
它里面不同原子之间连接都是某种图
所以可以把这种图的结构或者数据和深度学习进行结合
当时我在georgia tech 做了很多这个研发
都是基于这个深度学习和图数据图的方法结合去做一些小分子的药物的合成路径的应测
还有一些包括生物信息学上面的一些比如说怎么样预测这些蛋白质相互作用信号通路的这些呃
情况
其实这个呃
也是既有方法的某种呃
创新
也有一些在这个交叉学科的应用这么一个情况
您当时的比如说基于图神经网络的那些研究
在现在你觉得还依然适用吗
还是说呃
这个技术已经迭代到不太对以前的那些技术路径不太依赖了
其实还是在不断的使用的
现在呃
一些小分子的表征上
或者是知识突破的表征
依然这个图生经网络络一个经常被用到的一个技术
即其实是现现阶段如说虚
虚拟胞胞火的的这状状态下
很多情况况下
要构建一个准确的这么一个呃
劳动预测模型
也是基于图神经网络是
是一个非常有效的一种手段
对
可能关于就是呃
您现在做的一些研究
包括军八要做的东西
虚拟细胞
我们到后面可以再展开来聊一下啊
然后那您在这个学术界待了十年的时间
也这也已经做到这个终身教授了啊
然后我看就是接着您就做出了要去工业界
然后是回国
对其实一个机缘契机就是二零一七年的时候
我成为这个学校的终身教授的时候
呃
有一个学术休假的这么一个阶段
那个时候其实是到蚂蚁金服
我到阿里巴巴整个体系里面去做了这么一个学术休教
那个时候其实就是把我在学术界做的这种图神经网络用在这么一个有点像社交网络
支付网我金融支付网络上面
为什么
为什么学术休假去了阿里巴巴呀
这个跨度还挺大的
对
首先就是说在学校研发这个方法哈
就是可以用的各种各样的图的数据
包括社交网络图以及金融支付网络图
呃
在那个时间节点
大概二零一七年的时候
中国的互联网发展的如日中天
其实他对这个科学家对研发人员的吸引力是非常大的
所以当时的话就是
呃
也选择了蚂蚁金服作为这么一个学术休教的地方
呃
前面也也提到
就是说其实我一直也是在做很多交叉学科的东西
包括小分子制药的一些小分子药的属性的预测
然后包括这个生物的知识图谱的这种理解
然后对这种
呃
制药的这个领域天然的一些兴趣
刚好这个二零二零年百度生科成立的时候
我就关注了这个公司
然后后面的话就是说
呃
就加入了这个公司一起去做这个用ai 去制药
去
去分析蛋白质这一件事情啊
嗯 对
其实我对百图的成立我也挺好奇的啊
就是二零二零年
他应该是阿尔法four 的一刚刚发布是那个时间节点嘛
是因为这个契机
所以李彦宏是他是怎么样觉得说呃
生命科学加大模型
或者会是一个未来的
我这点还蛮好奇的
因为其实说百图它真的是国内就是比较早的一批就是进军ai 制药的这么一个企业啊
我觉得是有几个机缘契机的
首先在二零二零年的时候
有 呃 新冠是吧
大家觉得都应该用技术科技去对新冠做点事情
然后第二个的话
就是说对于百度来说
它的天然基因是人工智能
呃 呃
计算这些制
计算
所以的话
用计算的方式能够去怎么样去加速制药的过程
或者改改变制药的这个格局
这件事情是非常有趣的
当时也就是除了像阿尔法four 一
还有一些蛋白质预训练模型
非常早期的
所以看到了某种就是说汇聚的一个点啊
啊
是非常有趣可以做一些事情的
所以就成立了这么一个公司
对
然后你在百图主要负责什么样工作呀
对
当时到了百度之后
整体的这个人工智能的团队的构建
以及这些人工智能这些模型的训练
基本上是由我来主导
然后中间包括就是说训练的这种
呃
蛋白质语言模型啊
我们训练的一个世界上最大的蛋白质语言模型
一百个b illion 的那么大的蛋白质语言模型
还有就是说把这个结构预测这件事情也和蛋白质质语言型结结合在一起
获得了一个就是比阿尔法four 啊
可能更加efficient
甚至efficient 十倍一百倍这么样的蛋白质预测模型
让他来做比如说像抗体的深层设计这一块的事情
嗯
所以他除了能像阿尔法four 的一样
根据这个蛋白质的序列来预测蛋白质的结构以外
它还可以
呃
做一些蛋白质生成的功能是吗
对的是的
当时我们就是用了一个其实也比较创新的技术
我们叫做混合语言模型
就是说他既能做完形填空型
可以做这个前向生成
所以的话
他一方面可以用来做这个结构预测的一些特征
同时他也可以作为一个条件生成的这么一个工具
然后来设计这么一个蛋白质
对
它主要还是在蛋白质领域
对对的
主要要经力是因为为司司的这么一个焦焦点是在这个药物的设计这方面
所以在蛋白质当时也做了一些比较前沿的探索
包括就是说把当时世界上最完整的这么单细胞数据去做了一个归纳
然后做了一个单细胞的预训练模型
这个也是当时最大的一个特征
然后后来发表在内全白分
唉
你觉得在百度工作那段时间
回想起来你会有一些什么样的感觉啊
就探索这个前沿的大模型和生命科学的结合
这个是非常之令人兴奋的
我觉得这个就是说可能没有像百度这样的计算资源
云计算的backup 是挺难做这件事情的
在当时的这个时间节点
唉
当时国内还有一些什么样其他的公司跟你们竞争吗
我觉得其他公司都没有能力呃
去训练这么一个生物领域的大模型啊
我们竞争的更加是可能更加像传统的biotech
然后在抗体设计这一块
当时大家对像ai 去做生命科学这件事情其实还没有达到一个共识啊
我们是一种更加偏计算的视角进入这个领域
所以和大家切入这个领域的方式很不一样
有些企业是说他原来是有四实验的能力
然后叠加了一个呃
Ai 模型的能力去做这件事情
所以我们更加像用ai 原生的方式尝试去做这件事情
所以的话 呃
从这个视角啊出发的话
还是挺有趣的
然后
但是就是还
还不是一个行业的共识
所以的话就是说也挺艰难的在这个方向前行啊
用现在fancy 话来讲
就是二零年你们打造了一家ai native 的公司是不是
对
至少ai 的这个这个元素是非常重要的一环啊
其实我后来跟
呃
其他一些从业者聊啊
他们也说其实ai 用在制药这件事情上
真的是从拆gbt 发布以后
非共识才逐渐收敛起来
大家才真正的觉得说哦
Ai 是确确实实可以加速这个药物研发的发展呢
而不是打个问号
说这个可能是我的一个工具
我试一试
然后呃
行就行
不行拉倒的那种感觉
呃
确实是这样的
其实我们在训这个蛋白质预训练模型的的时候
其实hgpp 还没发布
当时就是说我们做了一个决策
说要训练这么一个千亿的蛋白质语言模型
在我们训列的过程中
Hgp 出来了
然后引爆了这个全球
然后就更加进一步证实了这个大语言模型在这个蛋白质在生命科学这个领域其实是
呃
可以有一些作为的
唉
所以当时你们做蛋白质大语言模型的时候
有
有过怀疑吗
都有啊 我
我觉得就是说他在生命科学里面的这个应用
把这蛋白质里面应用还没被完全证明有效
但是从这个
呃
对技术的判断
模型对人工智能这些
呃
这个通用技术的判断来说
这个应该是一个正确的方向
我们甚至是说用这个蛋白质的数据也证实了我们叫做scaling law
这说明就是更加多的数据
更加大的模型
它其实是能让蛋白质语言模型变得更好
这个其实也是hgp 通用人工智能的一个非常重要的一个基石
大家现在的工业界把这个模型训的更大是吧
然后用更加多的语料去训
然后它变得更智能
其实是是一脉相承的这么一个一个思想
对
然后你是在二四年左右离开百图的
这是为什么呀
就是说每个公司都有它的一个聚焦点和使命
百图的focus 当时是很多是在这么一个蛋白质语言模型
基于它去做抗体
去设计抗体
优化抗体啊
这样的一个聚焦是吧
超越了蛋白质之外
有细胞
有组织有
有整个个体
怎么样能够用计算去把这件事情做的更好啊
减少这个实验的这个数量
所以觉得这个是一个非常有趣的可以长期做的事情啊
也会需要更加多的资源啊
以及一个完整的聚焦去做这件事情
所以的话
就是那个时候决定自己去去搞这么来吧
嗯
就觉得然后能够把这个
对
比如说细胞的建模
或者甚至更加复杂的组织建模这件事情做起来是吧
嗯嗯 对
然后这个新公司就是gene bill 是怎么样成立的
对
因为我看过这个公司的扣方的
都是非常厉害的人物啊
包括这个诺贝尔奖的获得者
然后这个david baker
对的
就是说不同的这个口方der 有在不同时间加入
一开始的时候
就是说我有这个想法的时候啊
有几个最初的口方der 是非常之识和一起就
就说说有这么一个共识和兴趣的
包括就是说ereric 啊
还有这个
呃
Fresh 图也是我们的这个方coder
然后我们一开始先传来这么一个局
然后慢慢的就是说我们的这个整个vision 和就是说技术路径也让其他的一些非常资深的科学家觉得很有趣
包括david baker 对他他自己做了很多蛋白质这个设计优化这么一件事情
他也又越感兴趣
说蛋白质设计这件事情是不是能够更好的去帮我们去
比如说 嗯
理解细胞的这个整个更复杂的行为
甚至是去去做一些调控
让一些细胞疗法或者说细胞之间的这些交互能够做得更好
对 在我看来
可能你的研究兴趣从一开始比如说是用ai 来做基因
然后用来做蛋白
现在你这个尺度大大的扩大
你希望能看到不管是基因也好
还是蛋白也好
对整个细胞组织甚至是整个人体这个跨尺度
这个超级大的尺度的一个影响是不是对的
我
我觉得就是说其实在制药的过程中
确实是需要把这些不同尺度都考虑进去
呃
一开始的时候是针对某个靶点设计了一个蛋白或者小分子的药
那最终的话
你要在细胞里面测试
在这个组织里面测试
还要作为动物里面测试
然后再让整个人体测试
所以的话
中间是一系列跨尺度的这么一个测试
每个都很慢
越到后面越慢
越昂贵
越越有危险性
所以怎么样能够把这些东西更多的搬到这么一个计算的模拟
让这件事情变得更加这个安全是吧
更加价值高效
更加之便宜
所以这个是其实是既有很有趣的一个商业和经济的价值
也有很多科学的问题在里面发现
我 我觉得 呃
这个是可以值得我做一生的这么一个一个事业
我听起来觉得这个目标非常宏大
有点像星辰大海
就是从这个基因这么这么小的尺度一直跨越到人体的尺度
其实就有点像我们看星辰大海一样是这样的
生物本身就像一个非常复杂的宇宙是吧
它的这个分子的数目
然后可能就和宇宙里面的新星的数目一样
它在这么一个小小的这个个体里面
它有这么复杂的系统
这么多的尺度
其实它本身的研究和对它理解的这些这些东西
它的这个令人兴奋程度不亚于人类对宇宙的探索这么一件事情
那我们这个聚焦一下
我们现在来说说这个afo science
就是ai 怎么样能够驱动science 发展这件事情啊
就今年很多大公司嘛
就像我开始说的
就是都发布了他们afo science 的产品啊
比如说open ai 啊
Srr Pic 啊
包括deep mind 更不用说说了
对
你是怎么样理解这个af science 这件事情
我感觉这个词可能是个busword
感觉是个很火火赛赛道
拿拿它很容易融到钱
但是你是怎么样去把这个这这个词来具象化的呢
对
我觉得就是现在其实有两种主要的技术术径径做aff science 啊
一种技术路径其实就是这些人工智能大厂的路径
它是以比如人工智能的这个coding agent
呃
主要的这么一个引擎
它去做一些工具调用的自动化
然后对文献的自动抓取
甚至是把文献里面去抓取的信息和工具调用的结果整合起来
形成一个假设也好
形成一个报告也好
这么一个路径啊
实际上这个是这些人工智能这些厂商非常适合做的一个东西
另外一个方面其实就是说用更加深入到对应的这么一个领域里面去
用这个领域的数据去把一些
呃
模型做的更好
然后和ai 结合做一些领域specific 模型
包括阿尔法four 它自己也是
就是说怎么样把蛋白质序列变成蛋白质结构这件事情做的很深
做的很前沿
其实就是说没有阿尔法four 和这样的工具的话
其实af 三三它也会被被限制住哈
它是要调用这些工具
然后它工具的好坏其实有很多情况下也决定了它能够出结果的这个上限啊
大概有这么两条路径
就你可以想象
阿尔法four 只是一个例子
就是生命
就是细胞里面还有这么复杂的数据
还有dna 序列是吧
还有整个复杂调控网络
呃
这些东西如果能够更好的建模的话
这也是af for 三ence 的一个关键的地方
你可以想象还有在材料科学
在化学也有这种基于这个领域的这些数据和知识建模
怎么样更好的去去把它甚至是融合到这种基于agent 驱动的这么引擎一起
所以是整整个有两个主线
但是肯定在某个点他们是汇聚在一起的
哎 对 我正想问
就是你说到会
呃
Ai 会应用到对应的领域嘛
现在有哪些领域你看到是af science 最有前景或者说是最聚焦的一些地方
大家最感兴趣的
呃
我看到的哈
就是在
在医疗
在生命科学这一块
这 这是一个
另外的话
在材料化学这一块
其实有
有很多ai for science 的工作
也是说
就是说越来越多的这些知识也是在文献里面出现了
也有方式去呃
生产一些大规模的数据
然后根据这些领域去建一些模型
然后再跟和整个agent 驱动的这个引擎结合
你觉得为什么ai for science 现在会成为现在这些大公司他们聚焦的一个赛道呀
就是到了现在这个时候
对
我觉得首先这也和人的智能的一个特性有关是吧
人 人
人如果有智能的话
其实它的最大的价值是不断的开创一些新的东西
发现一些新的东西
很多情况下
发现一个新的东西它创造的价值或者开辟的一个领域
是比在同一个领域里面不断工程获得的这个价值大很多的
比如说我们发现了这个这个货是吧
他 他是 然
然后人类的社会有个大的飞跃
发现了这个铜和铁
它又带来一种不同的一个社会的形态
工业革命
蒸汽机
它发现了一个这样的东西
然后就引爆了整个整个现代的社会是吧
嗯 所以的话
如果能够用这种通用人工智能技术去不断发现这种能带来人类社会变革的这种新的东西
那它的价值是不可以用以前的那种线性的甚至指数的这种增长的公司的概念去想象
更加像是指数的指数这种增长的新的公司
所以这个方向首先很有前景
第二个的话
现在也变得更可能了
所以很多ai 的agi 的公司都在朝这个方向去去进发
但是是在这个节点
是不是感觉是不是到了一个什么技术的拐点
让大家觉得好像做这件事情可能了
对 首先是在
呃
去年末今年是有一些技术的突破
包括就是说呃
Ai 做coding 啊
做代码生成这件事情变得特别好呃
特别是这个ai agent 和一些工程叫hinees engineering 结合之后
可以让这些agent 在更加长的时间里面自主的工作
然后去去保证一个任务的完完成啊
比如说经常
呃
如果是叫一个博士生来做研究的话
有很多
比如说读文献的事情
以前知道的知识
做一个推理的工程
甚至说要把一个想法变成一个代码程序的过程
很多这样的一些任务的这些环节
其实都可以用ai 来做一个一个完成
而且他完成的水平可能和和个个初的这这gradual 的差不多了
所以这个这个的话
就是说把整个呃
科研前期的这些准备或者一些打下手的工作啊
都自动化了
所以的话
就有可能让这个stea i 甚至是ai 和人结一起去探索索
就是说智能的更高环节
发现一些全新的东西
产
产生一些就是以前没有发现hyyposis 啊
所以这个东西大家觉得就是说更可能了
所以一个是他已经可以做做一些长城的任务了
相对自动化的来加速这个过程
然后第二个可能也是他水平
也就是他的水平也比较高啊
就是每一步都能达到要求
对的
我觉得他
他已经达到一个平均的这么一个水平
然后能够长时间的自己工作
有足够的灵活性
包括刚刚我们前面讲的这个调用工具是吧
把调用工具和比如说文献的这个读取结合在一起
形成一些hypothesis summary
这已经带有一种人的初级智能的这么一个一个一个味道了
嗯 哎
那现在低年级博士生干什么
他们首先要学会怎么用ai
对
然后让他来辅助他们的这个工作
当然大家也用ai 来帮助自己学习啊
所以他们就的训练或者学习要有个转型
要在ai 工具的加持下
怎么样能够去引导ai 或者利用ai 的能力能够
呃
创造一些新的东西
我觉得这个是一个转型的一个过程啊
挺有趣的 对 我
我感觉低年级博士生现在面临的困境也跟现在在工业界有一些说一些那种就fresh h 业就业的那种情景有一点像啊
就是我
我当时看看严宁的一个访谈啊
他当时就是说他前三年其实没什么产出
他就是一直在试错啊
然后一直在重复他的实验
一直在试错
但是他觉得这些经历其实磨练了他
后来包括他怎么样总结他的实验经验啊
包括他怎么样总结他的未来的课题
然后我感觉如果所有的东西现在都这么gradusmooth
甚至ai 就是一口气就帮你完成
而且都是对的的话
我是觉得他们是缺少了这种挫折
对的
是这样的
就是说其实试错的过程中
一就是说对知识的边界的一个探索
嗯
精神方向下
Gragraduate
因为他的知识识还没达到一个完备的情况
所以有很多想法可能前任已经尝试过了
失败了
但是就是说自己不尝试不甘心
然后尝试的时候
哦
确实不work
然后他就对于这个知识的这个边界有更好的一个探索
第二个的话
就是说这个过程中它也形成自己己一一一些向前推进的一些思路
然后就能够比较精准的去做一些实验也好
对形成一些hineoffence 也好
有更加多的正向的反馈
我觉得这个是gradual student 在一开始的时候做了很多事情
对
其如你刚才也提到这个
呃
Af science
他们有自己独特的
或者说你在你的领域有独特的这个harineness engineering 啊
呃
比如说如果我们说generally honest engineering
可能就是在大模型基上
你要做一个产品
假如说我们做一个写作产品的话
你可能会需要给他设定一些边界
让这个产品怎么样更符合比如说呃
写作呀
呃之类的任务
那你说比如说在生命科学领域
你这个harineness engineering 指的是什么呢
对
也有很多honest engineering 包括就是说刚我说到细胞的建模
它有不同的尺度的信息是吧
比如说na 和阿内的关系
和蛋白的关系
它有一个比如说中心法则这么样的一个东西对吧
还有这个整个细胞里面整个调控网络
它是一个完整的整体的这么一个复杂系统对吧
就像我们呃
日常生活经历的物理世界一样
它有一个一致性是吧
比如说某些物体某种匀速在运动
然后你过几秒钟之后再看
它应该从一个位置到另外一个位置对吧
然后还有比如说有一个物体被打碎了之后
可能你回过头来再看它依然是一个碎裂的状态
所以要保持这么一个状态的一致性
所以在生命科学里边
生物里面也有很多这种一致性然后自然规律去限制的东西
你要对它进行一个模拟
甚至基于模拟进行预测
首先你要把这些规律抓住
所以的话
很多情况下啊
包括这些呃呃
哈金森engineering 啊
或者序列模型之后的一个lemon 的过程都是需要的
让它更加和生命科学这件事情
和生物本身这件事情有很好的一致性啊
所以有点像把生物领域的一些先验知识
生物理的一些定律房子放到这个模型里
让他会遵循
至少需要遵循这些先验知识和定律来进行运行
一方面就是说刚刚我们前面提到的一些提效的一些东西
读文献啊
写代码啊
然后啊
啊
除此之外就是很多情况下
Af 三这些这些模型或者工具需要学到的就是那个领域的一个domain knowledge 领域的知识
或者一些一致性的一些条件
让他才能作为一个合格的这么一个科学家
对啊
其实我接下来想拆解一下
就是做science 嘛
其实它有一在传统里头其实是有一定之规的啊
啊
比如说我们可能会观察到一个现象
然后我们接着可能去读文献
刚才你也说到读文献现在确实是可以提效啊
接着可能需要
比如说我根据以前人的一些
呃 观察
我提出我自己的一个假设
然后接着可以有计计设计验验
然需要做实验
验后接
接着你需一些科学件看一下验证一下
看你的结论对不对
然后最后可能会形成一套理论
你觉得这些链条里头哪些环节是现在ai 已经介入的
哪些是还不行的
凡是能够形成公式的这么一个环节
然后有一个可循的可以重复规律的这么一个环节
其实ai 都可以做啊
然后比如说一些逻辑推理
根据已有的定理做逻辑推理是吧
然后根据已有的数数学公式做推演
或者根据已有的一些逻辑的这些假设
呃
根据这个知识图谱或者是信号通路去做一个推理的这个一些过程其实都是可以去被ai 化的
自动化的啊
凡是有一些带有创造性的
然后有一些要跨领域思考考验证然后抽象的这些些务
其实就是是ai 较较难做一些事情
嗯 哎
可不可以举个例子啊
你觉得比如说哪一些科学发现是符合就是按照推理或者逻辑推理就能实现呢
对
比如说的话
就是像
像加法是吧
加法是很简简单一个例子
就是说先我们学一位数两位数的加法
然后有个规则他可以推演到
就是说可能一千位一万位的这么一个加法
对人来说位数越多他
他加起来的速度越慢是吧
但是这个规则有了之后
其实这个机器是很容易去做这么一个根据规则的推演的
当然也有很多逻辑的这个推演
比如说像有一个
呃 知识图谱
这个人是另外一个人的朋友
这又是另外一个人朋友
然后他们之间可能有一个有一个有一个有个不好的关系
然后你就推说a 和b 他们之间有什么关系
实际上这种带有逻辑推理的东西都是比较容易进行的
然后还有一些包括就是说呃
带公式去分析数据的这些东西都是比较容易去自动化的一个过程
你看 嗯
这些东西可能人来做一是精力有限
第二可能也没有不太可能在所有的这个搜索空间里头完成所有的计算
但是ai 就非常擅长
对的
Ai 是可以根据这些规则不断的去推演
他可以做很多枚举
然后就用上大量的计算
然后就可以把可能人脑呃
想不过来的一些可能性他都去计算
只要有一些推理的规则
他都可以进行一个搜索
然后他把那些最可能的结果都可以展现出来
其实最早的时候呃
人们用计算机来辅助数学证明的时候
就是用这个个计算机去做这么一个枚举去
去把那些可能性都一一的去探索一遍
然后再得到一些证委或者证实的这么一个结果
现在有了人工智能之后呢
它首先这件事情可以做的更加之高效以及更加之灵活
另外话
人工工智能有有一定的就是快思维的能力哈
有时候他也会做一些跳跃的
然后甚至是出现一些
唉
我们觉得挺有趣的一些新的结果的
我突然有个想法啊
就是比如说你像我们高中生的时时
曾经经探过那个个个就那那个可能一通过豆豆他实验杂交
然后得出来人体有遗传因子这么一个结论啊
他其实当时就是说他做豌豆花杂交
然后发现他的第一代那个什么皱皮跟原皮是三比一
然后第二代是什么九比三比三比一
所以他就说啊
根据
如果是根据统计的话
那我就能得出来身体里头肯定有这个遗传因子
然后他能随机的这样分布
最后得出这种结论
你觉得如果是ai 的话
他观察观察到这种就是三比一的这种比例
他能推论出说我们人体里头一定会有一个遗传因子这个结论嘛
我觉得还是挺难的
虽然这个孟德尔的这个实验看起来很简单
从
从这个modern 的角度来说是吧
这整个统计的
但是这件事情其实让ai 做是是挺难的
因为 呃
在做这件事情的时候
孟德可能没有一个清晰的目标啊
他
他就是观察到这么一个东西
然后突然有一天
唉
我来看看这个豌豆的这个表情啊
花瓣的形状或者是高矮的这个情况
和我这个
呃 到是是怎
怎么样来解释他是吧
他就 他就
他就形成了这么一个基因的这么一个概念
因为当时大家谁也看不到基因
谁也看不到分子是吧
但是他怎么样用这么一个带有创意的方式基因这么一个概念来解释他看到的这个现象
我觉得这种开创性东西现在对ai 还是很难的啊
虽然他推推理的规则是很简单的统计的规则
但是要开创性的把就创造这个基因这个东西
然后来解释他看到的现象
这件事情其实是我觉得是人类智慧的一个一个
呃
最高的知识点
其实有很多后面的例子也是这种开创性的思维
往往是这些开创性的思维带来人类的这个整体的这个思维的这个拓展
然后后面沿着这个思路下去
有很多各种各样的新的结果
然后对一个领域的完全的理解
这种东西其实是ai 比较难的
也是其实现阶段如果要用ai 做真正有创意的科学的一个非常需要去突破的一个技术
他其实从联联
联系这个东西现象到这个
呃
他的这个假设之间其实有一步跳跃
但是这个跳跃可能就是ai 不擅长的
但是如可能就是说你说他这个目标很不明确
其实你也不知道要做什么
这个问题也没定义清楚的话
我感觉可能ai 自己也很抓下啊
对的是的
就是说ai 特别擅长目标比较明确的事情
虽然现在的ai 也有一定的跳跃的能力
但其实它这个做科学发现有个非常重要的就是说他医要有跳跃
但是跳跃了之后呢
他要回过来去把两个似乎不关键的事情再用一步步的逻辑去补全的这么一个程程
断断跳跳跳
补全
然后收缩conconverch 到一个点
其实有很多例子
包括呃
信息论里面啊
就是现在的这种一个数字通信啊
然后这个数字这个信号传输的一个基础的叫信息论
它有个非常重要的概念叫商软
它是用来去测量比如说信息量的大小这么一个东西
它后面引引发了一系列的信息论
虽然它也是一个跳跃
原来商这件事情是在物理学里面去去对物理的这个体系进行建模的
像香农
他就把这个熵这个东西去
呃
这个计算公式用在描述信息上
而且是证明了说啊
用这个 呃
这个对应的公式来描述信息量大少小
是符合我们对信息的一个刻画的
所以他
他就是做了一个跳跃
他就是把一个好像不相关的两件事情联系在一起
然后通过一步步的逻辑推演去证实它是可行的
实际上大量的这个科学发现其实都是先是有一个看到大家看不到的联系哈
有这么一个跳跃
然后再通过逻辑推演数学推演的方式慢慢的收缩
收缩到一个自洽的这么一个阶段
以及能够去根据它去做一些未应的预测和和解释
包括爱因斯坦的这个这个能量和质量的关系
啊
我
我又想到一个例子啊
我感觉个例子也个ai 可以
但是我不知道
就是当时我们也是高中学那个化学元素周期表的时候
不也说
说是门捷列夫是分析了已经发现的这些元素哎
发现他们有这个这个这个规律
然后就预测说
哦
那如果根据这个规律的话
我们还有这些这些这些元素还没有发现
你觉得这件事情ai 可以做吗
这样的
其实他后面也有一个规程
就是有点像一个我们叫做inductive 就推演的一个过程
如果对
也是一个推演的过程
然后其实这种元学习的这种机制
或者原思考的机制如果能够被程序化
其实你也可以让ai 去做一些这种创造性的东西
因为他就是也有一种思维模式是吧
根据能够的的东西
然后推演出n 加一n 加二会发生什么东西这样的一一个一个过程
他开始可能也是观测到一些元素
他有这么多的
呃 自子中止
然后多多少的外面的电子
然后他就
他就把他们关系过程
呃
做成了一个公式
然后再推一推前面的几项是正正正确的
那他觉得后面也是正确的
大概就是这个归纳的方式
其实如果能够变成这种元的推理规则
其实也是可以被自动化的
嗯
但你觉得你对这个
呃
未来是乐观的吗
我觉得是可以的
因为大家现在已经意识到它的一些缺陷
那其实原推理的框架它就是说并不是在一个问题里面发起发现它有用
而是说这些原推理框架实际上在多个问题里面都有用是吧
那样的话
你就可以逐渐的把发现原推理的这些框架规则的这个过程变成一个目标明确的可以程序化的东西
慢慢的话
就是它可以积累这么圆推理的一些规则
甚至是通过多个这个场景的一个测试
看这个原推理框架是不是正确
然后慢慢的你你可以想象这个是一个迭代的一个过程
或者是它可推框架架下面面又有更加之就是说本质的可能原原推理框架是吧
都是有个更加抽象的这么一个规则
则可可以生生更加的规则
大概是会有这么持续的一个迭代的过程呀
嗯
那你觉得这个是按我们现在这个skaling law
就是数据
然后呃 算力
然后以及这个算法可以解决的问题吗
可能不是现在的这种训练方式和简单的把模型推大
可能是要在现在的这个大语言模型或者colding a 卷之上的一些新的系统的框架或者一些新的一个设计
才能够更好的让那个不断的抽象
不断的发现推推框架架这件事情去向下走啊
现在这个价构比较适合说在同一个推理框架下去不断的去做
呃 啊 这个演
演化
然后不断的去做推理这么一个过程呀
嗯
那你觉得未来ai 可以替代人类科学家吗
我觉得他永远是一个就是说呃
能帮人做一部分事情的这么一个过程
然后人总是探索更加前沿的一个东西
就是其实智能或者是推理的这些框架展也有很多层次
然后我们也提到了几个层次
所以人似乎在现阶段的话
还是非常擅长就是说把一些没有联系东西联系起来
然后去产生从另一个新的一个规则觉得
虽然我也认为这件事情是乐观的哈
但是我会觉得以后感觉人类科学家存在的价值好像越来越少了
对层面上说
人是会需要呃
寻找更加之互补的方向
但是如果从另外一个角度来说
机器作为人的一工具
能够很好的和他相处
一起去推进整个人或者社会的发展
这
这其实是也是一个很exciting 的一个过程
然后现在ai 的发展也并不是说一天就到位
也有一个过程
所以我们有足够多的时间在中间去学会和和这些ai 共处
和他怎么样一起去干活
然后能够把事情干得更好
我相信新的技术出来
人走势能找到一些新的啊
可做的事情
大概是这么一个情况
那我们刚才就是扣了个ai for science 的这个大大的帽子啊
然后我觉得下接下来我们可以更加细分到具体的领域里头啊
也就是ai 在这个生命科学里头的一个应用
然后孙波老师
其实你现在在创创业的家公司叫je bio ai 嘛
可不可以跟我说说
呃
具体是在做一些什么样的事情
对jam by ai 的话
我们希望就是说对这个生命啊或者生物然后进行一个建模
或者是去学习到它的一个基础的模型
那样的话
就可以在这个计算机里面模拟一些疾病相关的实验
药物的这个测试的实验
但可以加速整个比如说我们对这个药物的这个研发的过程
更好的去啊治愈一些疾病
那现阶段我们主要的呃
一个聚焦的点就是在虚拟细胞这一块
我们希望对这个细胞这个体系去把它的一个世界模型构建出来
能够去抓住生命里面的一些中心法的这样的一些还有调控机制
这些细胞里面啊的一些非常之玄妙的或者是amazing 的一些一些一些东西
那样的话
才可能说用这么一个模型去做一个药物的筛选
做一个有可能新的靶点的发现
去治疗一些新的一个疾病
现在是我们主要是在构建这个细胞的世界模型
对虚拟细胞其实我们之前做过一期节目
然后感兴趣的听众可以去听
那个是更偏科普
然后我所有老师
我跟你说一下我对这个虚拟细胞理解啊
啊 就是 呃
相当于是呃
把细胞里头所有的这些基本的这些分子吧
像dna 或者是rna 然后蛋白质
呃
给它建一个模型
然后这样呢
你当你比如说有一个疾病由一个基因突变的时候
然后你就可以看到说这个细胞有些什么样的反应
或者说你给了一个药物
你可以知道这个药物
呃
在不做实验的情况下
就知道这个药物是如何怎么样扰动了这个细胞
让这个细胞导致了一些什么样的后果
对
这是我对虚拟细胞的理解啊
但是我听你说的这个一个词叫
呃 世界模型
这个是我第一次听到
对
你可不可以展开说一下
就是你怎么样理解这个虚拟细胞
Dn
然后第二是这个世界模型要怎么样讲
在生物界的这个世界模型
首先它需要能够抓住细胞里面多尺度的这么一个信息
因为如果你看一下这个dna 和蛋白质
它的这个尺度大概是纳米级别的啊
然后但是你到了整个细胞的响应整个细胞的这个表型之后呢
它是一个微米级别的
大概是几十微米
所以这里的跨度就有一千倍的跨度
所以怎么样把像
呃
细胞里面的像dnarn 蛋白
整个细胞的这个这个活动细胞和功能的整体的构建起来
所以这个需要对各种尺度符合各种模态的数据一个整体的建模
他们要有一定的一致性
所以的话这个的话是不容易做到的
然后第二个的话
就是说要对细胞的行为进行模拟
它也是一个带有状态的这么一个东西
很多情况下我们做这个生物的实验室
先在什么温度什么样的营养条件下
先把这个细胞赋育镇子
然后再去丢一个呃
药物
看它的这个反应怎么样
所以它是持续的经历了一系列的这么一个操作是吧
所以你要说从状态a 转移到状态b
转移到状态c
在这样的物理化学的条件下
所以这个虚拟细胞
呃
总结起来它需要几个关键的一个能力
包括多尺度多模态的这么一个细胞的信息的模拟
第二个的话
是一个带有状态的这么一个模拟器
它可以接受一系列的对细胞的这么一个扰动
然后你可以把这个状态在这个模拟器里面推进
这么一个过程它才他能叫做一个世世界模型
其也很好做一个在物理世界比较理解的这么一个类比
包括就像巨身智能的世界模型型吧
他
他就是需要知道这个机器手臂和机器人
比如说在一个厨房里面
他先拉了一个盐
然后放在
呃
这个桌面上
然后你再去拉这个菜去洗干净是吧
然后他
他要回过来又去拉盐的话
那他知道盐放在哪里
或者他有一系列的操作
然后这个世界里面有一定的状态
要要能够去把这些状态记住
然后他能够甚至是推演出未来会发生什么事情
那他才能反过来去计划说
我可能为了炒好这个菜
可能要做abc 才能够成功
同样的话
这个在好的对的细胞里面也是这样的
它要对多种的这种分子和多种尺度进行建模
同时要要把整个细胞经历了什么
它的状态怎么变化这件事情要模拟出来
然后才能反过去说啊
在这个对应的靶解施加这个对应的药
它能够可能引起细胞怎么样的变化
所以是是为什么世界模型
以及世界模型所需要的一系列的元素是非常适合对这个细胞来进行建模的
对虚拟细胞这件事情变成一个具象化的可操作的这么一个建模的这么一个定义
说到尺度
其实就细胞而言的话
应该是比如说像从dna 到rna
从rna 到蛋白质
然后再再从蛋白质到整个细胞水平
是不是在每一层其实已经有一些基础模型了
对的
就是我们也构建了很多每一种模态的或者每一种分子的基础模型
这个是一个必须经过的这么一个呃
过程啊
其实在这个通用人工智能里面也有类似的这么一个阶段
你
你想想最早缺gbt 出来的时候
它就是一个文字游戏的工具啊
你可以跟它对话
然后它可以生成文字
你也不能用音频
也不能用这个图片给它
所以的话
后来的话
这个像open ai 和其他公司它也训练的图像的这么一个我们叫预训练模型和表征模型
然后再通过一些同时具有呃
文字又有图片的这种叫做呃
成对的数据
或者叫做这个我们叫parallel 或者pair data
然后把这种跨模态的这种ai 的能力去慢慢的去训练到模型里面
其实对这个呃
生物的世界模型也是类似的
首先要能够去理解单个模态的分子
包括dnadna 上
甚至它自己也有很多mutation 带来它
这比如说细胞的不同rn
然后蛋白它也是一种模态
所以先要对这种模态的理解
然后再通过一些整个细胞层面的一些成对的数据
就可以把这个世界模型的不同的的模态去进行一个一个整合
训练到同一个模型里面啊
这个实际上是人工智能里面躺过的很多路哈
很多的这个这个发现很好用的一些训练的方式
当时就是说比较容易做的一些一些训练方式
其实在这个训练虚拟细胞过程中
也是可以搬过来的
迁移过来
然后让虚拟细胞训练这件事情变得更加之准准确高效
所以细胞里头这些不同尺度的分子
就有点像从文字到音频
从音频到视频
然后从视频可能再到现在机器人他们学习的那些世界模型
对
是这样的一个一个过程
然后如果就发展水平来讲啊
你觉得现在虚拟细胞发展到了一个什么样的程度
对
现在虚拟细胞发展还在比较早期
有点像阿尔法four 一的前夜
或者是阿尔法four so
这个就快到了这么一个时间点
那个时候大概是二零一八年一九年的样子吧
当时就是说也是deep ma
呃
它展示了用这种深度学习的模型能够把这个蛋白质结构预测这件事情做的比前面的模型更准啊
但是直到到阿尔法for 二两年之后
这个它的这个水平才让
呃
很多人认识到
就是说这个端到端训练的模型
它能够比就是说很多其他的模型的准很多
然后以及有些预测也达到了实验的精度
所以的话
时间节点现在大概像是阿尔法for 一的这个时间节点
可能再过一两年阿尔法for 二
再过一两年阿尔法four 三这么一个节点
至少就是说在这个可能四年五年的这个阶段里面
会达到一个这种阿尔法four 的三的阶段
就有很多这个虚拟细胞可能可以已经达到这个工业界可用的水平
什么样一个标准是工业界可用的水平啊
其实这个定义也很简单
因为现在很多情模况下
看细胞怎么样响应药物
或者在进行销售后细胞怎么想
都有一些生物实验你可以做一个
比如说重复的实验
两次敲出做同样的细胞
同样的敲除
然后你看两次敲除它的这个误差或者相关性是怎么样的
如果我的这个ai 模型它能预测的结果和两次试验重复的这种相关性差不多啊
比如说达到一个八十分的这么一个水平
那其实预测的结果就和重复的实验一样好的结果
那个时候你就可以用这个虚拟细胞去指导你去做一些一些虚拟的实验
而不需要做试实验了
当时实际上阿尔法for
呃
二或者阿尔法for 三
它到一个可用的程度
也是因为有些结构的预测
它预测出来的结构已经能够达到这个实验的精度啊
唉
其实我看到二零二五年在nature
呃
应该是nature method 上上有一篇文章
它其实是测试了现在已经有的这些用深度学习建立的这种
呃 模型啊
然后它的结论是说
呃
当你想敲除一个基因
想预测它的结果的时候
所有的结果其实还不如现在已经有的线性模型
对
这有几个因素在里面
一就是说呃
生命科学很多以前的数据哈
它是以发现为驱动去产生的数据
所以有数据里面本身就有很多各种各样的就是一些噪音batch effect
也就是批次效应
这样的数据其实对i 的模型的帮助不大
就是很多情况下是需要有系统的产生的在同样的控制条件上产生的数据
这样为给ai 它才能够做到一个更好的
第二的话就是说
呃
因为有这种数据噪音的缘故
其实ai 它不需要
就是说一定是非常之大的模型
它就能够把数据里面的一个信号去抽取出来
其实
其实我是相信scalling 了也是在细胞的这种数据上存在的
但是现阶段的公开域里面的数据
它其实有很多同一种类型细胞的重复的测量哈
虽然你可能测了一百万个细胞
可能都是同一个人的血的细胞的测量
他们之间的这个
呃 变化很小
所以它真正含有的信息量比较少
你并不需要一个非常大的模型去把这个信息抽取出来
所以的话
其实相对简单的模型就已经能做的比较好
但是随着数据的质量的升高
量的增加
嗯
你不可避免的会需要更加大的模型去把这些信息去呃抓取出来
比如说在这个呃
已经数据量比较质量高的蛋白质数据里面
我们已经清晰展示了这个scaling law
然后如果这个单细胞的数据
呃
我相信也是这样的
它质量不断的提高
那scalallow 很自然的就会在这个领域里面起作用
其实也有一些其他的机构在它自己产的一部分的数据里面已经展示了这个scaling law 的这个存在
嗯
你觉得需要多少数据啊
或者多少个细胞的数据啊
如果从细胞的量来说
现阶段其实并不是一个关键
然后更加像是细胞的种类啊
对
我们希望看到比如说各种各样不同类型型心脏细胞
肝脏细胞
神经元是吧
皮肤细胞
甚至有某种疾病状态的呃
细胞
甚至是说人与人之间的细微差别的genetic law 带来来的对药物不同响应的这种数据啊
就是说带有信息量的数据
这个是非常要的
然后其实你在看公开域里面的单细胞数据已经超过了一亿
可能大家估计很快
可能明年就会到
呃 到 到十亿
然后产生单细胞数据的量是很快的
但是这个量并不是就和信息量直接挂钩
所以的话
怎么样去决定你做哪一波实验
其实能够用ai 的方法去做一个规划
其实有可能能够在更少的这个数据量的情况下
也能够把这个模型的这个提升带来一个更大的一个一个提升
哦
你说用ai 来对实验进行规划
对
这个其实就是在af science
或者是说这种在呃
闭环的这些科学发现里面
有非重要要一一一个点就是ai
它其实不是说给到数据就学习这些些实验
其实还有一个个产生自己产生一个我们前面提到一个个hyposis 一一个假设是吧
甚至是产生一个数据需求的规划
他自己去有些方法去算出来这样的数据可以帮我更大的提升
因为我在这一个点上不太确定
所以如果能给我这么一个数据点
我可以我把自己的这个不确定性降到最低
如果这个点能给我
我可以把我的知识拓宽的多少就有点像人的主动学习一样是吧
他其实ai 也是可以产生一些假设
然后对自己的呃
这边界有一个刻画的
他可以根据这个需求来去要求数据
所以的话
不一定是数据量越大越好
更加像现在呃
特别是ai 科学
在我们虚拟细胞里面有一个ai 的主动产生这么一个假设的过程
它实际上可以让数据本身的产生变更高效
需要 呃
可能不一定那么大的数据但是能够有针对性收集更加的信息量
然后让ai 的模型更快变更好这么一个过程
对
然后这个是数据
那在算法上也有瓶颈嘛
我先说一个我对算法上的疑问啊
为为你不管是dna 还是rna 还是还是蛋白质
它们其实都是某种序列嘛
所以我理解这些模型其实都是基于transformer 的
然后他们其实是根据这种序列来预测它的
不管结构也好
或者是功能也好
但是你从蛋白到细胞这一步啊
其实你这个蛋白的复杂的这种网络
然后到细胞这一步
其实我感觉他们就不完全严格的是这种符合序列的这种特征了啊
所以我不知道依然可以适用transformer 架构吗
还是说我们需要一些新的这种架构和算法
对
我觉得你的理解非常好
就是其实是需要很多深度学习架构的创新的
然后就像蛋白质结构
它是有带有三维坐标的这么一个数据
它并不是像自然语言是个线性的这么一个序列是吧
所以它的用的这些神经网络的架构啊
是很不一样的
甚至说在这种情况下
图神经网络或者叫几何深度学习它起的作用更大一些啊
其实就是说有趣的就是说
呃
深度学习科学家或者是说算法的同学
他是不断的去设计新的架构
或者甚至叠加一些新的训练的算法
目标就是说在同样的数据下
能够把这个模型的
呃
训练的更加之准确
以及训练的效率更高
所以其实你看到最近的这个大模型的不同厂商之间的竞争就是我怎么样把我的架构做一些创新的优化
然后让他有更加小的计算量
能够把模型训的更快更好
包括这个deep seek 这这些模型的出来
也是说在架构上的一些创新
让他整个训练变得高效
推理变得更高效
这也会去呃
形成一个从面上说商业竞争的一个优势的这方面的的一个技术
就是刚才说了架构嘛
在算法上还有一些什么其他的呃
瓶颈或者说是创新嘛
我觉得就是说算法上的一些创新也是结合着需要什么样的数据来提升你的算法
有一些可能就是说在算法迭代过程发现一些新的数据啊
发现这种数据以前人家没有用来做做训练
但是通过这种新的数据加入新的算法的设计
它能够把这种信息去吸收进来提升啊
我觉得这个肯定在后面的算法迭代里面也会发现很多这样的东西是吧
比如说原来在这个蛋白结构预测这块
大家发现最直接使用的单就是有三维结构的数据
但是慢慢的大家发现的话
没有三维结构的
呃
这个信息你只有告诉我他
他是是是使接触的这件事情
它比如说两个安基这弱残期它是不是接触这件事情也能带来一定的信息量
所以的现这种弱标签弱监督我们家的数据有可能说会在后面的算型带来提升
对
然后刚才说了数据
然后说了算法
你觉得还有什么瓶颈吗
我觉得这个领域是一个交叉啊
呃 科学领域
应该是把领域里面的key play 的考虑进去
除了这个模型算法之外
其实还有很多
呃
做这个生物工程是吧
做这种新的测量手段的公司也是在不断的去创新演进是尝试
就是说用更更高通量
更加之精准
更加之便宜的试时验长更加多的数据以及呃的创新的团队和公司也越来越思考怎么样才适合ai 模型的数据
所以这个也是高速发展的
如果你把这个算法的发展和这些测量手段的发展放在一起看
我觉得这这他们是相辅相成的
然后螺旋迭代上升的
所以的话就是说
呃
这些领域的这些提升也是很重要的
我觉是aif 三做好这件事情是是同时要层面上说
理解这两个领域的这个这个前景
然后才能够在合适的时间点层面上说
你做一个合适的这个模型
去把现在的一些数据吸收到
甚至是预判了未来会出现什么样的数
嗯嗯
其实我觉得现在我们能拿到目前有的这些数据
也是得益于单细胞测序这个技术的发展
对单细胞测序我觉得这是一个非常重要的助推的这么一个数据的形态
然后大家发现就是说啊
还有像cris spper 这种基因脑动消除
然后能够测这种基因表达
这种技术也是在不断的发展
变得更加越来容易做
这也是推进这个这个呃
技术向前发展一个非常重要的因素
唉
那你觉得失实验闭环是一个瓶颈嘛
因为不管你怎么样的呃
前面呃
用virtual 的方法
模拟的方法预测出来什么样的表情或者什么样的
呃 就是机制
你如果没有实实验的验证的话
是不是也很难闭环
我觉得肯定是模型要和试实验进行闭环的
现阶段失实验
还是作为这个af 三三或
或者生命消除这么一个精标准的形式存在
然后最终的这个ai 预预测是要通过实现检验去要发现可行才行
嗯
但是我觉得实
实验这个他做实验的速度还是比不上这个
呃
计算的筛选出来的这些候选分子的速度快呀
对
我觉得实验它是受到物理世界的一个限制
所以的话
这就是为什么我们要尽量的做更加多的计算
是你做更少的这个四实验的缘故了是吧
如果我们能够通过在这个计算机里做更加多的计算
你可以原来你做十倍的计算
现在可以做一百倍的计算
就让它计算时间久点吧
你
你是可以把计算时间和实验的时间match 起来是吧
只要你通过计算能够获取新的信息吧
那计算就是有价值的
那它的时间match 起来之后
就就像有一个整个机器
你那些齿轮之间它要配速要达到一致
他才能达到一个最高效的运转的过程
所以的话
其实的话
就是你希望做更加多的计算
让你去挑选出来要做实验的那些成功性更高
那你虽然实验的这个程序比较长
但是它都是成功的
那
那整体的这个过程就变成高效
大概是这么一个逻辑
就是相当于在计算过程中提高它计算的准确率
就是这样筛选出来的某些分子就
其实它可能
比如说以前你要筛一百个
现在你只用筛十个
然后这十个里头就有
就有
有你想要的那几个
对 是这样的
你就不要再做第二次实验了
第三次实验了是吧
所以整体的这个过程就就加速了
其实医药研发过程中
很多情况下它可能一个管线同时会尝试很多个分子
然后可能尝试十个分子
也许中间只有一个是成功的
所以它平均下来的话
一个分子除一个成分分子
那它的价格就很高啊
因为它有还有九次不成功的这么个过程
以及把时间加起来
中间九次不成功的时间加起来
那整个高
如果我能够在这个进入这个比如说临床的这个分分子面就过很多计算
算出出来两个分子肯定就有一个是成功功
那果我能大加提高效率率
呃
降低了成本对吧
嗯 唉
那你觉得虚拟细胞会在哪一些场景里头先落地呢
对虚拟细胞的话
它其实在医药的这个研发的环节有几个呃节点都可以有落地
一就是说在比如说像一些细胞疗法上面对吧
呃
它会比如说对这种呃
人工诱导的干细胞这些方面怎么样更好的让细胞分化
可能是有一个落地的场景
或者是一些免疫疗法
T 细胞疗法
它能够做免疫细胞建模
模够够么更好的让免疫免疫细胞去激活
去识别病毒
这些方面会有落地
然后或者是说你有一个呃
虚拟的肝脏细胞
它对呃
这些药物的呃
有毒和与否独立的一个分析和预测对吧
它能够去做一些应用
这也是虚拟细胞可以落地的地方
除此之外呢
就是其实如果能构建虚拟细胞
甚至说根据疾病的一些
呃
比较少的数据去构建一个比较准确的虚拟细胞
它也可以在前面的像激病的理解
寻找一些疾病的靶点方面去进行一个落地
然后有了其实虚拟细胞的这么一个模拟能力
然后你可以在虚拟细胞里面去尝试很多深层设计的小分子和大分子
看它是不是能够获得你想要的细胞的响应
所以在这个从临床前到整个就是说前面的疾病的理解
分子设计
虚拟细胞都有一些
呃
具体的落地的点
嗯
其实在有一些大厂里头
他们其实已经有一些预测模型了
只是我觉得可能还没有达到
就是说你说的这种世界模型或者说是那么完备的一个结果
但是可能在一些局部的
就像你说的某一种疾病
比如说呃
肺癌 肝癌
或者说是某一种特异的细胞
你比如说像免疫细胞
其实已经有一些这种落地的
嗯 Case 了
对的
就是针对某一种类型的细胞的一些预测模型
就是大家从机器学习开始有了
一直在使用我觉得世界模型或者这些人工智能机
我尝试做的是对比如说细胞
人的细胞的一些
呃
更深层次规律的理解
让你能够更好的泛化到一种新的可能原来数据比较少的
或者实验比较少的这么细胞类型啊
我们的这个比较长远的目标就是说能够把人的这么一个细胞里面的这些规律的学到对吧
这样的话
就是说可的这一新的疾病类型的细胞或者人的这些细细的情况有更好的一个预测
所以的话
要做到这么一个我们定义的虚拟细胞
或者是虚拟细胞的世界模型
还是需要很多算法上的创创新的
甚至是要增增加更多的的据据
让去去做更好的
你觉得要达到你的细细细胞或者说是商细的目标得要多长时间啊
其实可以做个类比
然后它像阿尔法for 二和三一样
就是它也没有完全解决蛋白质折叠这个问题
就是它在有一些进化保手的蛋白上
它就是说可以达到实验的精度
但它的这个准确率也是一个长尾的一个问题
就有还有很多类型的蛋白它也做的不准
比如说就大家最关心的像抗体和抗体和抗原的结合
它可能现在的这个能力也只达到六十七十分
但是就是说它没有全限的去把它的精度达到一个实验精度的成对面
它也是可以找到很多落体的场景
现现阶段的很多生成的抗体生成小分的设计都用阿尔法four 啊这样的模型来作为一个工具
我觉得虚拟细胞也是类似的
就是说它要完全的解决对细胞模拟这件事情可能也是一个长尾的
总是有一些疑难杂症的细胞
或者有一些特别的个人的一些一些突变的这么一个场景的细胞的场景不能被非常好的建模
但是可能就是随着这个虚拟细胞的这个水平提升
越来越多的可能细胞类型它有更加准确的模拟的
那这些类型的细胞可以先落地达到一个商业的层面
现在大概是阿尔法four 一的这个时间点啊
我相信在下个版本大概是阿尔法four 这样
呃
这么一个版本的虚拟细胞的时候
他应该会找到越来越多的落地的场景的
可以找到一些先可以落地的场景
然后我们在不断的提升这个虚拟细胞激模的能力
让它能够cover 住是吧
泛化到更加多类型的细胞
那又可以找到更加多的落地的场景
大概是这么一个过程
嗯
就是可能到七十分就可用了
但是从七十分提高到九十分还需要很长时间
但是也不是说必须要到九十分你才能进行商业落地
对的 嗯
是这样的
明白
宋老师还有什么想要补充的吗
啊
没有什么特别多补充的
然后我觉得今天我们聊了很多这个aff 三
然后特别是这个aff 这这块的东西啊
这个领域也是不断演化的一个过程是吧
大家不断的探索的一个过程
所以它本身也很没有趣
中间的话也会有一些商业的落地的点
甚至是说就是说投资人对这个的兴趣
我觉得这些都是这个领域开始繁荣
开始更加多人关注
开始在大步向前次的这么一个好的这么一个一阶阶段
这个确实令人得非常exexiting 点
嗯 是的是的 哎
我觉得我之前对as for science 这件事情就感觉是个很大的帽子
然后每个人都在说ai for science
但是也不知道究竟它就是把ai 放a 在哪个地方
但我我觉得今天聊完以后
我感觉它变得更加具体
然后变得更加可感一点
对的
其实就是要在理解深层次一点
包括ai 技术本身它能做什么
能不能做什么
Science 它本身有些什么东西
Ai 抓住了什么没抓住的东西
这两个齿轮之间有一个清晰的理解
然后在合适的地方结合在一起
就可以把这个整个机器运行起来
让让它更加深好的向前走
啊
好呀
那我们今天就到这里吧
啊
谢谢宋老师好
谢谢 拜拜
今天的科科知知知道到这里了
听完之后
如果你有任何的的想欢
欢迎评论区和我们交流
如果有任何想听的话题
也请告诉我们
如果你喜欢我们的节目
请记得分享给更多的朋友
那我们下期再见
下期再见
跳舞跳哦