Anthropic 生物实验室首份成果:Claude 自主发现类 CRISPR 的 ART 酶系统

Anthropic 生命科学实验室首度公开成果:仅给一句提示,约 950 个 Claude 智能体用 21 小时、2.1 亿 token 筛出 20 个候选,发现类 CRISPR 的 ART 酶系统,张锋评价值得深入研究。

Anthropic 的生命科学研究团队公布了一项早期成果:在科学家只给出一个高层级提示的前提下,Claude 自主发现了一个此前未被描述过的酶系统,其结构与 CRISPR 有相似之处。团队将它命名为 ART,即阵列相关逆转录酶(array-associated reverse transcriptases)。这也是 Anthropic 设立生物实验室之后,第一次把研究成果公开出来。

DNA医疗科技背景

一个只给提示、不给方向的实验

在这项研究中,Anthropic 的科学家只做了一件事:写一句提示词,让 Claude 去庞大的 DNA 序列数据库里寻找有意思的新型逆转录酶。剩下的检索、判断和筛选全部交给 Claude 智能体完成。据团队披露,大约 950 个 Claude 智能体连续工作了 21 小时,消耗 2.1 亿 token,累计收集到 20 多万个逆转录酶。在此基础上,它们挑出 3,500 个新的候选系统,进一步收窄到 20 个最值得关注的候选,并逐一写出人类能读懂的分析报告。同样的工作量如果交给专业科研人员,通常需要几周甚至几个月。

逆转录酶(RT)是一类把 RNA 复制成 DNA 的酶。团队指出,这个酶本身在此前的研究中已经被识别过,它来自一种巨型噬菌体;Claude 的贡献在于,它似乎是第一个注意到这个系统关键特征的对象——旁边成阵列排列的非编码 DNA 序列,以及一个功能未知的附属蛋白。检索过程中,一个智能体在看到逆转录酶附近的原始 DNA 序列后直接写道:紧邻逆转录酶的这段 DNA 非常惊人,肉眼就能看到串联重复阵列,看起来像是一个类似 CRISPR 的重复阵列。

ART 由三部分组成

ART 主要存在于噬菌体(感染细菌的病毒)中,由三块构成:逆转录酶本身、紧挨着它的一个伙伴基因,以及一段间距均匀、长度很长的 DNA 重复序列阵列。这种重复序列的排布方式与 CRISPR 阵列相似——后者储存着一批不同的 RNA 序列,正是这些序列让 CRISPR-Cas 系统成为可编程的生物技术工具。

初步实验显示,ART 的阵列同样会被表达成一组各不相同的短 RNA,这提示该系统中可能存在类似的机制。不过,ART 的具体功能目前仍在研究之中。Anthropic 表示,理解 ART 主要功能的工作还在继续,之所以选择这么早公开,一是为了展示 Claude 的能力,二是让更广泛的科研社区了解他们正在做什么。相关的预印本已经放出,其中对细节有更完整的讨论。

CRISPR 基因组编辑的先驱之一、MIT 与 Broad Institute 教授张锋在读过预印本后评价说,这是 AI 智能体参与生物学发现的一个令人兴奋的例子,识别出与逆转录酶相关的 RNA 重复阵列确实很有意思,值得进一步研究;他希望这项工作能鼓励更多科学家去探索 AI 如何支持自己的研究。

为什么这类发现值得关注

历史上许多改变生物学与医学的发现,起点都是某位科学家在自然界海量的分子机器中注意到了某种异常。限制性内切酶、Taq 聚合酶、CRISPR 都走过这条路。Anthropic 团队想验证的问题是:通用 AI 模型能否把这种「注意到异常」的能力系统化、规模化。

从目前的结果看,ART 的意义更多在于研究范式,而不只是多了一个新酶。生成假设的成本正在被压缩到「用算力换发现」的程度,人类的角色相应转向筛选、判断和实验验证。如果「注意到自然界的异常」这一步真的可以规模化,基因组挖掘有可能迎来新一轮工具型发现。

另一条值得留意的线索是,模型公司亲自建起了湿实验室。Anthropic 的实验室位于湾区,外观与常规分子生物学实验室无异;其研究只涉及生物安全等级较低的 BSL-1 和 BSL-2,不处理能感染人类的病原体,所有实验操作都由人类科学家完成。团队也提到,他们尝试过用 AI 加速实验工作的项目,但这类做法不太适合分子生物学研究中那种临时、非标准化的流程。

在具体工作流上,团队经常让 Claude 去检索那些功能未知的蛋白质所对应的大量 DNA 序列。一个典型流程是:先对某个蛋白质家族做整体调查,由 Claude 阅读相关文献、用公开数据复现已有结果以检验方法;接着寻找不符合任何已知系统的家族成员或基因组邻近序列,为每个候选写一份简短、人类可读的报告,提出功能假设并说明支持证据;在后续分析中,Claude 会批判性地评估这些证据,大多数候选会在这一步被淘汰。一轮调查下来,可能只剩一个候选值得做实验,也可能一个都不剩。

候选通过评审后,团队会在实验室中验证:把蛋白在标准实验室菌株中表达,再从生化与结构层面进行表征,Claude 在这一步协助解读数据。他们使用的是 Claude Science 和 Claude Code,也就是任何科学家都能用到的工具,有时还会用自建的工具框架来并行调度多个 Claude 会话。

由于 Claude 产出假设的速度太快,假设本身也成了研究对象。一轮研究就可能产生几百到几千份候选报告,团队因此在追问:那些被判定值得测试的提案,和那些被搁置的提案之间,差别究竟在哪里。得到的结论会回过头写进给 Claude 的指令中,让它逐渐学会模仿团队自己的科学品味。

团队还介绍了自己的背景:成员长期研究不寻常的蛋白质,擅长用计算方法系统性地读取 DNA、解读其演化过程,并挑出值得进一步表征的生物系统。在加入 Anthropic 之前,他们的研究帮助人们更好地理解 CRISPR 系统的演化与调控,发现了可用于下一代细胞与基因疗法的新酶,也构建过用于加速识别 DNA 异常(例如人类致病变异)的工具。他们隶属于 Anthropic 的生命科学组织,与从事药物发现、以及训练 Claude 理解生物学与化学的团队并列。

Anthropic 表示,希望这项工作能向更广泛的科学界展示 AI 驱动假设生成的价值,并愿意与其他科学家合作,把这种方法扩展到基因组学及其他领域的更多问题上。如果有研究问题上的提案,他们欢迎联系。此外,生命科学验证计划(LSVP)为生命科学从业者提供 Claude Mythos、Opus 和 Sonnet 模型的访问权限,并配有对生物学相关工作更为宽松的一套安全措施。

分享 微博

弹幕

还没有弹幕,来说一句。

到此一游

共 0 条

还没有人留下足迹,来签个到。

    评论 共 0 条

      昵称 —