OpenAI总裁Greg Brockman刚刚转发的一条动态,让科技和医药领域为之震动。知名科学家Andrew Aiginin在X平台上公布了这一重磅消息——在严格的独立基准测试中,GPT-6 Astra击败了所有前沿模型,成为抗体可开发性预测领域的最强AI。
它不仅取得了跑分第一的成绩,还在短短1小时内,手动构建了复杂的抗体机理交互式可视化页面。
长期以来,业界有一个普遍认知:「AI for Science,必须用专用模型解决专用问题。」例如,AlphaFold专注于蛋白质折叠,而LLM通常只被视为辅助写代码和读文献的工具。然而,今天,GPT-6 Astra彻底打破了这一共识。
它凭借通用智能,直接切入生物医药研发中最难量化、最令人头疼的临床前瓶颈。这一突破并非偶然。构建该测试基准的顶尖AI制药团队Insilico Medicine在arXiv上发布了一篇21页的重磅论文。
这篇论文不仅首次揭示了测试GPT-6 Astra的DDD Benchmark的严苛性,还展示了从小分子化学合成到大分子抗体预测,通用大模型正在全面接管最硬核的科学前沿。AlphaFold之后的科学范式转移,或许才刚刚开始。
37.98分!GPT-6登顶权威「DDD基准测试」
实测结果显示:GPT-6 Astra接入DDD Benchmark中的抗体可开发性测试模块(综合了6种不同的抗体实验数据)后,拿下了惊人的37.98分,碾压了所有受测模型。
AI学者Rim Shayakhmetov发出难以置信的惊叹:「专用模型在这个任务上的常规分数是多少?这结果太有趣了,你很难在药物发现的基准测试中,看到前沿的大语言模型在『不依赖外部专用工具』的情况下如此闪耀!」
没有专业生物信息学插件、没有专门做抗体数据微调的情况下,一个通用大模型,居然直接切中了抗体成药性的命脉,这太令人兴奋了。
发现抗体只是开始,「成药」才是真正的死亡之谷
要理解GPT-6 Astra这一成绩的含金量,我们首先得弄懂一个医药界的残酷现实。Andrew写下了一句直击灵魂的话:「找到一个能结合的抗体仅仅只是开始。它会聚集吗?它能保持稳定吗?它真的能像一个药物那样发挥作用吗?」
这句话,道出了全球无数新药研发人员的血泪史。在过去,当我们谈论抗体药物研发时,大家最关注的是「结合力」。通俗点说,就是这个抗体能不能精准地像钥匙插进锁孔一样,识别并结合到病毒或癌细胞的靶点上。早期的AI模型(比如AlphaFold)已经在「预测结合」这件事上做得非常出色了。
但是!能结合 ≠ 能变成药。这就好比谈恋爱。男女双方看对眼了,一见钟情,这只是第一步。你们能不能走进婚姻的殿堂?能不能经受住柴米油盐的考验?在药物研发中,这个「柴米油盐的考验」被称为「成药性」。
现实中,无数看似结合力极强的「完美抗体」,一旦进入真实的生理环境或工业生产环节,就会暴露出致命缺陷:它会不会聚集成团?它的结构稳不稳定?它到底能不能表现得像一款真正的「药」?这些属性统称为抗体可开发性。这是整个生物制药界的「死亡之谷」。
它导致了一个极其惨烈的局面:全球每年有成千上万个抗体分子在实验室里表现优异,但最终倒在了「成药性」的评估阶段。药企为此烧掉了几十亿美金,耗费了几年甚至十几年时间,最终颗粒无收。而今天,GPT-6 Astra宣布,它能比目前世界上任何其他前沿模型,更精准地预测这些成药性特征。
揭秘试金石:GPT-6 Astra面对的「地狱级」基准测试
有人可能会问:这会不会又是一个「刷榜」成绩?绝对不是。Bogdan A. Zagribelnyy博士指出,Astra登顶的平台是他们构建的DDD Benchmark。在他们发布的论文中,我们看到了这个测试体系多么硬核。
虽然推文讨论的是「大分子抗体」,但这篇论文展示了该团队在「小分子化学」领域建立评测标准的恐怖深度。了解了这个背景,你才会明白Astra的夺冠有多么不可思议。在论文中,研究团队聚焦了另一个制药界的世纪难题:单步逆合成。
简单来说,逆合成就是「化学界的倒推法」——给你一个目标药物分子,你需要倒推出可以用哪些现成的、便宜的化学原料来合成它。过去的AI评测是怎么做的?给AI一个目标分子,AI吐出一个合成路径,如果跟已有的专利数据库(比如USPTO)里的一模一样,就算100分。
但这在真实世界里几乎行不通。因为合成路径天生就是「一对多」的,传统的「单一标准答案」评估法,极大地限制了AI探索未知的能力。为此,Insilico团队构建了令人发指的测试环境:
**1.URSA-expert-2026基准:**这是一个包含100个由机器生成、并由顶尖人类化学专家手动确认合成可及性的全新分子数据集。它与任何公开的训练数据完全隔离,彻底杜绝了模型「背题」的可能性。
**2.ChemCensor打分系统:**他们不看模型是不是完美复刻了专利,而是开发了ChemCensor框架,从「反应中心映射」、「官能团兼容性」等最底层的化学物理规则出发,去判断模型生成的反应是否具备真正的化学合理性。
正是在这种「剥壳见骨」的物理/化学规律考核下,传统的LLM几乎都失败了。在早期的Top-1测试中,哪怕是强如GPT-5.5、Gemini 3.1 Pro,其表现依然无法超越最顶尖的专用传统化学模型(如MHNreact、LocalRetro)。「大力出奇迹」的通用LLM,似乎碰壁了。
4500万数据,LLM被「逼出」科学直觉的?
通用LLM拼不过专用模型,那该怎么办?论文给出的答案震撼了业界——不要换模型,换一种激发通用模型潜力的方法。研究团队在论文中提出了三大杀招,彻底解锁了大模型在化学领域的封印:
第一招:Top-K提示词范式。既然逆合成是「一对多」,那就不要让LLM只猜一次。团队在Prompt中明确要求:「给我15种不同的答案」。奇迹出现了,仅仅是切换到Top-K模式,几乎所有的大模型(GPT-5.5, Claude Opus系列)在化学合理性和多样性上都迎来了爆发式增长。Gemini 3.1 Pro在Top-15模式下性能飙升,直接成为最强LLM基线。这证明,大模型是有科学知识的,只是过去的提问方式不对。
第二招:构建4560万规模的超大核验数据集(CREED-CCV-2+USPTO-XL)。为了训练出专门针对化学限制对齐的语言模型(C3LM),团队不惜算力,利用虚拟合成引擎和ChemCensor框架,硬生生构建了一个包含约4560万个经过验证的真实化学反应的超大规模数据集。
第三招:强化学习中的「新颖性」奖励。在微调C3LM模型时,他们引入了GRPO强化学习算法。奖励函数极其刁钻:模型给出的合成路径不仅要符合ChemCensor的化学合理性,而且如果模型能想出一种连4500万训练集里都没有、但依然合理的全新反应,将会获得额外的巨大奖励。
结果是什么?经过这种「地狱级」训练的C3LM模型,在URSA-expert-2026盲测中,终于一举击败了MHNreact等所有传统专用SSRS模型!数据分析显示,C3LM和其他基础大模型能够探索出与传统模型完全互补的反应空间,生成了大量传统模型想不到的独特路径。
论文的核心结论是:大语言模型不仅能处理自然语言,只要给予正确的环境和激励,它们完全可以掌握最深奥的化学键、官能团和合成逻辑!
降维打击:从C3LM到GPT-6 Astra,通用智能的全面接管
如果你看懂了上面这篇论文,你就会明白Bogdan博士为什么会把GPT-6 Astra的成绩和这篇论文联系在一起。在这篇论文中,Insilico团队费尽九牛二虎之力,用4500万条数据微调、用强化学习对齐、用Top-K提示词引导,才终于让大模型在小分子化学合成上打败了专用模型。
然而,当测试赛道切换到更加复杂、维度更高的大分子可开发性预测时,GPT-6 Astra居然在「没有使用外部工具」的情况下,直接在同样的DDD Benchmark测试体系下登顶,拿下了37.98分!这绝对是降维打击。
过去,我们要解决抗体稳定性问题,需要专业团队设计专门的三维图神经网络。而现在的GPT-6 Astra,它的通用世界模型中似乎已经内化了物理、化学、生物的底层逻辑。它在阅读了人类历史上浩如烟海的论文、专利、实验数据,甚至通过多模态学习了微观世界的物理法则后,已经能像人类专家一样,「直觉」判断出一个蛋白质分子在溶液中为什么会聚集。
此外,Astra展现出的工程效率同样令人胆寒。Andrew Aiginin提到:「顺便提一句,这个展示抗体实际工作原理的交互式可视化页面,也是用Astra在大约1小时内建好的。」在传统药企,做这样一个系统,整个流程少说也要两三周。现在,1个小时,一个人,一个通用大模型,就能解决了。
AlphaFold之后,真正的范式转移
GPT-6在抗体基准上的跑分第一,宣告着通用大模型已经显出AGI雏形,在人类最顶尖智力活动中取得的实质性统治。这个榜单第一,宣告了这个新时代的到来——未来十年,科学发现的核心驱动力,可能不再是为每一个孤立的科学问题定制一个专门的AI模型;而是学会如何向一个如同神明般的ASI提出正确的prompt。
小分子逆合成被突破了,大分子抗体成药性被突破了。从新药研发到材料科学,从聚变控制到量子物理,通用大模型的外溢红利,即将如海啸般席卷所有硬核行业。例如,通过开云娱乐APP,用户也能体验到类似的技术突破带来的便捷。
参考资料: https://arxiv.org/html/2608.18940 https://x.com/gdb/status/2098167375342239957 https://x.com/andrewaiginin/status/2098078245350518884 本文来自微信公众号“新智元”,作者:ASI启示录,编辑:Aeneas 大卫,36氪经授权发布。

张伟
昨晚的德比战太精彩了!开云娱乐APP的实时比分推送非常及时,让我没错过任何一个进球瞬间。
李娜
开云入口的赛事预测功能很准,上周末推荐的串关方案帮我赢得了不少奖金,推荐给所有球迷朋友。