返回顶部
返回首页 会员充值 我的足迹 返回上一页
具身智能
情绪经济
商业航天
十五五
银发经济

AI Scientist前沿进展

当AlphaFold2斩获2024诺贝尔化学奖,当AI全自动论文首次通过同行评审,当Google Co-Scientist在Nature发表多智能体假说生成系统——AI正在从“科研工具”进化为“科研合作者”。这份报告系统梳理了2024-2026年AI Scientist领域的标志性进展:Sakana AI的端到端自动科研系统、Google的Co-Scientist多智能体协作框架、ERA的树搜索式科学软件开发、DeepMind Aletheia对700个数学猜想的冲锋。AI Scientist已从概念变为现实,但距离真正的“AI独立科学家”,仍有漫长的道路要走。

2024诺贝尔奖——AI登上科学最高殿堂

AI成果首次同时斩获两项诺贝尔奖

2024年诺贝尔奖成为AI在科学领域地位的标志性节点。诺贝尔化学奖授予Demis Hassabis、John Jumper和David Baker,表彰其在AlphaFold2蛋白质结构预测和计算蛋白质设计方面的突破性工作。诺贝尔物理学奖授予John Hopfield和Geoffrey Hinton,表彰其在启发大脑的神经网络方面的基础性贡献。

关键信号:历史上首次AI成果同时斩获两项诺贝尔奖——AI正在成为科学发现的核心驱动力。这标志着AI从“辅助工具”正式升级为“科学发现的关键力量”,为AI Scientist的发展提供了最有力的制度性背书。

科学范式的演进——第五范式AI驱动科学

科学范式的演进经历了五个阶段。第一范式实验科学(千年前,观察归纳),第二范式理论科学(数百年前,数学建模),第三范式计算科学(数十年前,模拟仿真),第四范式数据科学(十年前,大数据挖掘),第五范式AI驱动科学(现在,自主发现)。

第五范式标志着AI不再仅仅是处理数据的工具,而是能够主动参与科学发现的“合作者”。这一范式转变的核心驱动力是大语言模型在推理、规划和工具使用方面的能力跃升,使得AI能够自主生成假设、设计实验、分析结果并撰写论文。

AI Scientist系统演进——2024-2026关键里程碑

Sakana AI——首个端到端自动科研系统

2024年8月,Sakana AI联合UBC和Oxford发布了AI Scientist v1,这是首个端到端自动科研系统。2025年1月,AI Scientist v2的首篇AI全自动论文通过ICLR 2025 Workshop同行评审——这是AI全自动研究首次被人类同行评审接受。

技术基座包括Claude Sonnet、GPT-4o、o3、o4-mini等模型。核心创新包括Agentic Tree Search渐进式搜索、VLM视觉反馈迭代优化图表、Automated Reviewer自动评审门控。值得注意的是,Sakana AI在接收后主动撤稿,披露AI身份,体现了行业对AI科研透明度的严肃态度。ICLR Workshop接收率60-80%(主会仅20-30%),但这仍标志着AI全自动研究首次通过人类评审门槛。

2026年AI Scientist的能力边界

已能做到:自主生成研究想法并编写/运行实验代码、撰写完整学术论文(LaTeX)、在特定领域超越人类SOTA(DeepScientist)、通过Workshop级别同行评审、多智能体协作科研、生物医学假说生成并实验验证。

尚未做到:通过顶会主会议审稿、跨学科的通用科研能力、“湿实验”自主操作、真正理解科学概念(vs.模式匹配)、处理长周期复杂科研项目、独立提出范式级突破理论。这些能力边界是未来3-5年AI Scientist研究的核心攻关方向。

Nature发表的重要系统——Co-Scientist与ERA

Co-Scientist——多智能体协作假说生成

2026年5月,Google Research、Google DeepMind联合Insilico Medicine和Stanford在Nature发表Co-Scientist系统。其核心创新在于通过多智能体协作实现科学假说的自动生成、评估与优化。

核心架构包含七个智能体角色:Generation Agent(跨学科搜索生成假设)、Reflection Agent(同行评审式批判)、Evolution Agent(基于辩论反馈迭代优化)、Proximity Check Agent(假设聚类去重)、Meta-review Agent(综合评估优化)、Ranking Agent(Elo锦标赛式优胜劣汰)。该系统在急性髓系白血病(AML)的药物重定位和协同组合疗法中通过体外实验验证了AI生成的假说。

关键启示:将“科学辩论”逻辑嵌入智能体交互比单纯提升模型参数更高效;系统允许科学家在关键节点修改“研究计划配置”,实现真正的“人在回路”指导。

ERA——树搜索驱动的科学软件开发

ERA(Evolutionary Research Assistant)将科研探索建模为树搜索问题。核心思想包括:代码变异——LLM作为“变异引擎”,在语义层面理解并重写算法逻辑;树搜索——类似AlphaZero的策略,平衡“开发”与“探索”;思想重组——分析多个成功的父代节点,自动融合成前所未有的混合模型。

在基因组学任务中,ERA基于9种基础方法通过“重组”创造了40种新方法,在OpenProblems权威榜单上超越了所有人类开发的SOTA,性能提升14%。在流行病学任务中,ERA产生的14个预测策略优于CDC官方Ensemble模型。

ERA证明了在具有明确评估标准的任务中,AI可以极大地降低复杂科学软件的准入门槛。未来的科学家可能不再需要精通每一行代码,他们的核心价值将转向定义高质量的评估指标和提供精准的领域构想。

Aletheia——对700个数学猜想的冲锋

转化率不足2%与“潜意识抄袭”现象

Google DeepMind团队利用定制Gemini Deep Think智能体(代号Aletheia)对数学家Paul Erdős留下的700个开放问题发起冲锋。自然语言验证器将候选方案从700个锐减至212个;领域专家垂直评审进一步剔除“理解错题意”的方案。

最终成果:700个问题中仅解答出13个,转化率不足2%。更值得注意的是Aletheia在“Erdős-75”问题上的表现——该问题本身是伪命题(题干逻辑错误),但Aletheia仍输出了一份长达几十页的“完美证明”。同时,AI在处理Erdős-1089时被发现了“潜意识抄袭”现象——生成的证明与1981年东欧冷门期刊论文高度重合,而该文献在AI的预训练数据集中。

启示:数学发现的未来不在于AI的全自动化,而在于如何利用AI的超强联想力来识别那些被历史尘封的连接点。数学论文的署名权应始终属于人类,人类需要承担起“核实文献出处”的法律与学术责任。

未来展望与核心挑战

渐进式自主化路线图

AI Scientist的发展可分为五个等级:Level 1 AI工具(2020-22)、Level 2 AI研究助手(2023-25)、Level 3 AI科研合作者(2026-28,AI自主完成子任务,人类把控方向——当前所处位置)、Level 4 AI主导研究者(2028-30)、Level 5 AI独立科学家(2030+)。

技术、伦理与认识论挑战

技术挑战包括引用幻觉、可重复性缺乏标准化框架、高级模式匹配与真正理解的差距、工具使用任务完成率<20%、上下文学习平均解决率仅17.2%。伦理与社会挑战包括论文洪水冲击审稿系统、年轻科学家丧失核心实验能力的角色危机、AI发现出错时的责任归属、没有理解的发现是否算“知识”的认识论挑战。

核心共识是“Graded Autonomy”——系统在机器速度闭环运行,但始终锚定在人类的优先事项、可验证的机制和学科适配的理解之上。
点击阅读报告原文: ai798 Lab:2026年OPC 创业白皮书(114页)
相关报告