智能的边界:当AI代理走进实验室 为何仍写不出一篇合格的论文?
在人工智能被寄予厚望、几乎被视为科学发现"下一个引擎"的时代,一项最新研究给这股热潮泼了一盆冷水。研究人员发现,即便是当前最先进的AI代理,在独立完成开放式科学研究任务时,仍远远达不到人类科学家的水准——它们写出的论文,甚至无法通过顶级学术会议最基本的评审关卡。

这项发表在预印本平台arXiv上的研究,由Peter Kirgis等人主持完成。研究团队为几款"前沿AI代理"——即那些被设计用来自主执行复杂多步骤任务的顶尖智能系统——设置了一场颇具挑战性的测试:给予它们六天时间,围绕两篇当时尚未公开发表的AI会议投稿主题,独立开展研究并撰写论文。
选择未发表的课题,是为了确保AI无法简单地从互联网上"抄袭"或检索到现成答案。这两个课题分别涉及语言模型"人格"的结构与可控性,以及为表格型基础模型设计一种分布偏移检测器——都是当下人工智能研究的前沿方向。
六天、三千美元与彻底的失败
为了让测试尽可能贴近真实科研场景,研究者给这些AI代理配备了充分的资源:不受限制的互联网访问权限、专属计算算力,以及约合三千美元的模型使用额度,理论上足以支撑它们进行大量实验和探索。六天期限一到,人类专家研究者按照顶级AI会议的评审标准,对AI撰写的论文逐一打分。
结果堪称惨淡:两篇论文分别只获得了六分制中的2分和1分——这是明确无误的"拒稿"级别评价。评审专家指出,尽管AI理解了研究问题,甚至提出了一些与原始研究者思路相近的方向,但其科学推理过程存在严重缺陷。
实验设计被形容为"怪异且难以理解",其研究结论更像是"事后拼凑出的选择",而非严谨的假设检验。一位评审专家还特别批评了AI从有限的失败测试中得出过度概括结论的逻辑漏洞,称其为一种"举例证明"式的非科学谬误。
更耐人寻味的是,这些AI代理在面对负面反馈时表现笨拙——它们往往只是在已有结论上打补丁、加注释,而不是推倒重来、重新设计实验。
与此同时,尽管拥有六天的充裕时间和三千美元的预算,它们实际使用的API额度还不到一半,却仍然像"赶工"一样匆忙提交了远未达到发表标准的论文。这种"有时间不用、有预算不花"的现象,暴露出AI代理在自主规划、风险评估和耐心打磨等方面,与真正的科研思维仍有本质差距。
从"能写代码"到"能做科学",鸿沟依然巨大
值得注意的是,这并非人工智能第一次在复杂科研任务上折戟。国际权威科学期刊《自然》近期发布的一份行业报告同样指出,尽管科研人员已经广泛拥抱AI工具,但在真正复杂的研究任务上,人类科学家依然全面胜过最优秀的AI代理。
这与国内学界的观察不谋而合——中国科学院院士周志华近期也曾公开呼吁,应加大对AI算法基础研究的支持力度,鼓励科研人员开展真正的原创性研究,恰恰从侧面印证了当前AI在"原创"这一维度上的短板。
需要澄清的是,这些结果并不意味着AI在科研领域毫无价值。目前来看,AI更适合扮演"科研助手"的角色——撰写代码、检索文献、跑通实验流程,这些环节它已表现得相当出色。
但从辅助性工作跃升到独立提出假设、设计实验、面对失败并自我纠偏的完整科研闭环,仍是一道尚未跨越的门槛。正如图灵奖得主姚期智在2026世界人工智能大会上所言,"人工智能有局限性其实是好事",明确这些边界,恰恰是让人类与AI形成良性协作、而非盲目替代关系的前提。
科学发现的本质,从来不只是信息处理与模式匹配,而是在不确定性中提出问题、承受失败、不断修正方向的漫长过程。至少在目前,这份属于人类的耐心与判断力,还是机器难以复制的稀缺能力。
