

你有没有想过这样一个问题:如果给你一个天才的应届毕业生,再给他一间配备了所有实验设备的实验室,他能立刻做出一流的研究成果吗?
多半不能。
他懂理论,会推导公式,能读懂论文,但真正让他去复现一个复杂实验的时候,他会卡在一些让人哭笑不得的细节上:这个包的这个参数到底该怎么配,这个数据集要不要提前做归一化,跑出来的结果不对到底是代码问题还是方法本身就不适用。这些东西没有写在教科书里,是无数人踩坑踩出来的经验,行话叫"知道怎么把事情做成"的能力,而不是"知道有这么回事"的能力。
现在把这个毕业生换成AI科研智能体,问题一模一样地出现了。
**这篇论文要讲的,就是为什么现在最先进的AI科研智能体,明明用着最强的大脑,配着最精细的工作流程,却依然在真实科研任务上跌跌撞撞,以及研究团队怎么用一套叫DisCo的系统,把这个短板补上,补完之后成绩直接翻倍还多。**
先说说这个短板到底卡在哪儿。
聪明的大脑加上好的流程,为什么还不够用
一个AI科研智能体通常由两部分组成。
第一部分是模型本身,也就是负责理解问题、进行推理、制定计划、写代码执行的那个大语言模型,业内管这个叫backbone(骨干模型)。
骨干模型:指承担智能体核心推理、规划和执行能力的大语言模型,是整个智能体系统的"大脑"。
第二部分是harness(执行框架),也就是负责调度记忆、验证结果、反复迭代改进的一整套工程系统。
执行框架:负责智能体任务编排、记忆管理、结果验证和迭代优化的工程系统,类似"大脑"周围的骨骼和神经系统,决定智能体如何一步步把任务落地。
这两块东西,过去几年一直在飞速进步。骨干模型一代比一代强,GPT系列迭代到今天已经能处理极其复杂的推理;执行框架也越做越精细,各种规划、反思、纠错机制层出不穷。
按理说,两个都在变强,整体表现应该跟着一起涨才对。
但研究团队观察到,机器学习研究这件事特别"吃经验"。你要知道该用什么方法解决当前的问题,该选哪个具体的代码库来实现,这个库的接口该怎么调,训练流程该怎么配置,常见的坑要怎么绕开。这类知识,论文里研究团队把它叫做operational knowledge(操作性知识),而这恰恰是骨干模型和执行框架都没有覆盖到的一块空白地带。
操作性知识:把"知道某个方法存在"转化为"能真正让这个方法跑起来"所需要的全部经验,包括方法选择、工具使用、参数配置和踩坑规避,是连接理论知识和实际操作之间的桥梁。
骨干模型的知识是从训练数据里学来的炒股配资询问,广而不精,而且是固定的,不会随着任务变化而更新。执行框架管的是"怎么走流程
融正配资提示:文章来自网络,不代表本站观点。