自主科研Agent

自主科研Agent指在人类给定研究方向后,AI 自主修改训练代码、运行实验、判断好坏并迭代的无人值守科研闭环。代表性项目是 Karpathy 2026 年 3 月开源的 autoresearch(一夜飙至 77k star):你写一份 Markdown(program.md)告诉 AI 探索方向,AI 可一夜跑约 100 个实验。其核心理念是”AI as experimental loop, human as research direction”——AI 承担实验循环,人类承担方向定义。

对照:human-in-the-loop 的科研 Skill 辅助路线

他山科研 Skills 包(2026-08,上架 Qoder CN 技能市场)代表与全自主闭环相反的路线:20 个 Skills 覆盖文献检索、实验设计、统计分析、写作呈现、审查核对等科研全流程,但每个环节都显式保留”待核验”状态与需人工回查的位置,明确”科研 Skills 不能代替你的判断”——研究者保留每一步判断权。

这说明”AI + 科研”当前至少存在两种共存形态:自主实验闭环(AI 跑实验、自我迭代,人只定方向,如 autoresearch)与工作流 Skill 辅助(AI 承担可复用方法,人做每步判断,如他山 Skills)。两者的取舍核心是”判断权在谁”,可按任务可验证性与风险选择。

2026-08-10 第三路线:OpenAI4S Code-as-Action 可执行科研框架

OpenAI4S(北大团队开源,PKU-YuanGroup/OpenAI4S,v0.1.0)代表与上述两者并列的第三条路线——Code-as-Action 可执行科研框架,强调执行、记录、复现、交付而非聊天:

  • 双平面架构:JSON 工具负责控制平面(流程/权限/元数据/外部服务/人工审批),持久 Python/R 内核负责计算平面(读数、清洗、统计、绘图、仿真,多轮任务保留状态);代码单元执行到一半还能反向调用宿主(同步问模型、派子智能体、丢重活给远程 GPU)
  • 效率对照:同一任务传统 ReAct 需 14 个来回,一个代码单元跑完;大型数据留在内核内存,进入对话的只有 <DataFrame 100000×20> 一行摘要
  • 能力覆盖:连接 UniProt / RCSB PDB / PubChem / arXiv 与联网搜索;内置 30 余个生命科学 Skill(AlphaFold2、ESMFold2、ProteinMPNN、DiffDock、scGPT 等,重型任务需外部 GPU);模型中立(火山方舟/OpenAI/Anthropic/Gemini 及兼容接口)
  • 定位与成熟度:README 自称”9.9 元/月火山方舟 Small 套餐复现 Claude Science 核心工作方式”(作者明确这不是官方性能对标结论);过程记录在 Action Timeline,图表/报告存为带版本与来源信息的 Artifact;开源不足两个月、接口仍在变动,“能执行代码不代表结果天然正确”

“9.9 元复现 Claude Science”为 README 营销定位;“14 来回 vs 一个代码单元”来自 README 示例,非第三方基准。见 Source: 北大开源 OpenAI4S

同期背景(机构化里程碑)Jeff Dean 创立 Discovery Loop,把”AI 实验循环”机构化为公益公司(实验迭代一周 → 一小时、并行数千实验,见 单飞后首次公开亮相)。OpenAI4S(中国学术团队开源平价版)与 Discovery Loop(硅谷机构化创业版)构成 AI4S 光谱两端。至此本主题已记录四种形态:自主实验闭环(autoresearch)、工作流 Skill 辅助(他山)、可执行框架(OpenAI4S)、机构化创业(Discovery Loop)。

关联