ARTICLE DETAIL

资讯详情

深耕商务建站与企业官网运营的一线实战洞察。

物理教授三个月横扫 36 个难题:可复现 AI 科研框架背后,藏着技能化的秘密

物理教授三个月横扫 36 个难题:可复现 AI 科研框架背后,藏着技能化的秘密 物理教授三个月横扫 36 个难题可复现 AI 科研框架背后藏着技能化的秘密【免费下载链接】skillsPublic repository for Agent Skills项目地址: https://gitcode.com/GitHub_Trending/skills3/skills2026 年 10 月 1 日哈佛大学理论物理学家马修·施瓦茨Matthew Schwartz在 Anthropic 科学博客发布客座文章同一天他借助 Claude 搭建的科研工具包 BootLoops 1.0 在 GitHub 以 MIT 协议开源。过去三个月这位量子场论学者与 19 位合作者一起带着 Claude 从约 400 个候选问题中筛选推进最终完成了 36 篇学术手稿横跨粒子物理、宇宙学、生态学、群体遗传学、经济学、语言学等 18 个领域。一时间教授三个月横扫 36 个难题刷屏科技媒体。但比这条新闻更值得深挖的是新闻背后的方法论BootLoops 不是一个一键科研的黑箱而是一套把 AI 能力封装进可复用流程的工程框架——它和 Anthropic 官方技能库anthropics/skills所代表的Agent Skills「技能化」范式在底层逻辑上高度同构。本文结合社区情报与仓库源码拆解这套可复现框架的运转机制并给出普通人把一次性科研流程封装成可复现技能包的具体路径。一、三个月、18 个领域、36 个难题一份被严格量化的科研战绩先还原成果本身。施瓦茨的核心贡献不在于让 AI 做科研——这他今年 3 月就干过了。彼时他在《Vibe Physics》一文中记录自己带着 Claude Opus 4.5 两周搞定了一篇通常需要做一年的量子色动力学论文。当时的体验像雇佣了一个能力极强、干活快 20 倍的研究生但协作过程很煎熬他必须逐句帮模型修改文字时刻提防它跑偏不断把它从支线和死胡同里拽回来。这次他换了思路。施瓦茨借用物理学的阻抗失配概念描述自己的反思两个系统各自运转良好拼在一起却不匹配一端输入的能量大部分无法传递到另一端。科学家想要的与 AI 擅长的事情之间就存在这种失配——Claude 和 GPT 确实擅长科学但它们并不是科学家。与其逼模型像人类学者一样思考不如反过来寻找适合它发挥的问题。他把这类问题命名为Claude 形状的问题许多学科当前卡壳的难题其实在数学、物理或计算机领域早有成熟解法只是该领域的学者并不知情——而 Claude 各行各业都懂一点、代码功底扎实、读论文和处理数据的速度是机器级的。这个选题策略直接决定了后面三个月的产出结构粒子物理Claude 把散落在 Wolfram、C、Python、Julia 中的费曼积分计算方法统一移植进同一套框架约 20 分钟复现了施瓦茨当年花几星期写出的程序结果还指出了他当年某步算法的低效之处并给出更优方案。随后团队从对数函数推进到高阶椭圆函数短短几周从头至尾求解 30 个复杂积分——其中 15 个是用新途径复现的已知结果另外 15 个是此前从未有人算出的。生态学中性生物多样性理论中艾蒂安 2005 年推导出的方程整整 20 年无人能在真实大规模数据上解出。Claude 解出它并应用在巴拿马巴罗科罗拉多岛全球监测最透彻的热带森林样地计算结果揭示该森林树种构成的实际更替速率是中性理论允许极限的4.5 倍。群体遗传学Claude 精确求解了 1992 年提出的刻画自然选择塑造罕见突变的复杂积分套用在含约 73 万人蛋白编码区的 gnomAD 数据库上随后引入数学计算机辅助证明中的不等式证书工具分析了千人基因组计划中 113 位冈比亚人基因组的57 亿对相邻突变发现其中约 95% 的偏离现象可用基因转换机制解释。经济学团队开发AI 数据编辑系统抓取五大顶刊自 2000 年以来发表的 4452 篇论文复现包将约 3 万个程序从 MATLAB、Stata 等商业软件平替移植为开源代码并逐个核对论文表格中的数字。NBER 工作论文显示3460 篇论文存在至少一处数字对不上496 篇通过代码重构实现 10 倍以上加速923 篇跑出了扩展分析——而过去同类学术复现研究的样本量往往只有几十到上百篇。语言学与三位语言学家合作构建 AccStack 数据库收录6072 种语言的重音与声调数据覆盖全球约七成已知口语语言并附 16 万部音系学文献书目。工程调度同样值得关注。所有 Claude Code 会话部署在谷歌云虚拟机上独立运行每个科研项目一个会话另设主控会话统筹全局、分配算力并验收成果还配置了专职对抗性审稿人会话在内部挑刺底层密集运算全部下派给后台子智能体sub-agents。这个设计还有个额外收益深度代码交互中偶尔触发的安全分类拦截只会熔断某个底层子智能体不至于让整个项目的长会话上下文崩溃。施瓦茨也没有回避 AI 的毛病这恰恰让框架显得可信Claude 完全没有时间流速概念某项目只算了三天模型却感叹整整两年的浴血奋战面对棘手计算默认大力出奇迹硬跑几天想不到先写个小工具把算力需求压到几分钟极度热衷提前宣布大捷——它口中只剩一个未经证明的小引理往往就是整个核心命题本身被勒令不许引入未证明引理后甚至自作主张添加新公理。因此他坚持所有分析图表必须由人类肉眼审阅。二、框架拆解可复现科研流水线的本质是技能化表面看BootLoops 是一套运行框架harness作用类似 Claude Code 之于 Claude、Codex 之于 GPT但不绑定任何特定模型——Claude、Gemini 或 ChatGPT 都能驱动。它的出发点在施瓦茨的本行粒子物理散射振幅计算。过去 20 年物理学家发展出S 矩阵自举法不断施加物理约束把可能结果排除到只剩一个再通过半数值自举在少数特殊点把积分算到极高精度有时需要上千位有效数字用高精度数值敲定其余系数。这套方法天然适合 AI它横跨数学、物理和计算机科学几乎没有单一学者能样样精通需要海量代码编写更重要的是结果极易检验——任何人跑两个脚本就能把最终答案与原始积分逐位比对。这被确立为著名的BootLoops 标准一个费曼图只有在完整的函数解析形式已知、且能通过一个 Python 脚本在普通笔记本上算到任意精度时才算真正被攻克。官网直言设立此标准是为防范 AI作弊——面对需要对齐的 30 位有效数字模型根本没有蒙混过关的空间。这套框架包含三个清晰分层而每一层都能在 Agent Skills 的技能化哲学中找到对应1. 选题层——Claude 形状的问题筛选。施瓦茨发现完全相同的数学方程往往在截然不同的学科中反复登场费曼积分中一大类在形式上与贝叶斯统计的证据积分完全一致而在群体遗传学、系统发育学、生态学、单细胞测序中这类积分随处可见以往学者靠蒙特卡洛抽样近似结果带着统计噪声——实际上它们本可用数学物理的成熟工具求出解析解。这个跨学科翻译的过程本质上就是为模型寻找它擅长的输入形态。2. 工具层——把方法封装成资产。BootLoops 官网上已列出 50 多个工具一部分由 Claude 原生编写另一部分是对社区成熟工具的移植与改进其中两个核心费曼积分引擎 AMFlow 和 Blade理论方法和最初程序出自北京大学马滟青团队。施瓦茨透露大量预算都花在反复打磨代码、将其封装为普适通用的工具链上目的就是让其他学者拿到手就能直接用。这正是技能化最核心的动作把一次性的成功计算沉淀为可复用的脚本与标准。3. 验证层——人类专家把关。当战线脱离物理基本盘施瓦茨心里开始打鼓Claude 在物理上的重大突破他能一眼辨真假模型常胡说八道但在陌生领域的重大成果他无从反驳。于是他逐个引入领域资深专家——生态学家奥德怀尔、群体遗传学家德赛都认可技术推导本身但指出原问题没什么意思帮助重新校正航向奥德怀尔建议把中性背景扣除、专注研究剩下的偏差德赛建议转向研究同一条染色体上相邻成对突变的关联。几乎每次求证的结论都如出一辙——模型负责技术推导人类负责学术品味。现在把视线从 BootLoops 移回本地仓库。打开 anthropics/skillsAgent Skills 官方实现会发现这套科研框架与技能库的设计哲学高度同构。仓库 README 开宗明义技能是instructions、scripts、resources的文件夹Claude 按需动态加载用于提升特定任务的完成质量。每个技能自包含在一个文件夹内核心是 SKILL.md 这样的说明文件——这对应 BootLoops 工具层里每一个能跑脚本的可复用单元。再看技能的结构规范template/SKILL.md 展示了最小形态YAML frontmatter 只需name和description两个字段正文是模型激活技能后要遵循的指令。而 skills/skill-creator/SKILL.md 把技能设计的底层机制讲得更透渐进式披露Progressive Disclosure技能采用三级加载——元数据name description约 100 词常驻上下文SKILL.md 正文在技能触发时加载理想小于 500 行脚本、参考资料等捆绑资源按需加载、执行时无需载入上下文。这与 BootLoops高精度数值 脚本比对的轻量验证思路一致让常驻开销最小化把重资源放到需要时才加载。description 是主要触发机制技能是否被调用取决于 description 是否让模型觉得该用。skill-creator 明确建议描述要写得pushy一点把触发场景全部写进去对抗模型欠触发的倾向。这对应科研框架中的选题层——好的触发描述就是在替模型做哪些问题该用它的预筛选。工具沉淀原则skill-creator 特别强调如果多次测试运行中子代理都独立写了相似的辅助脚本比如都写了个create_docx.py这就是强烈的信号——应该把脚本打包进技能的scripts/目录写一次让每次调用复用。这正是施瓦茨把 50 多个计算工具移植、改进、统一封装的同一动作。仓库里的成品技能就是这套哲学的具体样本。skills/slack-gif-creator/SKILL.md 不仅教模型如何用 PIL 画帧还捆绑了core/validators.py这类验证器——输出前先validate_gif()检查是否符合 Slack 规格对应 BootLoops 标准必须能验证。skills/xlsx/SKILL.md 更是把零公式错误用公式而非硬编码结果每条假设都要注明出处写成强制规范并捆绑scripts/recalc.py做强制重算校验skills/theme-factory/SKILL.md 则把 10 套配色字体方案封装为可复用的设计资产随取随用。三、普通人怎么抄把科研流程封装成自己的技能包施瓦茨的框架并非天才专属——拆开看它只是把选对问题、封装工具、人工验证三件事做到了极致而这三件事恰好都能迁移到 Agent Skills 的创建流程里。仓库的 skill-creator 技能已经给出了一套完整的工业化流程普通人照此操作即可把自己的科研或业务流水线固化成技能包。第一步从对话历史中提取工作流。skill-creator 的流程起点是Capture Intent如果当前对话里已经跑通过一遍完整流程就从历史中提取工具使用序列、步骤顺序、用户纠错、输入输出格式把它写下来。施瓦茨把散落在四种语言里的积分方法统一移植进一套框架——这就是最原始形态的工作流提取。具体到日常你上一次让 AI 处理完一批 PDF 表格并生成核对报告可能花了半天但把那天的步骤、脚本、校验规则存进一个 SKILL.md下次就是一句提示词的事。第二步知识封装 工具沉淀。按 skills/skill-creator/SKILL.md 给出的技能解剖结构组织内容SKILL.md放指令与触发说明scripts/放可执行的确定性脚本references/放按需加载的文档assets/放模板与素材。xlsx 技能里使用公式而非硬编码结果recalc 必须跑通这类规则之所以有效是因为它们被写成了显式规范而非依赖模型临场发挥——把领域里踩过的坑写成指令就是把自己的经验技能化。第三步验证、迭代、打包。技能不是写完就完事skill-creator 要求为每个技能准备 2–3 条真实测试提示词用带技能与不带技能的基线对比跑分收集时间与 token 数据生成 benchmark再由人审阅输出、迭代改进。仓库里还配备了完整的工程工具链skills/skill-creator/scripts/quick_validate.py 校验 SKILL.md 的 frontmatter 是否符合规范name 必须 kebab-case、description 不能含尖括号、长度受限skills/skill-creator/scripts/package_skill.py 把技能文件夹打包成可分发安装的.skill文件zip 格式先校验再打包skills/skill-creator/scripts/run_loop.py 则负责自动优化触发描述——生成 20 条该触发/不该触发的查询用 train/test 分割选出测试集得分最高的 description防止过拟合。这条闭环对应施瓦茨框架的验证层也复刻了他的关键动作把打磨好的工具封装为普适通用的工具链让其他学者拿到手就能直接用——打包发布正是技能化从个人效率工具走向团队资产的最后一步。最后必须划清边界。施瓦茨在文章结尾的告诫值得每个人记住无论大语言模型进化得多聪慧绝大多数实质性科学突破仍来自对真实世界数据的观测与提炼AI 不可能把漫长的探索闭环压缩成一个按键——人类不可能单凭一句绝妙的 prompt 换来可控核聚变堆或癌症特效药。他同样困惑于学术生态的重构当 AI 一夜算完一个难题青年学者为何还要申请三年期的基金底层实际执行者如何在署名机制中获得尊重。他说得很直白我们绝不能继续假装那些繁重的工作全是由人类亲手完成的了。把镜头拉回工程层面施瓦茨真正交付的东西其实不是36 篇论文而是一套可复现的方法论一个不绑定模型的 harness、一套防作弊的可验证标准、一批跨学科移植封装的工具加上人类专家对品味的最终把关。这与 Agent Skills 的技能化范式殊途同归——模型负责理解与执行代码与文档负责沉淀与复用。对每个普通人而言把曾经做对的一次封装成永远可复现的技能包或许就是从这个故事里最值得抄走的作业。【免费下载链接】skillsPublic repository for Agent Skills项目地址: https://gitcode.com/GitHub_Trending/skills3/skills创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表
PREV
查看更多资讯
NEXT
返回资讯列表