我们开源了一套让 LLM 真正“学会思考”的方法论
Agentic Method—— 不是更多的 prompt而是一套让模型输出更可观测、可证伪、可进化的工作流。GitHub: https://github.com/Ghost-Silver/Agentic-Method一个越来越明显的问题现在的 LLM尤其是中档模型指令遵循能力已经很强了。你让它按格式输出、按步骤执行、调用工具它基本都能做到。但一到复杂任务——比如审查一个多文件代码改动、设计一组对照实验、或者推理一个系统 bug 的根因——模型就开始出现两种典型失败幻觉自信地给出没有依据的结论。事后合理化先跳到一个答案再编造一个看似合理的推理过程fake CoT。这些不是模型“不够聪明”而是模型的解码空间太大没有足够的外部约束把它锚定在“正确思考”的轨道上。我们的思路用方法论约束解码空间我们开源的Agentic Method本质上不是一套“提示词合集”而是一套元工作流meta-workflow。它通过四个机制把模型的思考过程外化、结构化、可审计1. 严格 DSL 锚定用类似(CTX)、(H)、(PREDICTION)、(OBSERVATION)、(VERDICT)的标签强制模型在每个关键节点声明当前上下文是什么假设是什么可证伪的预测是什么实际观测到了什么最终裁决是什么这能把模型的输出从“自由作文”变成“结构化科研记录”显著降低幻觉。2. 强制深层推理每个关键结论必须附带证据等级F0-F4置信度(CONF: level, 证据统计)至少一个竞争假设(BRANCH)明确的证伪条件(FALSIFICATION)模型不能再停留在表面回答。3. 子 Agent 交叉审查通过FORM_REVIEWER、HYPOTHESIS_VALIDATOR、COUNTEREXAMPLE_REVIEWER等角色让不同 Agent 互相挑错。循环论证、隐藏假设、事后合理化会被显式标记出来。4. 引入科研方法二分、消融、对照、反事实推理——这些方法不是作为“建议”写在文档里而是作为不可跳过的步骤嵌入 prompt。30 个核心 prompt覆盖高风险任务仓库里包含了 30 个已经脱敏、可直接复用的核心 promptexperimental-design-prompt.md设计可验证的实验logical-inference-prompt.md严格逻辑推理与证明审查code-review-prompt.md系统性代码审查debug-prompt.md因果排查与修复performance-optimization-prompt.md性能优化决策prompt-evolution-prompt.md让 prompt 自己进化自己subagent-protocol.md18 个子 Agent 角色的协作协议……以及更多所有 prompt 都遵循同一套 DSL可以按需加载、组合、演化。Prompt 自动进化PEL最有意思的部分可能是Prompt Evolution LoopPEL。它的思路很简单对同一个种子 prompt自动生成多个变异版本用同一组真实任务并行评测然后保留适应度最高的变体。我们已经在示例报告中展示了一次真实的 PEL 运行结果CONSTRAINT_ADD算子修复了一个 P0 级协议一致性缺陷ANTI_PATTERN_BLOCK算子因为与既有规则矛盾而被废弃EXAMPLE_INJECT算子需要与清单化调用点结合才有效。这些结论本身就是 prompt 工程从“玄学”走向“可实验科学”的证据。推荐配置这套方法论是为了高风险任务设计的会消耗更多 token 和上下文。但我们认为值得。主 Agent / 编排层推荐 200B、200K 上下文的强模型子 Agent / 审查层可以用更便宜的中等模型运行方式先读main.md再按需加载对应 prompt。适用场景复杂代码审查与架构决策Bug 根因排查性能优化实验设计科研论证与技术调研任何“说错一句话代价很高”的任务开源MIT 协议我们希望这套方法能被更多人验证、改进、应用到不同领域。如果你成功把它用到了软件工程或科研之外的领域用 PEL 进化出了更好的 prompt 变体发现了某个 prompt 的漏洞欢迎在 GitHub 上开 Issue 或 PR。社区会一起积累更多领域的 adapter 和最佳实践。下一步打开仓库https://github.com/Ghost-Silver/Agentic-Method从core/master-prompt.md开始读选一个你正在头疼的复杂任务试试experimental-design-prompt.md或debug-prompt.md如果有效回来点个 ⭐或者分享你的使用案例这不是又一个 prompt 仓库。这是一套让 LLM 学会像科研人员一样思考的工作流。https://github.com/Ghost-Silver/Agentic-Method

相关新闻

Python生成器原理与应用:从yield到内存优化

Python生成器原理与应用:从yield到内存优化

1. 从函数到生成器的跨越第一次遇到yield关键字时,我正尝试处理一个超过10GB的日志文件。传统方法是将整个文件读入内存,结果自然是内存溢出。同事建议我试试生成器,从此打开了新世界的大门。yield是Python中一个神奇的关键字,它能…

2026/7/31 5:48:30 阅读更多
Jetpack Compose滚动布局进阶:LazyListState控制与性能优化实战

Jetpack Compose滚动布局进阶:LazyListState控制与性能优化实战

1. 项目概述:从“能用”到“好用”的滚动体验在移动应用开发中,滚动布局是用户交互的基石。无论是浏览社交动态、查看商品列表,还是阅读长篇文章,流畅、自然的滚动体验直接决定了用户对应用的第一印象和留存意愿。Jetpack Compose…

2026/7/31 5:50:07 阅读更多
STM32开发必知:CubeMX沙箱段配置与链接脚本实战解析

STM32开发必知:CubeMX沙箱段配置与链接脚本实战解析

1. 从“沙箱”说起:CubeMX配置的基石逻辑刚接触STM32和CubeMX的朋友,第一次看到“沙箱段”这个词,多半会有点懵。这名字听起来像是某种隔离的安全区域,和芯片配置有什么关系?我第一次在CubeMX的工程设置里看到它时&…

2026/7/31 5:45:00 阅读更多
程序员攻克技术英语:词根词缀实战指南与编程术语解析

程序员攻克技术英语:词根词缀实战指南与编程术语解析

1. 为什么程序员必须啃下词根词缀这块硬骨头“程序员也要学英语”,这话听起来像一句正确的废话,但真正能把它当回事,并且找到高效路径的人,少之又少。很多人一提到学英语,脑子里蹦出来的就是背单词、刷美剧、练口语&am…

2026/7/31 5:45:00 阅读更多
HART协议详解:05 HART现场通信实战

HART协议详解:05 HART现场通信实战

第五季 HART现场通信实战 ——从USB-HART Modem抓包到工程诊断:让协议知识变成维修能力 各位工业现场的工程师朋友们,大家好! 经过前四季的系统学习,我们已经构建了HART协议的完整理论框架: 第一季:六层生命模型与本质认知 第二季:物理层4–20mA与FSK魔法 第三季:数…

2026/7/31 0:14:40 阅读更多
维修工程师的示波器实战:02 探头地线——示波器最大的“坑”

维修工程师的示波器实战:02 探头地线——示波器最大的“坑”

第二篇:探头地线——示波器最大的“坑” ——那根不起眼的小地线,可能比你测的信号还重要 很多工程师第一次用示波器时,都会经历这样一个“惊魂”时刻。 某食品厂包装线,伺服偶发报警。年轻工程师判断是编码器信号受干扰,便拿出示波器认真测量。波形一出来,所有人都倒…

2026/7/31 0:14:40 阅读更多