编程而非提示:把任务写成带类型的签名
官方的主张是「编程而非提示」:不再维护一段段自然语言提示,而是用带类型的输入输出声明任务(签名),再把它组合进模块与程序。这样做的好处是任务描述变成了代码——可复用、可版本管理、可被工具检查,多个模块之间通过类型约定协作。对已经习惯手写提示词的团队,最初的不适感来自「不再直接控制措辞」,但换来的是流程可测试、改动可审阅,且不必为每个模型单独调一遍措辞。
深度介绍
官方的主张是「编程而非提示」:不再维护一段段自然语言提示,而是用带类型的输入输出声明任务(签名),再把它组合进模块与程序。这样做的好处是任务描述变成了代码——可复用、可版本管理、可被工具检查,多个模块之间通过类型约定协作。对已经习惯手写提示词的团队,最初的不适感来自「不再直接控制措辞」,但换来的是流程可测试、改动可审阅,且不必为每个模型单独调一遍措辞。
官方把框架拆成三件原语。签名负责「声明做什么」,例如把一封邮件映射为事件名称与日期两个字段;模块负责「怎么做」,同一个签名可以搭配不同的推理策略,从而在接口不变的前提下切换实现;优化器负责「怎么变好」,它读取你的程序、评测指标与标注数据,自动搜索更好的提示词与示例组合。这种分层让「换策略」与「调效果」互不干扰:前者改模块,后者交给优化器。
官方文档列出的优化器相当丰富,包括 BootstrapFewShot 系列(含随机搜索与改进版)、BootstrapFinetune(把提示优化与微调结合)、COPRO、MIPROv2、SIMBA、InferRules、KNN 与 KNNFewShot、LabeledFewShot、Ensemble 以及组合式的 BetterTogether。近期还加入了基于反思式提示进化的 GEPA。它们的差别主要在于是否需要标注数据、是否更新模型权重、以及搜索策略的激进程度;实践上通常先用简单方法拿到基线,再逐步换用更重的优化器。
官方 README 列出完整论文清单,从 2022 年的 Demonstrate-Search-Predict、2023 年 10 月的 DSPy 原始论文(发表于 ICLR 2024),到 2024 年的多阶段程序优化、微调与提示优化结合、提示作为超参数,再到 2025 年 7 月的 GEPA。对工程团队,这意味着每个优化器背后都有可追溯的方法与实验设定,遇到效果不符预期时可以回到论文核对前提;对研究团队,这套框架本身也常被用作实验基线。
官方文档把评测(Evaluation)独立成章,这与它的设计前提一致:优化器需要指标才能工作,因此开发流程天然是「先定指标、再建评测集、然后优化」。相比「凭感觉改提示词」的做法,这种流程在多人协作时更稳定——任何改动都能用同一套评测回答「是否变好」。代价是前期投入:构造一个有代表性的评测集往往比写第一版提示词更费时,但它会被后续每一次迭代复用。
除核心原语外,官方文档还覆盖工具(Tools)、开发与部署等主题,并内置 Python 解释器组件供需要执行代码的流程使用。从发布说明看,最新候选版本的工作集中在解释器改进、优化器提速与协议兼容上——例如 PythonInterpreter 的改进、GEPA 速度提升以及 MCP v2 兼容。对需要让程序调用外部系统或执行计算的团队,这些是决定能否落地的配套能力。
官方站点给出的数字包括月下载量数百万级、贡献者四百余名与仓库约 3.8 万 star,并列出在生产环境中使用它的公司(其中包含多家知名数据与电商平台)。这类信息可以作为成熟度参考,但并不替代自测:DSPy 的收益高度依赖任务是否有稳定指标与足够评测数据,如果任务本身难以量化,优化器能发挥的空间有限。官方另设有社区讨论渠道与教程区,包含优化、反思式提示进化与实验性强化学习优化等专题。
DSPy 以 MIT 许可开源,版权声明为斯坦福未来数据系统(Stanford Future Data Systems),要求 Python 3.10 及以上,安装命令为一条 pip。核验时最新发布为 3.4.0b1(2026 年 8 月 21 日的候选版本),此前稳定版本为 3.3.0(2026 年 5 月 28 日)、3.2.1(2026 年 4 月 21 日)与 3.1.x(2026 年 1 月)。项目迭代较快,生产环境建议固定版本并在升级前确认优化器行为是否变化。
产品特点
任务以声明的输入输出字段表达,而不是自然语言提示;任务描述因此成为可版本管理、可被工具检查的代码,模块之间通过类型约定协作,换模型时也不必重调措辞。
官方提供 BootstrapFewShot 系列、BootstrapFinetune、COPRO、MIPROv2、SIMBA、InferRules、KNN 系列、LabeledFewShot、Ensemble、BetterTogether 与 GEPA 等优化器,可按数据条件与搜索强度选择。
优化器需要指标才能工作,因此流程天然是先定义指标、建立评测集,再由优化器搜索改进;每次改动都能用同一套评测回答是否变好。
从 2022 年的 Demonstrate-Search-Predict 到 ICLR 2024 的 DSPy 论文,再到多阶段优化、提示作为超参数与 2025 年的 GEPA,每个优化器背后都有可核对的论文与方法设定。
最近动态
官方文档首页标注的最新版本为 DSPy 3.4.0b1,更新要点包括 PythonInterpreter 的改进、GEPA 优化器速度提升,以及 MCP v2 兼容。该版本为候选版本,生产环境使用前建议在自有评测集上验证行为差异。
3.3.0 于 2026 年 5 月 28 日发布,是核验时点之前的一个稳定版本。项目在 3.x 系列中持续补充优化器与配套能力,升级前建议核对优化器接口与默认行为是否变化。
3.2.1 于 2026 年 4 月 21 日发布。对依赖较多优化器的项目,建议在固定版本下保存评测基线,升级后先跑一遍评测再决定是否切换。
2026 年 1 月 6 日发布 3.1.1、1 月 19 日发布 3.1.3。整体看项目保持每季度若干次功能版本的节奏,候选版本与稳定版本并行推进。
DSPy 是由斯坦福 NLP 与社区维护的开源框架,官方把它定义为「用于编程而非提示大模型的框架」,缩写含义是声明式自改进 Python(Declarative Self-improving Python)。它的目标是把大模型应用的开发从「手写并反复调试提示词」转向「写模块化程序加自动优化」:用带类型的签名声明任务,用模块组合出流程,再用内置优化器自动搜索更好的提示词与示例组合。项目以 MIT 许可开源(版权声明为斯坦福未来数据系统),要求 Python 3.10 及以上,核验时最新发布为 3.4.0b1(2026 年 8 月 21 日),此前稳定版本为 3.3.0(2026 年 5 月)与 3.2.1(2026 年 4 月)。 框架的核心是三件原语。签名负责声明任务的输入输出字段;模块负责实现策略,同一个签名可搭配不同推理方式,从而在接口不变的前提下替换实现;优化器负责效果,官方文档列出的包括 BootstrapFewShot 系列、BootstrapFinetune、COPRO、MIPROv2、SIMBA、InferRules、KNN 与 KNNFewShot、LabeledFewShot、Ensemble、BetterTogether 以及基于反思式提示进化的 GEPA。此外文档覆盖评测、工具、模型接入、开发与部署等章节,并内置 Python 解释器组件供需要执行代码的流程使用;最新候选版本的更新集中在解释器改进、优化器提速与 MCP v2 兼容上。 与它的设计前提相一致,DSPy 的开发流程天然是评测驱动的:优化器需要指标与数据才能工作,所以要先定义评测、再建评测集、然后让优化器搜索改进,任何改动都能用同一套评测回答是否变好。官方 README 还给出完整论文清单,从 2022 年的 Demonstrate-Search-Predict、2023 年的 DSPy 原始论文(ICLR 2024),到 2024 年的多阶段程序优化与提示作为超参数,再到 2025 年的 GEPA,方法来源可追溯。官方站点给出的规模数据包括月下载量数百万级、四百余名贡献者与约 3.8 万 star,并列出了在生产环境使用它的公司。 使用前需要注意:它更适合有明确指标与稳定评测数据的任务,任务难以量化时优化器的收益有限;前期构建评测集的投入不小,但会被后续迭代反复复用;优化器数量多且行为不同,建议先用简单方法建立基线再换用更重的方案;项目迭代较快且候选版本与稳定版本并行,生产环境应固定版本并在升级前跑一遍自有评测。
核验信息
本页事实来自 DSPy 官方渠道:GitHub 仓库 README(「编程而非提示」定位、DSPy 缩写含义、安装命令、论文清单与引用信息)与许可文件(MIT,版权归斯坦福未来数据系统)、发布页版本与日期,以及官方文档站首页与相关章节(三件原语说明、优化器清单、评测与工具章节、Python 版本要求与 MIT 许可标注、版本更新要点、月下载量与贡献者与 star 等规模数据、生产使用者名单)。版本、规模数据与功能核验于 2026 年 9 月 22 日,项目迭代较快,请以官方文档与发布说明为准。
DSPy介绍页面对您是否有帮助?