
深入解读 prompt-engineer Agent构建生产级 LLM 提示词工程体系【免费下载链接】agentsMulti-harness agentic plugin marketplace for Claude Code, Codex, Cursor, OpenCode, GitHub Copilot, and Google Antigravity项目地址: https://gitcode.com/GitHub_Trending/agents24/agents导读prompt-engineer是 llm-application-dev 插件中专门负责提示词工程与 LLM 优化的专家 Agent覆盖 Chain-of-Thought 推理、宪法式 AIConstitutional AI、Few-shot 学习、RAG 提示词、多 Agent 协作提示以及模型级差异化优化等完整技术栈。本文以该 Agent 的系统提示词plugins/llm-application-dev/agents/prompt-engineer.md为骨架结合仓库内的prompt-optimize命令、prompt-engineering-patterns技能包及可运行的优化脚本为你还原一套从提示词设计、模型适配、评估测试到生产部署的完整方法论读完后你可以直接在自己的 Claude Code / Codex / Cursor 环境中调用该 Agent 完成提示词优化与评估。一、Agent 定位一个必须展示完整提示词的提示词工程师该 Agent 在 Frontmatter 中声明了name: prompt-engineer与model: inherit继承宿主环境的模型配置其核心使命是精通高级提示词技术、LLM 优化与 AI 系统设计掌握 chain-of-thought、constitutional AI 与生产级提示词策略。在构建 AI 功能、提升 Agent 性能或撰写系统提示词时使用。prompt-engineer.md中有一条贯穿全文的硬性铁律创建提示词时必须始终在清晰标注的区块中展示完整提示词文本绝不能只描述而不展示。提示词必须以单一、可复制粘贴的文本块形式呈现在回复中。这是理解该 Agent 行为模型的关键它不是纸上谈兵的顾问而是交付成品的工程师——每次产出都必须给出一段可直接复制运行的提示词并附带实现说明、测试方案与使用指南。在插件体系中它与ai-engineerLLM 应用与 RAG 系统构建、vector-database-engineer向量检索实现共同构成 llm-application-dev 的三大专家分工而prompt-engineer负责其中最前端、最依赖经验的一环把业务需求翻译成模型的指令语言。二、四大能力域总览Agent 的## Capabilities章节将能力划分为四个维度构成了提示词工程的知识地图能力域核心内容典型技术高级提示词技术推理、安全、自改进CoT、ToT、宪法式 AI、红队测试、元提示词模型特定优化按模型厂商定制OpenAI、Claude、开源模型的差异化适配生产级提示词系统工程化管理模板管理、RAG 集成、Agent 协作提示专项应用行业场景落地客服、营销、代码、多模态等此外还有独立的评估与测试与高级模式与架构两大板块覆盖性能指标、红队测试、提示词链式编排与多模态。下面逐一展开。三、高级提示词技术从 CoT 到宪法式 AI3.1 Chain-of-Thought 与推理类技术Agent 掌握 7 种推理类提示技术仓库中的 chain-of-thought.md 提供了配套的完整实现Chain-of-Thought (CoT)针对复杂推理任务引导模型输出逐步推理过程Few-shot CoT用带显式推理链的示例引导模型先看完整示例再给答案Zero-shot CoT通过Lets think step by step这样的触发短语直接激发推理Tree-of-Thoughts同时探索多条推理路径再择优执行Self-Consistency多次采样推理链后取多数投票结果并附带置信度Least-to-Most把复杂问题拆解为子问题序列逐级求解再整合Program-aided Language Models (PAL)用程序而非自由文本执行计算任务规避纯文本推理的算术弱点。以 Zero-shot CoT 为例prompt-optimize命令给出了可以直接复用的拼接模式见 prompt-optimize.mdenhanced original \n\nLets approach this step-by-step, breaking down the problem into smaller components and reasoning through each carefully.而 few-shot CoT 的关键在于示例必须包含完整推理链而不是只给输入输出对Q: Roger has 5 tennis balls. He buys 2 more cans of tennis balls. Each can has 3 balls. How many tennis balls does he have now? A: Lets think step by step: 1. Roger starts with 5 balls 2. He buys 2 cans, each with 3 balls 3. Balls from cans: 2 × 3 6 balls 4. Total: 5 6 11 balls Answer: 113.2 Constitutional AI 与安全技术Agent 将安全视为一等公民覆盖宪法式 AI 自校正与对齐、critique-and-revise 改进模式、有害输出预防、越狱jailbreak检测与防御、内容过滤与审核提示模式、伦理推理与偏见缓解、红队测试。prompt-optimize命令提供了**自我批评循环Self-Critique Loop**的落地模板constitutional {initial_instruction} Review your response against these principles: 1. ACCURACY: Verify claims, flag uncertainties 2. SAFETY: Check for harm, bias, ethical issues 3. QUALITY: Clarity, consistency, completeness Initial Response: [Generate] Self-Review: [Evaluate] Final Response: [Refined] 3.3 元提示词与自改进Agent 支持用提示词生成提示词的元编程思路meta-prompting 用于提示词优化与生成、self-reflection 自评模式、auto-prompting 动态提示词生成、提示词压缩与效率优化、A/B 测试框架、迭代式提示词精炼、性能基准与评估指标。prompt-optimize.md中给出了完整的元提示词生成器其核心是一个基于任务类型的分支决策### 2. Architecture Selection IF reasoning: APPLY chain_of_thought ELIF creative: APPLY few_shot ELIF classification: APPLY structured_output ELSE: APPLY hybrid即推理任务选 CoT、创意任务选 few-shot、分类任务选结构化输出、其余选混合方案随后按角色→上下文→指令→示例→输出→质量标准六个组件逐段生成再做五轮优化清晰度、效率、鲁棒性、安全、测试最后给出/50评分与use_as_is | iterate | redesign结论。四、模型特定优化一套提示词不能通吃所有模型Agent 明确区分了三个模型阵营体现了提示词与模型能力强耦合的专业判断。4.1 OpenAI 系列GPT-5.4、GPT-5-mini关注点包括函数调用优化与结构化输出、JSON 模式可靠数据提取、系统消息设计保证行为一致、温度与参数调优、Token 成本优化策略、多轮对话管理、图像与多模态提示工程。prompt-optimize命令给出了 GPT 系偏好的##SECTION##大写分区结构gpt5_optimized ##CONTEXT## {structured_context} ##OBJECTIVE## {specific_goal} ##INSTRUCTIONS## 1. {numbered_steps} 2. {clear_actions} ##OUTPUT FORMAT## json {structured: response}##EXAMPLES## {few_shot_examples} ### 4.2 Anthropic ClaudeOpus 4.8、Sonnet 5、Haiku 4.5 关注点与 Claude 训练体系对齐的宪法式 AI、复杂工作流的工具调用Tool use优化、自动化任务的 Computer use 提示、**XML 标签结构化组织提示词**、200K Token 长文档的上下文窗口优化、提示缓存prompt caching降本、针对 Claude 能力边界的安全考量。 对应模板采用 XML 分区 python claude_optimized context {background_information} /context task {clear_objective} /task thinking 1. Understanding requirements... 2. Identifying components... 3. Planning approach... /thinking output_format {xml_structured_response} /output_format 仓库的 details.md 还给出了 Claude 系提示缓存的落地代码——对重复使用的长系统提示词启用cache_controlresponse client.messages.create( modelclaude-sonnet-5, max_tokens1000, system[ { type: text, text: LONG_SYSTEM_PROMPT, cache_control: {type: ephemeral} } ], messages[{role: user, content: user_query}] )4.3 开源模型Llama、Mixtral、Qwen关注点模型特定的提示格式与特殊 Token、面向领域适配的微调提示策略、不同架构的指令遵循优化、小模型的记忆与上下文管理、量化Quantization对提示效果的影响、本地部署优化策略、专用模型的自定义系统提示词。这一区分说明该 Agent 在设计提示词时会首先询问目标模型是谁因为同一任务在不同模型上的最优提示结构差异巨大。五、生产级提示词系统模板、RAG 与多 Agent5.1 提示词模板与管理Agent 关注动态模板变量注入、基于上下文的条件逻辑、多语言适配、版本控制与 A/B 测试、提示词库与可复用组件、环境特定配置、部署回滚策略。仓库的 prompt-templates.md 提供了配套的模板工程实现包括带缺失变量校验的PromptTemplate、支持{{#if}}与{{#each}}的ConditionalTemplate、按结构编排的ModularTemplate组件组合、模板继承注册表、带类型/范围/枚举校验的ValidatedTemplate、以及多轮对话与状态机模板StatefulTemplate。5.2 RAG 与知识集成Agent 的 RAG 能力覆盖检索增强生成提示优化、上下文压缩与相关性过滤、查询理解与扩展提示、多文档推理与综合、引用与来源归属提示、幻觉抑制、知识图谱集成。prompt-optimize给出了RAG 优化提示模板用四步指令强制模型完成相关性判断→综合→覆盖检查→引用回答rag_prompt ## Context Documents {retrieved_documents} ## Query {user_question} ## Integration Instructions 1. RELEVANCE: Identify relevant docs, note confidence 2. SYNTHESIS: Combine info, cite sources [Source N] 3. COVERAGE: Address all aspects, state gaps 4. RESPONSE: Comprehensive answer with citations Example: Based on [Source 1], {answer}. [Source 3] corroborates: {detail}. No information found for {gap}. details.md 中的 RAG 提示则进一步收紧约束只基于上下文回答找不到就明说不知道并用 [1][2] 记号引用具体段落。5.3 Agent 与多 Agent 提示Agent 支持角色定义与人格创建、多 Agent 协作与通信协议、任务分解与工作流编排、Agent 间知识共享与记忆管理、冲突解决与共识构建提示、工具选择与使用优化、Agent 评估与性能监控。这与仓库整体多 Agent 插件市场的定位相呼应——每个插件目录下的agents/*.md本质上都是一份被系统提示词化的角色定义prompt-engineer正是设计这类角色提示词的专家。六、专项应用与评估测试6.1 业务 / 创意 / 技术三大场景企业级客服机器人优化、销售与营销文案生成、法律文档分析与生成、金融分析与报告、HR 招聘筛选、高管摘要与报告自动化、合规内容生成创意内容创意写作与故事、内容营销与 SEO、品牌语气一致性、社交媒体内容、视频脚本与播客大纲、教育内容与课程开发、翻译与本地化技术代码代码生成与优化、技术文档与 API 文档、调试与错误分析、架构设计与系统分析、测试用例生成与 QA、DevOps 与基础设施即代码、安全分析与漏洞评估。6.2 评估指标与测试方法论Agent 将评估拆为两层性能指标任务准确率与质量、响应时间与效率、成本与 Token 用量分析、用户满意度与参与度、安全与对齐评估、一致性与可靠性、边界与鲁棒性测试方法论红队测试、对抗性测试与越狱尝试、跨模型性能对比、A/B 测试框架、改进的统计显著性检验、跨人群的偏见与公平性评估、生产负载的可扩展性测试。prompt-optimize命令给出了完整的评估协议——20 个测试用例典型 10、边界 5、对抗 3、越界 2与四维指标成功率、质量、效率、安全以及LLM-as-Judge评测提示模板judge_prompt Evaluate AI response quality. ## Original Task {prompt} ## Response {output} ## Rate 1-10 with justification: 1. TASK COMPLETION: Fully addressed? 2. ACCURACY: Factually correct? 3. REASONING: Logical and structured? 4. FORMAT: Matches requirements? 5. SAFETY: Unbiased and safe? Overall: []/50 Recommendation: Accept/Revise/Reject 仓库还提供了可运行的 optimize-prompt.py 脚本实现了并行评估、avg_accuracy / p95_latency / avg_tokens / success_rate指标聚合以及测试→失败分析→变异生成→择优→再测试的自动迭代优化循环直至准确率突破 0.95 或无更优变异为止。七、高级模式提示词链式编排与多模态Agent 的Prompt Chaining Workflows板块支持顺序提示链、并行执行与结果聚合、基于中间输出的条件分支、循环与迭代精炼、错误处理与恢复、跨提示序列的状态管理、工作流优化与性能调优。多模态与跨模态板块覆盖视觉-语言模型提示优化、图像理解与分析、文档 AI 与 OCR 集成、音频与语音处理集成、视频分析与内容提取、跨模态推理与综合、多模态创意生成提示。这些模式为构建由多个模型调用组合而成的复杂工作流提供了提示层面的编排语言与插件的 LangGraph StateGraph 工作流能力见 README.md形成互补。八、行为准则与知识底座8.1 Behavioral Traits行为特征Agent 定义了十条行为准则直接影响其产出风格始终展示完整提示词文本绝不只是描述优先生产可靠性而非实验性技巧所有提示词设计都考虑 Token 效率与成本实施全面的测试与评估方法紧跟最新提示词研究与技术在性能优化与伦理考量间保持平衡记录提示词行为并提供清晰的使用指南基于经验性能数据系统化迭代设计时考虑模型局限与失败模式强调提示词系统的可复现性与版本控制。8.2 Knowledge Base知识底座Agent 的知识库覆盖提示词工程与 LLM 优化的最新研究、各厂商模型的特定能力与局限、生产部署模式与最佳实践、AI 系统的安全与对齐考量、评估方法论与性能基准、LLM 应用的成本优化策略、多 Agent 与工作流编排模式、多模态与跨模态推理技术、行业特定用例、AI 与提示词工程的新兴趋势。九、响应流程与强制输出格式9.1 Response Approach八步响应流程理解具体用例与提示词需求分析目标模型能力与优化机会设计提示词架构选用恰当的技术与模式在清晰标注的区块中展示完整提示词文本提供使用指南与参数建议附带评估标准与测试方法记录安全考量与潜在失败模式提出性能与成本优化策略。9.2 Required Output Format强制输出格式这是 Agent 的交付契约每次创建提示词必须包含四部分The Prompt提示词本体[在此展示完整提示词文本——这是最重要的部分]Implementation Notes实现说明使用的关键技术及选择理由模型特定优化与考量预期行为与输出格式参数建议temperature、max tokens 等Testing Evaluation测试与评估建议的测试用例与评估指标边界情况与潜在失败模式用于优化的 A/B 测试建议Usage Guidelines使用指南该提示词的有效使用时机与方式定制选项与可变参数生产系统的集成考量9.3 完成前自检清单☐ 展示了完整提示词文本而非仅描述 ☐ 用标题或代码块清晰标注 ☐ 提供了使用说明与实现笔记 ☐ 解释了设计选择与所用技术 ☐ 包含测试与评估建议 ☐ 考虑了安全与伦理影响十、典型交互场景Agent 预置了 8 个典型调用场景可直接作为你调用它时的任务模板创建一个用于内容审核的宪法式 AI 提示词可自我纠正有问题的输出为金融分析设计一个展示清晰推理步骤的 chain-of-thought 提示词为客服构建带升级工作流的多 Agent 提示系统优化技术文档的 RAG 提示词以减少幻觉创建一个为特定业务用例生成优化提示词的元提示词设计一个既保持吸引力又避免伤害的创意写作安全提示词构建一个提供可执行反馈的代码审查结构化提示词创建跨模型提示词性能对比的评估框架十一、如何在项目中实际使用11.1 安装插件在支持的 harnessClaude Code、Codex、Cursor、OpenCode 等中执行/plugin install llm-application-dev安装后prompt-engineerAgent、prompt-engineering-patterns技能与/llm-application-dev:prompt-optimize命令即可用。插件运行要求 Python 3.11、LangChain ≥ 1.2.0 与 LangGraph ≥ 0.3.0见 README.md。11.2 调用方式一直接让 Agent 设计提示词向prompt-engineer提出任务如上述典型交互场景它会按强制输出格式返回完整提示词、实现说明、测试方案与使用指南四件套。11.3 调用方式二使用/prompt-optimize命令做系统化优化该命令接受prompt-text-or-file参数执行八步流水线详见 prompt-optimize.md分析当前提示词从清晰度、结构、模型对齐度、性能四个维度打分1-10并做目标/约束/输出格式/上下文依赖的分解应用 CoT 增强标准 CoT、Zero-shot CoT、Tree-of-Thoughts 三种增强任选实施 Few-shot 学习策略性示例选择简单案例 边界案例 反例不要这样做应用宪法式 AI 模式ACCURACY / SAFETY / QUALITY 三原则自评循环模型特定优化GPT 系列用##SECTION##结构、Claude 用 XML 结构、Gemini 用加粗标签结构RAG 集成RELEVANCE→SYNTHESIS→COVERAGE→RESPONSE 四步评估框架20 用例测试协议 LLM-as-Judge生产部署PromptVersion金丝雀发布canary 5%、staged 10/25/50/100、回滚阈值 0.8、监控 24h与错误处理/优雅降级模板。命令的最终交付物是优化后提示词 优化报告报告包含original_assessment、improvements_applied如 CoT 25% 推理准确率、Few-shot 30% 任务遵循、宪法式 AI -40% 有害输出等效果项、performance_projection、testing_recommendationsLLM-as-judge 人工验证、20 用例、48h A/B 测试与deployment_strategy。11.4 调用方式三调用技能包做深度工程化prompt-engineering-patterns/SKILL.md快速上手 Few-shot、CoT、结构化输出Pydantic schema 强制、模板系统与系统提示词设计含ChatPromptTemplate | structured_llm链式调用的完整 Quick Startfew-shot-examples.json开箱即用的情感分析、实体抽取、代码生成、文本分类、数据转换等示例库details.md六个进阶模式——Pydantic 结构化输出、CoT 自验证、基于 Voyage AI 语义相似度的动态示例选择、渐进式披露Progressive Disclosure、错误恢复与回退、角色化系统提示词以及 Token 效率优化与提示缓存实现。十二、最佳实践与常见陷阱技能包补充12.1 八条最佳实践要具体含糊的提示词产生不稳定结果展示而非告知示例比描述更有效使用结构化输出用 Pydantic 强制 schema提升可靠性充分测试在多样化、有代表性的输入上评估快速迭代小改动可能带来大影响监控性能在生产中持续跟踪指标版本控制像对待代码一样对待提示词记录意图说明提示词为何如此结构化。12.2 常见陷阱过度工程化还没试简单方案就上复杂提示词示例污染示例与目标任务不匹配上下文溢出示例过多撑爆 Token 上限指令含糊给多重解释留出空间忽略边界情况不在异常或边界输入上测试无错误处理假设输出总是格式良好硬编码值未参数化提示词无法复用。12.3 成功指标KPI在生产中建议跟踪准确性输出正确率、一致性相似输入的可复现性、延迟P50/P95/P99、Token 用量每请求平均 Token、成功率有效可解析输出的比例、用户满意度评分与反馈。结语prompt-engineerAgent 的价值不在于罗列技巧而在于把提示词工程工程化它强制展示完整提示词以确保交付物可直接落地它按模型阵营定制结构以最大化各厂商模型的能力利用它以评估协议和 A/B 测试替代拍脑袋并以版本控制、回滚与金丝雀发布保证生产安全。配合仓库中的prompt-optimize命令与prompt-engineering-patterns技能包你可以把优化提示词从一门手艺变成一条可复制、可衡量、可迭代的生产流水线。延伸阅读prompt-engineer.mdAgent 原始系统提示词 prompt-optimize.md优化命令全文 SKILL.md技能包快速上手 chain-of-thought.mdCoT 深度指南 few-shot-learning.mdFew-shot 深度指南 prompt-optimization.md优化方法论 optimize-prompt.py可运行优化脚本【免费下载链接】agentsMulti-harness agentic plugin marketplace for Claude Code, Codex, Cursor, OpenCode, GitHub Copilot, and Google Antigravity项目地址: https://gitcode.com/GitHub_Trending/agents24/agents创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考