← 返回概念项目列表 工程实现架构设计产品设计工程实现
概念原型技术验证企业提效独立设计
Prompt 资产管理与评测中心
企业级 Prompt 治理平台,统一管理各部门 prompt 版本,修改即评测,退化必拦截
企业 AI 改造进入深水区后,prompt 不再是工程师的个人技能,而是企业资产。客服部改了一行 prompt,运营部的 Agent 可能就答非所问。这个原型是企业 AI 提效矩阵的治理层——所有业务 Agent 的 prompt 统一托管、版本管理、自动评测,让 prompt 修改从"凭感觉"变成"有依据"。
产品原型
Prompt 工作台主界面 · 交互原型预览
PromptLab
v3 vs v2 · 在客服 FAQ 评测集上的对比
200 条评测 · 整体准确率 +4.2% · 3 条退化 · 8 条改善
查看 bad case 分析 →+4.2%
整体准确率
8
改善 case
3
退化 case
退化 case(需关注)
⚠
#047 · 退款条件查询 · v2 答对 v3 漏了"7天内"
退化
⚠
#112 · 会员等级 · v2 答对 v3 多加了过期条件
退化
✓
#089 · 物流查询 · v2 漏答 v3 答对
改善
核心模块
我设计的四个关键模块
01
📝Prompt 版本管理
把 prompt 当代码:版本、diff、blame、分支。核心设计是每次修改必须关联一个"假设"(这次改动预期改善什么),否则不允许提交。
02
🧪评测闭环
修改 prompt → 自动跑评测集 → 输出对比报告。我设计了增量评测:只跑上次失败 + 随机抽样,把评测时间从 12 分钟压到 90 秒。
03
📉退化检测
整体准确率提升不代表没有退化。我单独列出退化 case(v2 答对 v3 答错),并要求产品经理逐条确认后才能发布。
04
🔗变更追溯
每条线上 prompt 都能追溯到:谁改的、为什么改、评测结果、发布时间。这是 prompt 工程化的底线——没有追溯就没有回滚。
技术方案
Prompt-as-Code 的评测闭环架构
📝
Prompt RepoGit + 假设字段→
🧪
Eval Runner增量 + 全量→
📊
Diff Report退化/改善分析→
🚀
Release Gate逐条确认设计权衡与开放问题
已决策
- prompt 修改必须关联"假设",否则拒绝提交
- 增量评测:只跑上次失败 + 抽样,90 秒出结果
- 退化 case 单独列出,需逐条确认才能发布
- 所有变更可追溯到人和原因
➜
开放问题
- 评测集如何防止过拟合?长期跑同一批数据
- LLM-as-judge 的可信度如何量化?
- 多 prompt 协作时如何做联合评测?
- 非工程角色能否独立完成评测?门槛仍偏高