← 返回概念项目列表
概念原型技术验证企业提效独立设计

Prompt 资产管理与评测中心

企业级 Prompt 治理平台,统一管理各部门 prompt 版本,修改即评测,退化必拦截

企业 AI 改造进入深水区后,prompt 不再是工程师的个人技能,而是企业资产。客服部改了一行 prompt,运营部的 Agent 可能就答非所问。这个原型是企业 AI 提效矩阵的治理层——所有业务 Agent 的 prompt 统一托管、版本管理、自动评测,让 prompt 修改从"凭感觉"变成"有依据"。

性质:概念原型 · 无真实客户状态:可交互原型设计周期:3 周技术栈:Next.js + FastAPI + PostgreSQL

产品原型

Prompt 工作台主界面 · 交互原型预览

promptlab.workbench/v3/diff
Prototype
v3 vs v2 · 在客服 FAQ 评测集上的对比

200 条评测 · 整体准确率 +4.2% · 3 条退化 · 8 条改善

查看 bad case 分析 →
+4.2%
整体准确率
8
改善 case
3
退化 case
退化 case(需关注)
#047 · 退款条件查询 · v2 答对 v3 漏了"7天内"
退化
#112 · 会员等级 · v2 答对 v3 多加了过期条件
退化
#089 · 物流查询 · v2 漏答 v3 答对
改善

核心模块

我设计的四个关键模块

01
📝
Prompt 版本管理
工程实现

把 prompt 当代码:版本、diff、blame、分支。核心设计是每次修改必须关联一个"假设"(这次改动预期改善什么),否则不允许提交。

02
🧪
评测闭环
架构设计

修改 prompt → 自动跑评测集 → 输出对比报告。我设计了增量评测:只跑上次失败 + 随机抽样,把评测时间从 12 分钟压到 90 秒。

03
📉
退化检测
产品设计

整体准确率提升不代表没有退化。我单独列出退化 case(v2 答对 v3 答错),并要求产品经理逐条确认后才能发布。

04
🔗
变更追溯
工程实现

每条线上 prompt 都能追溯到:谁改的、为什么改、评测结果、发布时间。这是 prompt 工程化的底线——没有追溯就没有回滚。

技术方案

Prompt-as-Code 的评测闭环架构

📝
Prompt RepoGit + 假设字段
🧪
Eval Runner增量 + 全量
📊
Diff Report退化/改善分析
🚀
Release Gate逐条确认

设计权衡与开放问题

已决策

  • prompt 修改必须关联"假设",否则拒绝提交
  • 增量评测:只跑上次失败 + 抽样,90 秒出结果
  • 退化 case 单独列出,需逐条确认才能发布
  • 所有变更可追溯到人和原因

开放问题

  • 评测集如何防止过拟合?长期跑同一批数据
  • LLM-as-judge 的可信度如何量化?
  • 多 prompt 协作时如何做联合评测?
  • 非工程角色能否独立完成评测?门槛仍偏高