← 返回作品集 PO PromptOps Evaluation Platform Prompt 质量评测与版本优化 Demo

AGENT DEMO 02

PromptOps 评测与优化控制台

把 Prompt 当作工程资产管理:版本记录、测试集、批量评测、失败分析、人审复核和迭代对比集中在一个可演示流程里。 公开演示使用 Mock Model 保持稳定;工程版可接入 OpenAI、Claude、Gemini、DeepSeek 等模型 Provider。

Mock Model No API Key Static Vercel Demo
运行次数 0 累计批量任务
平均得分 0.00 关键词与规则评分
失败率 0% 低于阈值的输出
总成本 $0.000000 Mock token 成本
平均耗时 0ms 模拟模型延迟
Prompt 版本 测试集 批量运行 自动评分 人工复核 版本优化

01 / Prompt Library

Prompt 版本管理

02 / Test Set

测试用例管理

03 / Prompt Preview

当前 Prompt 预览

尚未选择版本
暂无 Prompt 版本。

04 / Failure Review

失败案例分析

0 个失败

当前没有失败案例。运行评测后会展示低分输出、失败原因和优化建议。

05 / Batch Evaluation

批量评测结果

0 条输出
测试用例 模型输出摘要 自动评分 状态 人工评分 复核备注 操作
还没有运行批量评测。

06 / Version Comparison

Prompt 版本对比

07 / Workflow

评测流程

  1. 选择 Prompt 版本和测试集,建立可复用的评测任务。
  2. 选择不同版本运行评测,观察平均分、失败率、成本和耗时变化。
  3. 打开失败案例,查看系统如何把低分输出转成优化建议。
  4. 补充人工评分,让人审与自动评分一起沉淀评估记录。