适用于评估知识或支持流程的 IT 负责人和服务商。从单一任务及明确的业务负责人开始。
准备输入
提供已授权的示例文档,以及文档负责人、版本和目标读者。说明语言、预计用户人数、部署要求与现有身份系统。在导入前识别过时文档与相互矛盾的版本。
调优前建立测试题集。例如可设计 100 个问题:50 个日常事实问题、20 个跨文档比较问题、15 个证据不足的问题,以及 15 个权限限制测试问题。这些数量是建议方法,不是测量结果。
定义验收
| 指标 | 方法 |
|---|---|
| 正确性 | 业务审核人员将答案与参考答案比较 |
| 引用支持 | 被引用的段落确实支持相关陈述 |
| 拒答 | 对没有依据的问题作适当拒答 |
| 权限 | 用户不能检索到权限范围外的文档 |
| 延迟 | 在约定的并发用量下记录分位数 |
| 成本 | 计入部署、推理、导入、支持及人工审核 |
将调优题与留出测试题分开。保留失败结果,不要在看到结果后替换难题。测试前与客户约定阈值。
规划运营方式
记录由谁更新内容、批准访问、审核错误答案以及处理模型变化。梳理每个外部模型或语音调用:应用自托管也可能向第三方服务发送数据。
Dify、RAGFlow、Qwen3 与 DeepSeek-R1 可作为研究起点。检查确切版本和许可。Dify 有附加条件;不同模型变体和托管服务可能采用不同条款。
若要按方法比较 FastGPT 形态的流程与 ChatGPT 公司知识(权限、引用与审核,而不是模型分数),请阅读英文页 FastGPT vs ChatGPT for permissioned enterprise knowledge。若要选择一套获准语料、一项可测量流程和一组难题作为阿联酋首次试点,请阅读英文页 Pick documents and one workflow for a UAE FastGPT first pilot。
向 CNPS 提供哪些信息
描述业务任务、文档类型、国家、语言、用户、数据限制和目标日期。从非敏感信息开始,实施能力与商业范围另行约定。