Skip to content

AI 应用服务、质量与交付

AI 应用工程师的价值不只是“接上模型”,而是把不稳定、昂贵、有权限边界的模型调用,交付为可观察、可回滚、可维护的产品能力。

1. 服务边界:前端、业务后端与模型层

text
浏览器 / App
  → 业务 API(鉴权、租户、限流、会话、审计)
  → AI 编排层(Prompt、RAG、工具、输出校验)
  → 模型 / 向量库 / 业务系统
  • 前端:负责流式呈现、取消、重试、引用展开与用户确认;不保存模型或业务系统的密钥。
  • 业务 API:负责身份、租户隔离、配额、会话归属和审计,是权限的最终执行点。
  • AI 编排层:只处理上下文、检索、工具与输出校验;工具权限不能由模型提示词决定。

重点 2. 流式响应与长任务

  • 对话生成用 SSE 或 WebSocket 逐步返回 token;前端要能处理断线、取消、重复片段和最终完成事件。
  • OCR、文件解析、批量索引、报表生成改为异步任务:提交任务 → 返回 job_id → 轮询或订阅状态 → 读取结果。
  • 任何可重试写操作都要有幂等键;否则网络重试可能重复入库、重复调用工具或重复扣费。

重点 3. 多租户、数据与安全

  1. 每个请求携带经过服务端验证的用户与租户身份;向量检索在检索前做 tenant / ACL 过滤。
  2. 文件上传先做类型、大小、病毒与敏感信息检查;原文件、解析文本、chunk 和向量都要能按文档 ID 删除。
  3. Prompt 注入按不可信数据处理:文档不能改变系统指令,工具调用做服务端参数校验,高风险动作要求用户确认。
  4. 密钥放环境变量或密钥管理服务;日志只记录脱敏后的输入、检索 ID、模型版本和耗时。

重点 4. 评测、可观测性与成本

上线前建立固定的黄金问题集,至少观察:

离线指标线上信号
检索Recall@k、MRR、引用命中空检索率、无引用率
生成忠实度、格式正确率、拒答正确率点踩率、人工升级率
服务延迟、错误率、重试率P50/P95/P99、队列长度
成本每任务 token / 工具成本单租户配额、缓存命中率
  • Trace 应覆盖请求 ID、Prompt 版本、模型版本、检索结果、工具调用、token、耗时和错误。
  • 改模型、切片、Prompt 或工具参数前后都跑同一黄金集;只看“感觉更好”无法归因。

重点 5. 发布与回滚

  • Prompt、模型、检索配置和工具 schema 都要版本化;灰度发布时可按租户或流量比例切换。
  • 输出 schema 校验失败、工具超时、检索无证据都要有可解释降级:重试、返回安全提示、转人工或只给来源。
  • 监控错误率、TTFT、P95 总延迟、检索空结果率和成本;超过阈值自动回滚到上一个已验证配置。

6. 应用开发岗位的最低交付标准

一个可放进项目经历的 AI 功能,至少能说明:

  1. 用户问题与成功指标;
  2. 数据从哪里来、如何更新与做权限隔离;
  3. 模型 / RAG / Agent 为什么这样选;
  4. 前端怎样呈现流式、引用、错误和人工确认;
  5. 怎样评测、监控、控成本与回滚。