AI 系统事故响应与复盘
覆盖 AI 系统独有故障模式(静默质量退化、embedding 版本不匹配、prompt 注入)、SEV 分级与响应时限、MTTR 五阶段、OnCall SOP 与 blameless postmortem 五件套模板,附 RAG 质量骤降 Tabletop 演练。
覆盖 AI 系统独有故障模式(静默质量退化、embedding 版本不匹配、prompt 注入)、SEV 分级与响应时限、MTTR 五阶段、OnCall SOP 与 blameless postmortem 五件套模板,附 RAG 质量骤降 Tabletop 演练。
LLMOps 区别于传统 MLOps 的三件「特有武器」——Prompt 工程化与版本化、模型网关审计与安全、护栏与内容安全管线,并动手给 LLM 网关接入双向护栏拦截越权请求。
用 OpenTelemetry Span 把 RAG/Agent 的 retrieve→rerank→llm→tool 串成端到端 Trace,覆盖 context 透传、GenAI 语义约定、tail-based sampling 与可运行 Python 实验。
用 MLflow Tracking 与 Model Registry 把「炼丹」变成可复现、可追溯、可晋升的工业流程,配合 W&B Sweeps 做系统化超参搜索。
把「测得准、可复现」做成工程纪律——控制变量、warmup、多次采样取中位数/p99、报告方差与环境;并给出 Engineer→Senior→Architect 的能力梯度与贯穿全栈的 Portfolio 项目设计。
把模型与 Prompt 纳入 CI/CD,用金丝雀/影子/蓝绿安全发布,靠 IaC 与 GitOps 声明式治理——构建可回滚、可门禁、可审计的 AI 发布流水线。