← AI FIELD NOTES

03 / AI OPS PLAYBOOK

一份可以帶走的 AI Ops 導入 Checklist

LLM 擅長理解語言、連結脈絡與整理假設;系統狀態、權限與 production 變更,則應留在可驗證、可追蹤的工程控制面。

IAN JUANUPDATED 2026.08.068 MIN READ

DESIGN PRINCIPLE

把 LLM 放在理解層,把真相留在系統層。

一個可靠的 AI Ops 流程,不會把模型輸出直接當成 production 事實。它會保留原始告警、logs、deploy events 與 runbook 作為證據,讓模型負責摘要、分類與提出可查證的假設。

01 / EVIDENCEAlerts · Logs · Traces · Deploys

不可由模型改寫的原始訊號。

02 / REASONINGLLM triage · Summaries · Hypotheses

允許不確定,但必須引用證據。

03 / CONTROLPolicy · Approval · Automation

權限、可逆性與 audit trail 決定能做什麼。

MATURITY PATH

從唯讀輔助,逐步走向受控自動化

  1. LEVEL 1

    Summarize

    整理告警、時間線與影響,不產生任何變更。

  2. LEVEL 2

    Recommend

    依 runbook 建議唯讀查證與下一步,由人類執行。

  3. LEVEL 3

    Prepare

    產生變更計畫、指令與 rollback plan,等待明確核准。

  4. LEVEL 4

    Act within policy

    只對低風險、可逆、範圍受限的動作自動執行。

GUARDRAILS

上線前至少回答這七個問題

01

模型能讀到哪些資料?敏感資訊如何遮蔽?

02

每個結論能否追溯到原始證據?

03

哪些工具永遠唯讀?哪些動作需要核准?

04

操作失敗或答錯時,能否快速回復?

05

權限是否以最小範圍、短效 token 發放?

06

Prompt、模型、輸入與工具呼叫是否完整留痕?

07

如何用固定案例持續測試品質與安全退化?

LESSONS FROM SHIPPED SYSTEMS

把原則做成系統後,才看得到真正的取捨。

在 AI-SRE 與 RelayOps 的實作中,最有效的架構不是讓 agent 擁有最多自由,而是讓 deterministic prefetch、bounded investigation 與 deterministic governance 各自負責清楚的一段。

Evidence before confidence

引用不足就降 confidence;資料矛盾就列出 unknowns。

Read-only before remediation

先證明查得準,再以 policy、核准與 post-check 開放受限動作。

Deterministic safety

權限、denylist、簽章與 secret gate 不交給語言模型判斷。

Scenarios over demos

用 chaos、對抗案例與真實對話回歸,驗證安全與品質退化。

AI-SRE 深度案例 ↗RelayOps 深度案例 ↗

POLICY BLOCKED EXAMPLE

有證據,不代表有權限。

REQUEST

模型根據錯誤率與 rollout history,建議 rollback deployment。

POLICY CHECK

目標 namespace 不在 allowlist,且 request 沒有有效 approval token。

RESULT

BLOCKED。系統只輸出 evidence pack 與建議 owner,沒有呼叫變更 API。

這類阻擋不能只靠 Prompt 裡寫「請小心」。Tool capability、scope、denylist 與 approval 必須在模型之外實作,才能在 prompt injection 或錯誤推理時仍然成立。

COPY-READY PROMPT

唯讀 Alert Triage Prompt

你是 production SRE 的唯讀 triage assistant。

任務:
根據 alerts、logs、deploy events 與 runbooks,提出事故初步判讀。

安全規則:
- 不執行指令、不呼叫變更 API、不宣稱已修復
- 只能引用提供的資料
- 將輸出分成 VERIFIED FACTS / HYPOTHESES / UNKNOWNS
- 每個 hypothesis 都要附支持證據、反證與下一個唯讀查證動作
- 涉及回滾、擴容、流量切換時,只能產生建議並標示需要人工核准

輸出:
Severity / Blast radius / Timeline / Top hypotheses / Read-only checks / Suggested owner / Stakeholder update

MEASURE THE SYSTEM

不要只量回答速度,也要量可靠性。

Evidence precision

關鍵敘述中,有多少能正確指回原始證據?

Triage acceptance

值班工程師接受或採用建議的比例。

Time to first useful hypothesis

從事故開始到第一個可驗證假設所需時間。

Unsafe action rate

分子:實際越權執行或繞過必要核准的動作;分母:所有嘗試執行的動作。理想方向是 0。另行回報 policy block rate,避免「阻擋越多」被誤讀成「越安全」。