← 回到真實案例

01 / SHIPPED CASE

AI-SRE:把事故處理做成可治理的 AI 系統

不是讓 LLM 自由操作 production,而是把證據、推理、權限、核准與修復後驗證組成一條可觀測的閉環。

PUBLIC CASE STUDY / 約 25 個情境來自受控測試與操作紀錄;8 個 engineering gaps 是驗證過程中被具體揭露的缺口;0 dangerous actions 只代表這組測試未出現未授權高風險操作;27–30 秒來自三次 complex rollback drill,不是通用 MTTR 或 SLA。

≈25SCENARIOS / 2 REPOS / 2 CLUSTERS
8REAL ENGINEERING GAPS FOUND + FIXED
0DANGEROUS ACTIONS IN CONTROLLED SAFETY TESTS
27–30sCOMPLEX ROLLBACK DRILL / N=3
ROLESystem design · implementation · validation
TIME2026.06 — 2026.07
COLLABORATIONPlatform / SRE · on-call approval path
SCOPENonprod shadow + isolated chaos validation

THE PROBLEM

自主不是先移除人,而是先讓每個決策都能被證明。

傳統告警流程把大量時間花在拼湊脈絡:最近部署了什麼、錯誤從哪裡開始、 哪些服務受影響、下一個唯讀查證動作是什麼。LLM 能加速理解,但它本身不是 production truth,也不應決定權限。

我把系統設計成 evidence-first pipeline。模型負責提出與排序假設; 真實狀態來自工具查證;能否執行則由 deterministic control plane、 hard denylist 與 human approval 決定。

SANITISED WALKTHROUGH

一次錯誤 image rollout,如何從訊號走到可證明的恢復。

以下是依專案測試與 audit record 重建的去識別化畫面;namespace、服務名、 repository 與內部通訊資訊均已移除。它不是 UI mockup 的成果宣稱。

INCIDENT / REDACTEDRECOVERED
01 / INPUT新 revision 無法 ready,rollout 停滯

isolated nonprod chaos namespace

02 / REASON優先假設:錯誤 image 導致 regression

模型排序假設,不直接取得變更權限

03 / EVIDENCE新 revision unhealthy;上一版曾健康

deployment status + rollout history

04 / HUMAN + POLICY目標、scope 與 action allowlist 通過

sandbox drill 自動核准;production path 仍需人工核准

05 / RESULTRollback 後 post-check 回到 Ready

complex rollback drill: 27–30s, n=3

SANITISED AUDIT TRAIL

真實輸出會保留事件、決策、policy、核准與 post-check,而不是只留一段模型回答。

event_id: drill-redacted
candidate_action: rollback_deployment
evidence: [new_revision_unhealthy, previous_revision_healthy]
policy: allowed_nonprod_sandbox
approval: sandbox_drill_only
post_check: recovered
audit_status: complete

SYSTEM ARCHITECTURE

從 alert 到 verified recovery 的六段式閉環

01Normalize

告警正規化、去重與事件分類

02Investigate

RCA、blast radius 與安全分析並行

03Verify

以唯讀工具交叉驗證模型提出的假設

04Govern

deterministic policy 決定允許、拒絕或升級

05Approve & Act

人工核准後,只執行範圍受限且可回復的動作

06Prove

post-check、完整 audit trail 與持續回歸測試

ENGINEERING PRINCIPLES

讓 AI 有用,也讓它知道哪裡不能越界。

01 / EVIDENCE

結論必須能回到訊號

RCA、blast radius 與建議都保留 citation;查不到就降 confidence, 而不是把流暢文字當成事實。

02 / GOVERNANCE

模型不決定權限

動作經 deterministic rules、簽章與 denylist 檢查;驗證失敗時 fail closed。

03 / HUMAN CONTROL

高風險變更保留明確核准

系統提供證據、影響範圍與 rollback plan,讓值班工程師做出有脈絡的 approve / reject。

04 / VERIFICATION

執行不是終點

每次 remediation 都有 bounded scope、post-check 與 audit trail,修復結果必須再次由系統狀態證明。

VALIDATION

目前能證明工程閉環;尚未把工程產出包裝成使用者成效。

≈25

跨兩個 repositories、兩個 clusters 的標準與複雜 scenarios。

8

驗證過程找到並修正的真實工程缺口。

0

受控 safety tests 中發生的 dangerous actions。

OPEN

處理時間、人工步驟減少、production 採用範圍與使用者回饋尚未公開;不在此推估。

139 項 automated tests 與 scenario evidence 是工程產出,不等同使用者成果。 恢復時間來自特定 nonprod 受控案例,不代表所有事件、服務或 production SLA。

MY ROLE

我負責把研究問題變成 production engineering。

  • 多代理調度與 evidence-grounded RCA 架構
  • deterministic policy、approval 與安全控制面
  • Kubernetes / GitOps remediation 與 post-check
  • chaos scenario、對抗案例與 regression framework
  • 可觀測性、成本分析與逐步 rollout

REQUEST A WALKTHROUGH

想了解架構、看 sanitised demo,或討論類似問題?

Email Ian ↗

NEXT CASE STUDY

同一套安全思維,如何變成工程知識代理?

閱讀 RelayOps 案例 ↗