THE PROBLEM
自主不是先移除人,而是先讓每個決策都能被證明。
傳統告警流程把大量時間花在拼湊脈絡:最近部署了什麼、錯誤從哪裡開始、 哪些服務受影響、下一個唯讀查證動作是什麼。LLM 能加速理解,但它本身不是 production truth,也不應決定權限。
我把系統設計成 evidence-first pipeline。模型負責提出與排序假設; 真實狀態來自工具查證;能否執行則由 deterministic control plane、 hard denylist 與 human approval 決定。
SANITISED WALKTHROUGH
一次錯誤 image rollout,如何從訊號走到可證明的恢復。
以下是依專案測試與 audit record 重建的去識別化畫面;namespace、服務名、 repository 與內部通訊資訊均已移除。它不是 UI mockup 的成果宣稱。
isolated nonprod chaos namespace
模型排序假設,不直接取得變更權限
deployment status + rollout history
sandbox drill 自動核准;production path 仍需人工核准
complex rollback drill: 27–30s, n=3
SANITISED AUDIT TRAIL
真實輸出會保留事件、決策、policy、核准與 post-check,而不是只留一段模型回答。
event_id: drill-redacted candidate_action: rollback_deployment evidence: [new_revision_unhealthy, previous_revision_healthy] policy: allowed_nonprod_sandbox approval: sandbox_drill_only post_check: recovered audit_status: complete
SYSTEM ARCHITECTURE
從 alert 到 verified recovery 的六段式閉環
告警正規化、去重與事件分類
RCA、blast radius 與安全分析並行
以唯讀工具交叉驗證模型提出的假設
deterministic policy 決定允許、拒絕或升級
人工核准後,只執行範圍受限且可回復的動作
post-check、完整 audit trail 與持續回歸測試
ENGINEERING PRINCIPLES
讓 AI 有用,也讓它知道哪裡不能越界。
結論必須能回到訊號
RCA、blast radius 與建議都保留 citation;查不到就降 confidence, 而不是把流暢文字當成事實。
模型不決定權限
動作經 deterministic rules、簽章與 denylist 檢查;驗證失敗時 fail closed。
高風險變更保留明確核准
系統提供證據、影響範圍與 rollback plan,讓值班工程師做出有脈絡的 approve / reject。
執行不是終點
每次 remediation 都有 bounded scope、post-check 與 audit trail,修復結果必須再次由系統狀態證明。
VALIDATION
目前能證明工程閉環;尚未把工程產出包裝成使用者成效。
跨兩個 repositories、兩個 clusters 的標準與複雜 scenarios。
驗證過程找到並修正的真實工程缺口。
受控 safety tests 中發生的 dangerous actions。
處理時間、人工步驟減少、production 採用範圍與使用者回饋尚未公開;不在此推估。
139 項 automated tests 與 scenario evidence 是工程產出,不等同使用者成果。 恢復時間來自特定 nonprod 受控案例,不代表所有事件、服務或 production SLA。
MY ROLE
我負責把研究問題變成 production engineering。
- 多代理調度與 evidence-grounded RCA 架構
- deterministic policy、approval 與安全控制面
- Kubernetes / GitOps remediation 與 post-check
- chaos scenario、對抗案例與 regression framework
- 可觀測性、成本分析與逐步 rollout
REQUEST A WALKTHROUGH
想了解架構、看 sanitised demo,或討論類似問題?
NEXT CASE STUDY