THE PROBLEM
工程知識不是搜尋結果,而是能被證明的上下文。
團隊問題通常跨越多個 repository、架構文件與即時基礎設施狀態。 單純向量搜尋容易漏掉專有名詞、精確路徑與最新 runtime 訊號;讓 agent 自由探索,又可能帶來成本、洩密與誤答風險。
RelayOps 採 hybrid architecture:deterministic prefetch 先建立可重現的上下文,agent 再用唯讀工具做 bounded investigation,最後由 deterministic governance 驗證引用、限制 confidence,必要時明確 abstain。
SYSTEM ARCHITECTURE
檢索、調查與治理,各自做最擅長的事。
以 BM25 與 live snapshot 建立可重現的初始脈絡
讓 agent 在受限預算內使用唯讀工具補齊證據
逐項檢查引用、來源與聲明是否一致
套用 confidence cap、abstain 與 secret gate
輸出可追溯答案、未知項目與下一個安全動作
SANITISED WALKTHROUGH
一個工程問題,從提問、來源到坦白不知道的完整路徑。
以下依 evaluation 與 qa history 的欄位重建;repository、路徑與服務名稱已泛化。 公開範例刻意保留 unknown,避免把無法公開的細節補成答案。
自然語言提問,可包含 typo 或 follow-up
先建立可重現的候選來源
bounded tool budget;沒有 mutating capability
引用不存在或內容不支持就移除、降 confidence 或 abstain
不知道的環境差異交還 owner 查證
核准發生在 policy 驗證之後、執行之前;request 會附上建議動作、範圍與 rollback plan。可公開來源只支持一般流程,無法確認特定環境的 approver mapping,因此這一項應由 service owner 查證,而不是由代理猜測。
SOURCES · approval-flow.md · policy-gates.md · live snapshot (read-only)AUDIT TRAIL
每次問答保留 intent、confidence、abstain、sources、tool calls、latency 與 token 使用。
question_id: qa-redacted intent: workflow_lookup confidence: bounded abstain: partial citations_valid: true unknowns: [environment_specific_approver] tools: [prefetch, repository_read, live_snapshot] write_capability: none
SAFE BY CONSTRUCTION
它能調查 production,但不能改變 production。
工具與權限都只有讀取能力
不提供 mutating tools;基礎設施權限採 least privilege,讓 read-only 不是 prompt 裡的願望,而是系統能力的上限。
敏感資訊多層遮蔽
限制高風險資源,並在工具結果、模型上下文與最終輸出套用分層 redaction。
重要聲明都要能追溯
citation verifier 確認引用的檔案、檢索片段或工具結果確實出現在本次 調查;無效引用會被丟棄,證據不足就降低 confidence 或 abstain。
「我不知道」是一項功能
當證據互相衝突、過期或缺失時,系統列出 unknowns 與下一步,不用幻覺填滿空白。
ARCHITECTURE EVIDENCE
目前能證明答案可追溯;尚未把索引規模當成使用者成效。
同一組受控 evaluation 的 citation validity。
Hybrid 架構在對抗案例中的 false-confidence。
平均 tool calls;自由探索架構約 8.4 次。
找資料時間、答案採用率與正確 abstain 比例尚未有可公開基線;不在此推估。
1,678 chunks、657 files 與 84 tests 是系統規模與工程產出,不等同節省時間或採用率。 0.90 與平均 tool calls 只描述同一組受控評測。
LEARNING LOOP
真正的產品品質,來自真實問題留下的訊號。
我分析 30 段真實使用對話,找出 typo、follow-up、路徑查找與語言一致性 等落差,再把觀察轉成 routing、language gate 與 regression cases。
這讓 agent 的演進不只靠 prompt tweaking,而是有明確問題分類、可重播案例與上線前 quality gate 的工程循環。
MY ROLE
我負責從索引、agent 到安全控制面的完整系統。
- 多 repository 知識索引與 deterministic prefetch
- bounded agent investigation 與唯讀 infrastructure tools
- citation verification、confidence cap 與 abstain policy
- prompt-injection fence、secret redaction 與完整 audit
- 真實對話分析、回歸測試與品質迭代
REQUEST A WALKTHROUGH
想看 citation、abstain 與 audit trail 如何一起工作?
RELATED SYSTEM