THE PROBLEM
工程知識不是搜尋結果,而是能被證明的上下文。
團隊問題通常跨越多個 repository、架構文件與即時基礎設施狀態。 單純向量搜尋容易漏掉專有名詞、精確路徑與最新 runtime 訊號;讓 agent 自由探索,又可能帶來成本、洩密與誤答風險。
RelayOps 採 hybrid architecture:deterministic prefetch 先建立可重現的上下文,agent 再用唯讀工具做 bounded investigation,最後由 deterministic governance 驗證引用、限制 confidence,必要時明確 abstain。
SYSTEM ARCHITECTURE
檢索、調查與治理,各自做最擅長的事。
以 BM25 與 live snapshot 建立可重現的初始脈絡
讓 agent 在受限預算內使用唯讀工具補齊證據
逐項檢查引用、來源與聲明是否一致
套用 confidence cap、abstain 與 secret gate
輸出可追溯答案、未知項目與下一個安全動作
SAFE BY CONSTRUCTION
它能調查 production,但不能改變 production。
工具與權限都只有讀取能力
不提供 mutating tools;基礎設施權限採 least privilege,讓 read-only 不是 prompt 裡的願望,而是系統能力的上限。
敏感資訊多層遮蔽
限制高風險資源,並在工具結果、模型上下文與最終輸出套用分層 redaction。
重要聲明都要能追溯
citation verifier 確認引用的檔案、檢索片段或工具結果確實出現在本次 調查;無效引用會被丟棄,證據不足就降低 confidence 或 abstain。
「我不知道」是一項功能
當證據互相衝突、過期或缺失時,系統列出 unknowns 與下一步,不用幻覺填滿空白。
ARCHITECTURE EVIDENCE
不是憑感覺選 agent 架構,而是用比較實驗選擇。
離線核心、對抗與 live scenarios 橫跨三種架構。
Hybrid 架構在對抗案例中的 false-confidence。
整體 citation validity,兼顧回答能力與可追溯性。
平均 tool calls,低於自由探索架構的約 8.4 次。
28 個情境用於比較三種架構,不是泛化到所有問題的準確率保證; 0.90 與平均 tool calls 只描述同一組受控評測。公開內容已移除內部資料集、 服務與環境細節。
LEARNING LOOP
真正的產品品質,來自真實問題留下的訊號。
我分析 30 段真實使用對話,找出 typo、follow-up、路徑查找與語言一致性 等落差,再把觀察轉成 routing、language gate 與 regression cases。
這讓 agent 的演進不只靠 prompt tweaking,而是有明確問題分類、可重播案例與上線前 quality gate 的工程循環。
MY ROLE
我負責從索引、agent 到安全控制面的完整系統。
- 多 repository 知識索引與 deterministic prefetch
- bounded agent investigation 與唯讀 infrastructure tools
- citation verification、confidence cap 與 abstain policy
- prompt-injection fence、secret redaction 與完整 audit
- 真實對話分析、回歸測試與品質迭代
RELATED SYSTEM