Agent 的目標設定與監控:從自我審查到多代理協作

AI 代理要從被動工具進化為主動系統,核心在於目標設定與監控

傳統 AI vs 有目標的 AI

傳統 AI 像是手機裡的電子地圖:問去火車站怎麼走,它就畫一條線,然後停在那裡,一個口令一個動作。

有目標的 AI 代理則像自動導航系統:規劃路線後持續監控路況,遇到塞車自動重算,不需要等人下指令。

我們可以用「計劃一趟旅行」來比喻這個過程:

AI 必須考量現實條件(交通工具、預算限制),將高階目標自主分解為一系列有依賴關係的子目標,並透過內建的搜尋演算法與 LLM 的語義理解來生成與執行計畫。

六個場景:依風險層級分類

低風險:數位工作流程

客服支援自動化。傳統客服機器人只會重複罐頭回覆;有目標的 AI 代理則以實際解決帳單爭議為目標,主動調閱資料庫,在後台模擬計費調整。監控機制會看客戶語氣是否緩和、帳單數字是否修正,沒解決才升級交給人類。

中風險:個人化學習

個人化學習系統以提升學生的代數理解為目標,動態監控作答時間與準確率。發現學生在某個概念卡了三分鐘,就立刻換一種比喻重新解釋,而不是繼續丟題目。

專案管理助理以在期限前完成里程碑為目標,隨時監控任務狀態。偵測到延遲風險就主動標記警告團隊。

高風險:即時動態環境

自動交易機器人的目標是在特定風險容忍度內最大化收益。代理持續運算投資組合價值與目標狀態的差距,在毫秒級別內模擬預測。一旦市場波動可能擊穿風險區值,立即觸發重規劃,果斷平倉或改變投資標的。

自動駕駛汽車同時監控行人軌跡、交通號誌、自身油量與速度,關乎人身安全。

主觀判斷:內容稽核

社群媒體的 AI 目標是刪除有害內容,監控指標不只是關鍵字,還包括誤報率與漏報率。如果發現把正常的諷刺迷因誤刪太多,監控回饋會強迫代理調整過濾權重,持續自我校正。

自我審查機制:輸送帶模式

用 LangChain 和 OpenAI 打造的自我審查 AI 程式設計師。

流程:

  1. 給予 AI 兩個輸入:詳細的專案簡介 + 極度嚴格的品質檢查表
  2. AI 寫出第一版初稿後,系統強迫暫停
  3. AI 轉換身份為自己的 QA 品管員,用檢查表逐項核對
  4. 任一項不合格 → 踢回重做(純粹的 boolean 判斷)

這就像工廠輸送帶上的自動光學檢測儀:程式碼是剛做好的零件,QA 身份的 AI 用檢查表當掃描標準,不合格就送回產線。

起草 → 審查 → 修正 → 再審查 → 通過

如果比對結果為 false,AI 不會直接放棄。它會擷取失敗原因,將這些自我批評的見解作為新的提示詞,針對弱點重修修改,直到所有檢查項目都回報通過,或達到預設的嘗試次數上限。

需要注意,這是用來說明概念的範例,並非可上生產的程式碼。LLM 可能無法完全掌握目標的預期含義,誤判自己的成效;同一個 LLM 同時負責寫程式和判斷品質時,更難發現程式碼走錯了方向。最終仍需要開發者手動執行與測試產出的程式碼。

球員兼裁判的問題

讓 AI 自己改自己的考卷,本質上有巨大的利益衝突。LLM 最為人詬病的就是幻覺。如果 AI 從一開始就誤解了目標,幾十次自我審查只會用錯誤的邏輯不斷肯定自己,最後自信滿滿交出完全錯誤的結果。就像一個有極度完美主義的作家同時兼任自己最嚴格的編輯,把稿子退回給自己重寫幾次,改了三天三夜出來的東西根本文不對題。此外,如果自我檢測迴圈沒寫好,極有可能陷入無限迴圈,不斷消耗龐大的運算資源卻毫無進展。

多代理協作:五人 AI 團隊

解法是多代理協作,借鑑軟體工程中的關注點分離原則。與其聘請一個無所不能但可能陷入幻覺的全能員工,不如組一個各司其職的團隊。

舉例來說,用 Gemini 模型建立了一個五人 AI 團隊:

角色 職責
程式設計師 專職寫程式與激盪想法
程式碼審查者 完全獨立,用放大鏡檢視程式碼,沒有思維包袱
文件產生器 將程式碼轉換為人類工程師能讀懂的清晰文件
測試編寫者 寫出各種刁鑽的單元測試,用極端資料攻擊成果
提示優化者 團隊與人類之間的溝通橋樑,優化提示詞減少溝通誤差

寫碼與審查的職責徹底剝離後,系統整體的客觀性得到指數級提升。這就是人類社會經過千百年驗證的分工智慧,直接應用在 AI 系統設計中。

何時使用這個模式

目標設定與監控不是每個 AI 系統都需要。適合使用的情境:

不適合的情境:單一步驟的問答、不需要長期追蹤進度的任務。

目標設定的基石:SMART 原則

無論是給單一代理還是整個團隊設定目標,都必須嚴格遵循 SMART 原則

在實作上,Google 的 ADK(Agent Development Kit)框架將高階目標轉化為精確的代理指令傳達給整個系統,透過全域的狀態管理與工具互動來監控,確保每個 AI 成員的內部狀態更新都朝著同一個可被驗證的指標前進。

未解的懸念:主觀目標的護欄

本文談到的目標都非常具體且客觀——寫出沒有 bug 的程式碼、把車安全開到 B 點、確保專案不延遲。成功與否容易用資料衡量,非黑即白。但當未來 AI 代理擁有極度強大的自我規劃與監控能力,而人類給予的高階目標變得主觀時呢?

當導航系統的目的地不再是一個具體地址,而是一個名為「幸福」或「利潤」的抽象概念,AI 會如何為自己設定子目標?如何確保這個極度聰明的系統在追求目標的過程中,不會為了達到目的而抄一條讓人類意想不到、甚至極度危險的捷徑?這個問題目前沒有標準答案。如何為 AI 的主觀目標設定護欄,留給開發者繼續探索。

參考資料


Agentic Design Pattern Agentic AI Multi-Agent AI AI Engineering Architecture Design Pattern