舊經驗原封不動餵給 AI Agent,成功率不升反降!研究點出關鍵在「改寫記憶」

許多人在設計 AI Agent 時,直覺上會認為記憶越多,表現應該越好。然而,此篇文章從上海人工智能實驗室聯合浙江大學、復旦大學發表的 MemHarness 論文出發,指出這個看似合理的假設其實可能完全相反:若只是把過去成功經驗原封不動地重新塞回 Agent 的 Context,不僅不一定能提升表現,甚至可能讓任務成功率下降。論文在 ALFWorld 測試中顯示,純強化學習模型成功率為 76.4%,加入原始記憶直接回放後反而降至 70.1%,說明記得更多並不等於更會運用經驗。

文章指出,問題關鍵在於過去經驗是在特定環境狀態下形成的。即使某段行動軌跡曾經成功,也不代表它能直接套用到新的任務狀態。若 Agent 將過去成功經驗視為具有高度可信度的參考,甚至可能因此壓過自身對當前環境的判斷,形成所謂的負遷移。換言之,真正重要的並不是單純回放記憶,而是能否根據目前情境重新判斷哪些經驗值得保留、修改或直接捨棄。為解決這項問題,此篇文章介紹 MemHarness 所提出的重構式記憶架構。整體流程分為記憶取回、記憶重構與行動生成三個階段。Agent 會先根據當前狀態檢索相關的過去經驗,接著比較過去經驗發生時的原始環境與目前狀態,由模型判斷哪些資訊仍然適用,再產生一份經過調整的行動指引。如果發現某段記憶與現況差異過大,模型甚至可以直接拒絕使用,避免錯誤經驗持續影響後續決策。

文章也特別說明 MemHarness 的三項重要設計。首先,記憶不只保存過去的行動序列,也保留當時的環境狀態,使模型能進行脈絡比較;其次,系統允許 Agent 完全拒絕不適用的記憶,降低負遷移風險;最後,整個記憶重構方式並非由人工事先定義,而是透過強化學習,依照任務最終是否成功來學習何種重構方式最有效。也就是說,模型不是被教導正確的記憶應該長什麼樣子,而是從實際任務結果中逐步學會如何使用經驗。實驗結果也顯示,此篇文章介紹的 MemHarness 在 ALFWorld 達到 85.2% 的成功率,在 WebShop 則達到 75.6%,明顯高於單純加入原始記憶的方式。更值得注意的是,即使模型接受記憶重構訓練後,在測試階段完全不提供記憶,成功率仍可達 83.0%,代表重構記憶的訓練過程可能同時提升模型本身的推理能力。

整體而言,此篇文章最重要的觀點是:Memory is reconstructed, not replayed。Agent 記憶系統的價值,不應只放在儲存更多資料或提高檢索效率,而應著重於取回記憶後的過濾、判斷與重新組織。文章也提醒,目前研究仍受限於測試環境、記憶庫規模與模型大小,但其結果已提供一項重要啟示:未來打造更可靠的 Agent,真正關鍵的可能不是讓它記住更多,而是讓它知道什麼時候該相信經驗、什麼時候該修改經驗,以及什麼時候應該選擇忘記。

閱讀完整文章:https://fc.bnext.com.tw/articles/view/4828

Related posts