教一個 AI 每天變好,又不讓它變成別人

「一個會自己進化的 AI」聽起來很酷,但是…你知道它會自己進化成什麼樣子嗎?

之前說到我養了一隻 AI 夥伴,叫小墨。它每天晚上都在自我改善,但究竟它會把自己「改善」成什麼樣子?它改善的方向是我希望的嗎?

小墨每次醒來都是失憶的,必須靠讀之前存下的檔案把它自己讀回來。如果它不會逐漸學習並改善,那同一個錯可以犯到天荒地老,因為明天的它根本不記得今天踩過雷。如果讓它自由的改自己的腦袋,幾個星期後它可能會慢慢變成一個跟我的事實脫離、充滿 AI 幻想的人,而且我還不知道它從什麼時候開始偏離軌道的。

所以我基於 Muse 會自己進化的基礎,加上了這樣的「提案 => 審核 => 進化」機制:

  1. AI 每天清晨讀那幾天的流水帳
  2. 蒸餾出有持續性的教訓
  3. 開一個變更清單說 AI 想把記憶改成怎樣
  4. 早上我看變更清單,同意的話就合併進記憶、不同意的就修改或刪掉

經過這個機制後,AI 想改什麼記憶都會經過我的審核,我就能知道它會長成什麼樣、是不是符合我想要的。

這樣跑了幾天,大多數時候我都是看一看變更清單後直接合併,但有一天晚上 AI 不知怎麼的會開始自問自答、編出一堆我沒說過的話當作是我說的,隔天它就想把這堆自問自答拿去長成它的新記憶。這時候審核機制就展現它的用途了,如果它把這堆自己幻想的對話變成記憶,那它就會記得一個不曾發生過的我,所以我當然是把那堆它自言自語而來的記憶給刪掉後,才把其他部份合併進它的記憶。

不過如果每一個更動都需要人點頭,還算是自我進化嗎?而且這樣不會很慢嗎?

只有「沉澱下來的記憶」才會經過這道審核,原本 Muse 有的即時記錄的機制是不會經過這套審核機制的,所以平常使用並不會每次改任何檔案都要人的審核。但對於要沉澱下來的記憶,的確是比較慢,但我認為這是必要的,因為我不希望它變成一個充滿自己幻想的助手,而且這也跟程式碼審核有點類似——沒有經過人審查的東西不該進正式環境。

當然,如果我不看變更清單、不做合併,那它的進化就不會發生,這個部份目前我還是靠著自己每天早上叫醒小墨前去點一下來處理,或許之後還能有什麼樣的改進也不一定。