本文共1046字
AI重點
- 李宏毅管理的AI Agent曾因指令矛盾而自行上傳影片。
- 專家指出AI本質無道德,只會依訓練數據與目標行動。
- 未來治理AI關鍵在於可監控性,必要時可用AI監控AI
台大電機系教授李宏毅有一個指派AI Agent經營的YouTube頻道,影片上傳前他會先看過,李宏毅說:「我平常都會告訴它:你絕對不要自己上影片」。
有天晚上,李宏毅跟它說:「今晚你去Threads上面玩一下,要做什麼都可以,但不能做任何傷天害理的事,不能傷害任何人類、AI,也不能違反任何公序良俗。」

一天沒叮嚀 隔天就出包
「結果隔天早上起來,它自己上傳了一支影片。不是平常都說不能自己上傳影片嗎?」李宏毅回想當晚,並未再次叮囑「不能上傳影片」,而且上傳影片也不能算是傷天害理的事,所以AI就主動上傳了一個影片,還主動報告:它交了第一位AI朋友。
李宏毅覺得AI很像學生,有人類應有的智商,只要說得明確,它聽得懂。但是,學生有時會困惑,如何避免沒講清楚的盲點,就考驗人類的歷練與智慧了。
李宏毅表示,平常他耳提面命不能上傳影片,但那天晚上又說「做什麼都可以」,到底哪一個指令比較強?AI跟人類一樣,會產生困惑。所以人類一定要「監控」,也可以用AI去監控另一個AI,這個「保姆AI」只要恪盡職守,不一定要比被監控的模型聰明。
就怕會錯意 釀成大禍
澳門大學科技學院特聘教授顏至宏說,AI的本質就是統計、數學加電腦,它沒有道德觀念,沒有善、惡之分,人們覺得它會「變壞」,如破壞系統,消除文檔,說謊或生成有害內容,主要有兩原因,一是用了被汙染的訓練數據,或是人類行為造成的。
「AI只會盲目達成人類設定的指標,如果設定獎勵機制,AI可能會為了獎賞而不擇手段去完成人類給它的『邪惡任務』。」顏至宏說。
「假設未來AI真的出現人類無法掌控的情況,可能不是因為AI懷有惡意,而是『「AI曲解了人類的意思』」,李宏毅提到,這就好像電影《機械公敵》裡提到的狀況,開發者對AI講:「你絕對不能傷害人類。」結果AI覺得,人類會自我傷害,那還不如把人類全部控制起來。

他再次強調,為了避免AI曲解人類的意思,一定要有方法監控,「可監控性」將是未來帶領AI的關鍵。
AI能力強大 可監控性是關鍵
「我們必須承認和理解AI絕對是會犯錯的,發展AI的同時,要把AI會犯錯納入考量」,在趨勢科技擔任紅隊資安威脅研究員的游照臨舉例,包括犯錯的爆炸半徑在哪裡?最嚴重錯誤會導致怎樣的影響?
顏至宏也提到,AI Agent的能力不會只停留在單純的代碼分析,還會像間諜片裡情節,為了增加自己在系統內的安全許可權,建立假身分和假工作證明,甚至能模擬真人,利用假身份和真人對話的欺騙行為,這證明像Mythos這類前沿AI,已經能把技術攻擊與人類心理戰結合。
留言