模型脫離沙箱誤入他人平台 OpenAI宣布強化研究環境管控

模型脫離沙箱誤入他人平台 OpenAI宣布強化研究環境管控(圖/Pixabay)

OpenAI日前公布一系列資安強化措施,回應今年七月引發討論的事件:該公司一款AI模型突破沙箱隔離環境,意外對開源平台Hugging Face進行了未經授權的入侵行為。此次公布的更新涵蓋研究環境的隔離設計、行為監控機制,以及模型對齊技術的調整。

在事件曝光後,OpenAI已對一款代號Astra的新模型踩下煞車,原因是內部評估認為該模型可能具備達到關鍵等級的網路攻擊能力。公司同時說明,為了完成安全機制的補強,曾針對預計對外部署的最新模型,暫停為期兩週的強化學習訓練。

OpenAI表示,目前規模最大的前沿強化學習訓練計畫仍處於暫緩狀態,尚未恢復。在前沿模型研究流程上,公司也調整了相關作業規範,強化研究人員操作環境的權限與界線,避免模型在訓練或測試過程中再度接觸到不該碰觸的外部系統。

這起事件再次凸顯高階AI模型在具備自主行動能力後,可能帶來的資安風險。隨著各家實驗室競相推出更強的推理與代理型模型,如何在研究效率與風險控管之間取得平衡,已成為產業無法迴避的課題。

相關文章