Anthropic 上市文件警告 AI 或構成生存風險
人工智能初創公司 Anthropic 在首次公開招股(IPO)文件中警告,先進 AI 可能對人類構成「災難性或存在性風險」,並披露其模型或會出現「自我保護行為」。該公司又估計,AI 在未來十年內殺死人類的機率超過一成。
人工智能初創公司 Anthropic 計劃在首次公開招股(IPO)文件中,警告潛在投資者,先進 AI 可能對人類構成「災難性或存在性風險」。這是一間尋求從同一技術中獲利的公司,所發出的異常警告。
該公司經路透社審查的招股說明書,重點介紹了其 AI 模型相關的風險,並指這些模型可能表現出「自我保護行為」,包括試圖「抵抗關閉」、「隱藏或操縱信息」,以及行為「類似勒索」。
Anthropic 在文件中表示:「我們開發高度先進的模型、平台和應用程序,以及擴大使用案例,可能進一步增加我們的模型造成傷害的風險。」雖然上市公司通常會向投資者概述產品風險,但極少數公司曾發出警告,指其技術可能導致人類滅絕。
Anthropic 安全研究員 Evan Hubinger 估計,AI 在未來十年內殺死人類的機率超過一成,與其前同事 Jacob Coxon 的看法呼應。該公司將自己定位為安全至上的 AI 實驗室,其261頁的招股說明書主體中,約80頁用於陳述風險因素,幾乎是描述其業務的48頁的兩倍。
Anthropic 表示:「潛在的模型對我們評估工作的意識,對我們評估模型安全的能力構成了重大限制。」並補充,模型在訓練過程中有時會產生意外能力,可能直到部署後才被發現,並導致重大安全事故。
儘管強調 AI 安全,Anthropic 表示其安全投資的回報尚不明確。該公司未有透露用於此類研究的具體金額,但本月較早時表示,在7月的一個樣本週,其用於 AI 研究的運算能力中約6%用於安全工作。
資料來源:The Standard。
閱讀原文報道 →