Apple 研究人員推出新型 AI 模型 SimpleDesign 用於蛋白質設計

蘋果研究人員在一項新研究中詳細介紹了 SimpleDesign,這是一種精簡的人工智能模型,能夠共同生成蛋白質序列和結構。這項研究的背景是,去年九月,蘋果研究人員發表了一項名為「SimpleFold:摺疊蛋白質比你想的更簡單」的研究,該研究詳細說明瞭一種從氨基酸序列預測蛋白質三維結構的精簡方法。簡而言之,SimpleFold 使用流匹配模型直接從氨基酸序列生成蛋白質的三維結構。

我們在這裡更詳細地解釋了流匹配,但簡單來說,這一技術從一個嘈雜的隨機基礎開始,並學習到達最終結果的相對直接路徑。這與擴散模型形成對比,後者通常通過反覆去除噪聲來達到最終輸出。這兩種技術最常見(或至少歷史上)與圖像生成相關,儘管研究人員(包括蘋果的研究人員)也探索了擴散模型在文本和代碼生成中的應用。

SimpleDesign 模型的創新設計提升蛋白質生成效率

回到 SimpleFold,蘋果基本上將流匹配與通用變壓器模塊(通常用於文本生成)相結合,使模型避免使用一些傳統蛋白質摺疊模型(如 DeepMind 的著名 AlphaFold)所需的計算成本較高的技術。現在,蘋果研究人員推出了 SimpleDesign,將在 SimpleFold 中探索的簡化通用架構的推進應用於更廣泛的蛋白質設計問題,而不僅僅是預測蛋白質的三維結構。

根據蘋果研究人員在新研究《SimpleDesign:一個蛋白質序列和結構共同設計的模型》中所述,現有模型通常依賴於多階段的訓練過程,其中自編碼器將數據標記化為潛在表示,並在第一階段進行訓練。其次,生成模型在自編碼器的潛在表示上進行訓練,即在潛在空間中進行生成建模。我們假設這種多階段訓練並不是獲得高性能共同設計模型所必需的,因此提出了 SimpleDesign,這是一個直接在數據空間中訓練的有效多模態蛋白質設計模型。

換句話說,雖然許多現有的蛋白質設計模型依賴於多階段過程,但 SimpleDesign 學會在單一的端到端訓練過程中生成氨基酸序列和連續的三維結構。

SimpleDesign 在蛋白質設計領域的潛力和挑戰

許多當前的蛋白質共同設計模型的運作方式如下:首先,它們訓練一個單獨的模型將蛋白質結構轉換為離散表示或「標記」。然後,它們訓練一個生成模型來處理這些表示,以生成新的蛋白質序列和結構。SimpleDesign 跳過了這一中間步驟,直接從配對的氨基酸序列和三維坐標中學習,而不是先將蛋白質結構壓縮為單獨的標記化表示。蘋果研究人員訓練 SimpleDesign 的方式相當有趣。

他們使用來自 AFESM 數據集的超過 200 萬個蛋白質序列和結構對進行訓練,該數據集結合了來自 AlphaFold 資料庫的預測結構和其他樣本。

在訓練期間,他們對每個配對的兩個部分進行了損壞:氨基酸序列中的氨基酸隨機被遮掩,而相應的三維結構也添加了噪聲。研究人員還會變更每一側的擾動程度。如果序列基本完整但結構嚴重受損,這項任務就類似於蛋白質摺疊,模型必須從已知序列中恢復結構。相反,如果結構基本完整但序列嚴重被遮掩,則與逆摺疊類似。模型則必須生成能夠產生給定結構的序列。而當兩者都部分被擾動時,模型學會同時解決這兩個問題,有效地訓練其進行蛋白質共同設計。

根據這項研究,儘管使用了更簡單的訓練流程,SimpleDesign 在蛋白質共同設計、結構生成和序列生成基準測試中提供了競爭力的結果。研究人員還發現,SimpleDesign 能夠生成合理的蛋白質結構,而其生成的氨基酸序列通常與大多數競爭性多模態模型生成的序列一樣好或更佳。最後,研究人員指出,SimpleDesign 的結果仍然僅限於基於計算的評估,因為生成的蛋白質未經實驗測試以確認其是否能夠在實際生物系統中摺疊、功能或安全行為。

儘管如此,這些結果相當令人鼓舞,整個研究(自然會更深入地探討 SimpleDesign 的架構、訓練過程、基準和結果)值得一讀。

Henderson
Henderson

Henderson 是 TechRitual Hong Kong 科技編輯,專注報導智能手機、消費電子產品、SIM 卡及流動通訊市場。自加入 TechRitual 以來,累計撰寫數千篇科技報導及產品評測,內容同步發佈至 SINA 及 Yahoo Tech 等主要平台。

友情網站:日本語版 / TechNipponThe Base Principle(AI・工程)