
商傳媒|責任編輯/綜合外電報導
傳統深度突變掃描技術(deep mutational scanning)旨在一次測試數千種蛋白質內的「胺基酸替換」(即蛋白質構成的單元發生改變),以建立變異效應圖譜。然而,由於測序深度不足、覆蓋率有限以及實驗篩選失敗等問題,這些圖譜經常出現數據缺口,難以全面呈現蛋白質突變的影響。
為了解決這項挑戰,研究人員開發出一套名為 VEFill 的全新機器學習框架。這項 AI 模型能夠精準填補深度突變掃描數據集中的缺失值,並將其應用範圍擴展至未曾見過的蛋白質。VEFill 整合了多種生物學資訊,包括演化保守性分數、胺基酸替換矩陣(BLOSUM62、PAM250)、物理化學描述符,以及來自 ESM-1v 的上下文序列嵌入(contextual sequence embeddings)。
研究團隊使用 Human Domainome 1 資料集進行模型訓練與優化,該資料集包含了 522 種人類蛋白質結構域的穩定性測量數據。在「排除蛋白質」的評估方式下,VEFill 展現出優異的效能,決定係數(coefficient of determination)達到 0.64,皮爾森相關係數(Pearson correlation)為 0.80。這項成果顯著優於現有的歸因方法,如 Envision、FactorizeDMS 和 AALasso,尤其在至少有 20% 變異數據透過實驗測量時,VEFill 的表現更為突出。當每個位置的替換數據量達約四個突變時,模型的準確度會迅速提升並趨於穩定。
這項研究指出,完全無需任何位置上下文資訊的「零樣本預測」(zero-shot prediction)對於功能複雜的蛋白質仍具挑戰。儘管如此,VEFill 的表現已接近實驗不確定性的極限。未來,VEFill 的發展方向可能包括整合更明確的結構特徵、跨物種轉移學習,以及系統性的實驗校準。VEFill 的程式碼和訓練模型已公開釋出,期望能藉此加速建立更全面的「變異效應圖譜」(Atlas of Variant Effects)。


