本文にスキップ
AI News HubLIVE
サイト内リライト2 分で読了

タンパク質折りたたみモデルを潜像拡散による生成に再利用する

記事の要約

PLAIDは、タンパク質折りたたみモデルの潜在空間を学習することで、タンパク質の1次配列と3次構造を同時に生成するマルチモーダル生成モデルです。配列データのみで訓練可能で、機能や生物種のプロンプトに対応し、全原子生成、生物種特異性、制御仕様といった実用的な課題を解決します。

ソースBAIR Blog
タンパク質折りたたみモデルを潜像拡散による生成に再利用する
誤りを報告

訂正窓口はまだ利用できません。記事情報をコピーして保存できます。

訂正案内
本文へ

2024年のノーベル化学賞がAlphaFold2に授与されたことは、生物学におけるAIの役割が大きく認識された瞬間です。タンパク質折りたたみの次のステップとして、PLAID(Protein Latent Diffusion)が登場しました。PLAIDは、タンパク質折りたたみモデル(例:ESMFold)の潜在空間を学習することで、新しいタンパク質を生成するマルチモーダル生成モデルです。既存の多くのモデルが主鎖原子のみを生成するのに対し、PLAIDは離散的なアミノ酸配列と連続的な全原子構造座標を同時に生成し、マルチモーダル共生成問題に取り組みます。

構造予測から現実の創薬への応用には、いくつかの課題があります。全原子生成には配列情報が必要であり、生物学的製剤はヒト化して免疫拒絶を避ける必要があります。また、薬剤発見では溶解度などの複雑な制約を指定する必要があります。PLAIDは、機能と生物種の合成プロンプトを提供するインターフェースを備えており、画像生成のテキストプロンプトのようにタンパク質生成を細かく制御できます。例えば、金属タンパク質に特徴的な四面体型のシステイン-鉄配位パターンを学習しつつ、配列多様性を維持します。

PLAIDの重要な利点は、配列データのみで生成モデルを訓練できることです。配列データベースは構造データベースより2~4桁も大きく、入手コストも低くなります。訓練時には、タンパク質折りたたみモデルの潜在空間上で拡散過程を学習し、推論時には凍結された折りたたみモデルの重みを使用して配列と構造をデコードします。これは、ロボティクスにおける視覚-言語-行動モデルがインターネット規模のデータから事前知識を利用するのと類似しています。

ただし、ESMFoldなどのTransformerモデルの潜在空間は正則化が難しく、非常に高次元であるという問題があります。この問題に対処するため、研究チームはCHEAP(Compressed Hourglass Embedding Adaptations of Proteins)を提案しました。これは、タンパク質配列と構造の結合埋め込みを圧縮するモデルです。メカニズム的解釈可能性分析により、この潜在空間が高度に圧縮可能であることがわかり、全原子タンパク質生成モデルを実現しました。

将来的には、この手法は、豊富なモダリティから希少なモダリティへの予測子が存在する任意のマルチモーダル生成タスクに適用可能です。AlphaFold3がタンパク質と核酸やリガンドの複合体を予測できるようになったことで、同じ手法を用いてより複雑なシステムのマルチモーダル生成が可能になると期待されます。研究チームは、さらなる共同研究や湿実験による検証を呼びかけています。関連する論文とコードはbioRxivで公開されています。

要点と分析を開く

記事インテリジェンス

エンジニア上級

要点

  • PLAIDはタンパク質折りたたみモデルの潜在空間で拡散生成を行い、配列と構造を同時生成する。
  • 配列データのみで学習可能で、構造データベースより2~4桁大きい配列データベースを活用。
  • CHEAP圧縮法により、トランスフォーマーの高次元潜在空間の問題に対処。
  • 機能と生物種のプロンプトによる制御を実現し、テキストベースのタンパク質設計を目指す。

要点と分析は自動生成され、誤りを含む場合があります。原典をご確認ください。