AI医学研究員 オンライン面接用ポートフォリオプロジェクト
このプロジェクトは、タンパク質研究に使うAI技術を集めたものです。 難しい技術を、誰でも分かるように説明しながら実装しています。
タンパク質は「MVLSPAD...」のようなアミノ酸の文字列で表されます。 ちょうど「あいうえお」を並べて文章を作るように、 アミノ酸を並べるとタンパク質ができます。
LLM(大規模言語モデル) を使って、この「ことば」を読み解き、 「このタンパク質は何をするものか」を予測します。
📁 ファイル: src/protein_llm.py
タンパク質は折りたたまれて立体的な形になります。 この形をグラフ(点と線の繋がり) として表現し、 GCN(グラフニューラルネットワーク) で分析します。
「このタンパク質はらせん状か?シート状か?」を予測します。
📁 ファイル: src/protein_gcn.py
Diffusion(拡散モデル) は、 でたらめな下書きから始めて、 少しずつキレイにして、最後に本物のタンパク質を作ります。
これで今までにない新しいタンパク質を発明できます!
📁 ファイル: src/protein_diffusion.py
ゲームでキャラクターを育てるように、 強化学習(RL) でタンパク質を改良します。
「水に溶けやすく」「副作用が少なく」など、 目標に向かって最適なタンパク質を探します。
📁 ファイル: src/protein_rl.py
| 技術 | 用途 | 難しい名前 |
|---|---|---|
| 🗣️ LLM | ことばを読む | Transformer, Self-Attention |
| 🔷 GCN | カタチを理解 | Graph Convolutional Network |
| ✨ Diffusion | 新しく創る | DDPM, Denoising |
| 🎮 RL | 育てる | Policy Gradient, Reward |
# インストール
pip install -r requirements.txt
# 全てのデモを実行
python main.pyprotein_ai_interview/
├── src/
│ ├── protein_llm.py # ことばを読む
│ ├── protein_gcn.py # カタチを理解
│ ├── protein_diffusion.py # 新しく創る
│ └── protein_rl.py # 育てる
├── main.py # デモ実行
└── requirements.txt # 必要なもの
- 新薬開発: 病気を治すタンパク質を見つける
- 抗体設計: ウイルスと戦う抗体を作る
- 酵素改良: 工業に使える酵素を改良
MIT License
作成: 2026年1月 | 目的: AI医学研究員 オンライン面接