Xaira Therapeuticsは2026年7月21日(現地時間)、AIを活用した創薬開発におけるモデル構築のため、データ生成に注力していることを明らかにした。同社のBo Wang氏とCi Chu氏は、情報豊富なデータがAI駆動型創薬の鍵であるとの戦略的見解を示した。特に、遺伝子発現の変化予測に特化した新しいモデル「X-Cell」とその基盤となるデータセット「X-Atlas」について説明した。

Xaira Therapeuticsは、データがモデルの性能向上に不可欠であるとの認識に基づき、データ生成への投資を強化している。同社は、15億パラメータでテスト損失が横ばいになり、31億パラメータのモデルがスケーリングの限界に達した経験から、この戦略を採用した。Bo Wang氏とCi Chu氏のチームは、遺伝子発現変化予測に必要な情報豊富なデータを約30倍に増やすことで、パラメータと計算量のスケーリングに伴う性能向上が可能になったと説明している。

同社は、ヒト細胞の機能を解明するアプローチとして、遺伝子発現の変化を予測するモデルの重要性を強調する。Chan Zuckerberg Instituteが構築した1億6800万個の細胞のデータベース「CELLxGENE」は、構造生物学モデルにおけるProtein Data Bank (PDB) と同様の役割を果たすと指摘。このCELLxGENEを基盤に、Bo Wang氏が影響力のあるモデル「scGPT」を構築し、これがXairaの新しいモデルの出発点となった。

しかし、CELLxGENEでトレーニングされたモデルは、細胞タイプと細胞状態の関係を記述するものであり、RNA発現の変化が引き起こす影響を予測するのには不向きであるとXairaは分析する。これは、遺伝子発現の変化が高い相関関係にあるため、何が原因で何が結果であるかを特定することが困難であるためだ。Xairaのチームは、単一の遺伝子を一つずつ操作することで、特定の遺伝子の因果関係を観察可能にするアプローチを採用。これにより、遺伝子変化が細胞に与える影響を予測するモデルのトレーニングが可能になるとしている。

この目的のために、Xaira Therapeuticsは新しいデータセット「X-Atlas」とモデル「X-Cell」を開発した。これらの開発においては、オートリグレッションモデルから拡散モデルへの転換、CRISPRベースの実験による数百万回の並行テスト実行、実際のヒト細胞における実験への汎化、以前のモデルを上回る線形ベースラインの達成などが議論された。同社は情報豊富なデータがAI駆動型創薬の鍵であると位置付けている。


参考: Latent Space (アーカイブ) — 2026年7月22日 04:34 (JST)

原文ハイライト

"Xaira Therapeutics is all in on data generation for model building!"

この記事をシェア
X はてブ LinkedIn