HyperAIHyperAI

Command Palette

Search for a command to run...

UCE、単一細胞の汎用エンベッディング基盤モデルを公開

単一細胞トランスクリプトーム解析における統合の壁を破る基盤モデルUniversal Cell Embeddingが公開された。従来のscRNA-seqデータ解析は、種や実験バッチによるバラつきにより新データごとにモデル調整を必要とし非効率だった。この課題を解決するため開発された同モデルは、タンパク質言語モデルESM2を用いて遺伝子をタンパク質配列レベルでトークン化し、トランスフォーマーに投入する独自アーキテクチャを採用した。細胞をRNAの集合体と捉え、ラベル不要の自己教師あり学習で三千六百万超の細胞データから普遍表現を習得している。 同モデルの最大の特徴は再学習なしで新データを即座に埋め込み可能とするゼロショット能力である。ベンチマークでは既存のGeneformerやscGPT、微調整手法のscVIを大幅に上回る統合精度とバッチ補正性能を検証。トレーニング未観測の異種データでも細胞種マッピング精度が顕著に向上した。埋め込み空間内の細胞配置は発生系や組織特性と統計的に相関し、既存の細胞階層と矛盾しない自律的な生物学的構造を形成している。 実証応用では、腎臓の低発現細胞Norn細胞の解析ケースが示された。同空間で細胞を認識する分類器を構築し他臓器データに適用した結果、類似トランスクリプトーム状態の細胞群が広く検出された。特に線維性肺疾患やCOPD患者の肺組織でも同細胞が関与していることが判明し、疾患予後やエリスロポエチ産生との関連性が示唆された。 同モデルのコードとウェイトはすべて公開され、細胞アトラス構築の標準ツールとして活用が見込まれる。生物の機能単位である細胞のデジタル版実現へ向けた重要な一歩となり、次世代のゲノム解析支援基盤への転換が期待されている。

関連リンク

UCE、単一細胞の汎用エンベッディング基盤モデルを公開 | 人気の記事 | HyperAI超神経