🧬 「データは多いほど良い」という機械学習の常識が、ゲノム医療の世界では通用しないかもしれません。
タイトル: Transfer learning for genomic prediction in underrepresented populations
URL:
疾患リスクを予測するポリジェニックリスクスコア(PRS)は、これまでほぼ欧州系集団のデータで作られてきたため、他の集団に使うと精度が落ちるという課題がありました。この研究では、UK Biobank(欧州系)とBiobank Japan(日本人)のデータ量を変えながら、8つの臨床形質でPRSの精度を検証しています。
注目ポイント1 📉 データが増えるほど良いとは限らない
欧州系データを使った転移学習が日本人向け予測に有利なのは、日本人側のサンプル数がおよそ15,000人に達するまで。それを超えると、むしろ日本人単独のデータで作ったモデルの方が精度が高くなります。
注目ポイント2 🧬 形質によって「賞味期限」が違う
BMIのように遺伝的に保存性が高い形質は、欧州データの恩恵が25,000〜40,000人以上まで長続きします。一方、脂質関連の形質など集団固有性が強い形質では、恩恵はもっと早く失われます。
注目ポイント3 ⚖️ 手法選びもサンプル数次第
クロス集団向け手法PRS-CSxは、サンプル数が少ないうちはシンプルな手法に劣りますが、10万人規模に近づくと同等の性能を発揮します。万能な手法は存在せず、状況に応じた使い分けが必要です。
臨床ゲノミクスの公平性を高めるには、各地域のバイオバンク拡充と、形質・サンプルサイズに合わせた戦略選択の両輪が欠かせないことを示す研究です。
#
ゲノミクス# #
転移学習#