本文へスキップ
Decipher the Map English

2026年8月6日

前提

全ゲノム解析で「読めること」と「読めないこと」

全ゲノムだから何でもわかる、ということはありません。原理的に読めない領域がどこにあるのかを、解読を始める前に確認しておきます。

「全ゲノム」という言葉には、ゲノムの全部が読めているという響きがあります。実際にはそうではありません。

いま個人向けに広く提供されている全ゲノム解析のほとんどは、短鎖リードと呼ばれる方式で行われています。ゲノムを細かく断片化して、150塩基ほどの短い断片を大量に読み、それを参照配列と照らし合わせて元の位置に戻していく。この「元の位置に戻す」工程に、そのまま限界が出ます。

解読を始める前に、この線を引いておきます。ここを曖昧にしたまま進むと、「見つからなかった」を「存在しない」と読み違えることになるからです。

得意なこと

一塩基の置換と、数塩基から数十塩基程度の挿入・欠失。世の中で語られる多型のほとんどはここに入るので、実用上は広い範囲がカバーされます。

代謝経路に関わる多型を見ていく分には、大半がこの範囲で足ります。

苦手なこと

大きな構造の変化

数百塩基から数千塩基規模の欠失や重複は、短い断片を並べる方式では捉えにくくなります。断片が「ない」ことは、読めなかっただけなのか、本当に欠けているのか、区別がつきにくいためです。

繰り返し配列の伸長

同じ配列が何十回、何百回と繰り返される領域では、断片が繰り返しの中のどこ由来なのかを決められません。繰り返しの回数そのものが意味を持つ場合、そこは読めていないことになります。

他とよく似た配列を持つ領域

ゲノムには、機能を失った遺伝子の写しのような配列が、本体とよく似た形で残っている場所があります。断片がどちらの由来か判別できないため、この領域の読みは信頼度が落ちます。

読みの厚みが薄い場所

同じ位置が何回読まれたかを、カバレッジ深度と呼びます。この値は場所によってばらつきます。特定の塩基組成に偏った領域では薄くなりやすく、薄い場所での判定は当てになりません。

「見つからなかった」の意味

ここが実務でいちばん誤解されるところです。

解析結果に何も出てこなかったとき、それは次のどれかです。

  • そこに変化がなかった
  • 変化はあったが、この方式では読めない種類のものだった
  • そもそもその領域が十分に読まれていなかった

この三つは、結果の表からは区別できません。 区別するには、その領域が実際にどれだけ読まれていたかを確認する必要があります。手順としては、解読を始める前にカバレッジの分布を見て、読めていない領域を先に把握しておくことになります。

確認は、遺伝子単位ではなく座位単位で

ここで一つ、間違えやすいところがあります。「この遺伝子はよく読めている」では足りません。知りたいのは、その一箇所が読まれていたかどうかです。

遺伝子全体の平均深度を見ても、対象の座位がたまたま谷に落ちているかどうかは分かりません。逆に、全体としては薄い遺伝子でも、その一箇所だけはよく読めていることがあります。座位を決めて、そこを見る。

もう一つ、変異は平均すると千塩基に一つ程度しか出てきません。「その座位のすぐ近くに何も出ていない」ことは、そのまま「読めていない」を意味しません。 近くに何も無いことと、読めていないことは、別の話です。

読めない型には、別の道具がある

「この方式では読めない」型の中でも、性質がはっきりしているものがあります。

  • 遺伝子まるごとの欠失多型。 その遺伝子を持っている人と持っていない人がいる、という型です。持っていないことを、断片が並ばないという事実だけから確定することはできません(GSTM1・GSTT1 が代表例として知られています)
  • 反復回数そのものが多型になっている領域。 調節領域に短い配列が何回繰り返されるか、という違いです。回数が意味を持つので、短い断片を並べる方式では数えられません(MAOA のプロモーターにある反復配列が例として挙げられます)

これらは「読めなかった」のではなく、この方式では原理的に読めないものです。確かめたければ、コピー数を数える検査や、反復の長さを測る検査など、別の方法が要ります。

大事なのは、読めないものを読めないと書くことです。表に空欄が残るのは落ち着かないものですが、何かで埋めてしまうと、後から見た人はそれを結果として読みます。空欄のままにして、なぜ空欄なのかと、確かめるなら何が要るのかを書き添えておく。それがいちばん誠実で、後から使える形になります。

演習では、正解のあるデータを使う

自分の手順が正しいかどうかを確かめるには、答え合わせができる必要があります。

そのために、研究目的で公開されている標準データセットを使います。米国 NIST の Genome in a Bottle という取り組みが、高い信頼度で検証された「正解」を公開しています。同じ検体を複数の方式で繰り返し解析し、結果が一致する範囲を確定させたものです。

自分の手元のデータには正解がありません。だからこそ、手順の練習は正解のあるデータで行い、手順が固まってから自分のデータに向かう。この順番を崩さないほうが、結局は早く進みます。

参照