本文へ
NBDC ヒトデータベース

カートに入れたデータセットはありません。

現在、多数のデータ提供申請をいただいており、確認作業に通常よりも時間を要しております。お待たせして大変申し訳ございませんが、何卒ご理解いただけますようお願い申し上げます。申請いただく際は、お時間に余裕を持ってお手続きいただけますと幸いです

2026年4月1日付の組織体制変更により、当部門は「データサイエンス共同利用基盤施設 ライフサイエンス統合データベースセンター」から、「国立遺伝学研究所(NIG)バイオデータ研究拠点(BSI)ライフサイエンス統合データベース部門(DBCLS)」となりました。ガイドラインにおいて旧名称が残っております箇所につきましては、すべて新名称に読み替えて適用くださいますようお願いいたします

データセット ID

JGAD000873

データの種類
バイオバンクジャパン7,472名のWGSデータと1000ゲノムプロジェクト(Phase3v5)2,504名のWGSのvcfファイルを統合したgenotype imputation用のreference panel
アクセス制限
制限公開(Type I)
総データ量
40.5 GB
ファイル形式
  • VCF
研究
hum0014
公開日
2024-11-29
更新日
2024-11-29

解析手法

WGS + リファレンスパネル (autosomes)

材料と対象者
【WGS】
BBJ第1コホート:7,472名
15-30×深度:3,256名、3×深度:4,216名
(下記データを含む)
・2003年から2007年度にバイオバンク・ジャパンに登録された47疾患患者 1,026名(JGAD000220)
・バイオバンク・ジャパン第1コホートに含まれる胃がん 256名(JGAD000831)
・2003年から2017年度にバイオバンク・ジャパンに登録された症例 1,964名(JGAD000495)
・バイオバンク・ジャパン第1コホートに含まれる糖尿病のうち 2,157名(JGAD000833)
・バイオバンク・ジャパン第1コホートに含まれる胃がんのうち 2,059名(JGAD000834)
【reference panel】
・BBJ第1コホート7,472名のWGSのvcfファイル
・1000ゲノムプロジェクト(Phase3v5)2,504名のWGSのvcfファイル(ftp://ftp.1000genomes.ebi.ac.uk/vol1/ftp/release/20130502/)
  • 健康状態
    罹患
  • 対象者数
    7472 (人数)
  • コホート
    1000 Genomes Project、BioBank Japan
  • 対象集団
    日本人
試料説明
末梢血から抽出したgDNA
  • 組織
    末梢血
  • 腫瘍 / 非腫瘍
    非腫瘍
試料の入手元
N/A
実験方法
WGS
測定対象
N/A
試薬キット
TruSeq Nano DNA Library Prep Kit
断片化
超音波断片化
プラットフォーム
Illumina HiSeq 2500
Illumina HiSeq X
リードタイプ
ペアエンド
リード長
125 bp
126 bp
151 bp
161 bp
参照ゲノム
GRCh37
マッピング
15-30×深度:BWA mem 0.7.12
3×深度:BWA mem 0.7.5a
リード重複除去
15-30×深度:Picard 2.10.6
3×深度:Picard 1.106、2.5.0
再アライメント・塩基品質補正
GATK v.3.2-2
マッピング品質
15-30×深度:GATK 3.7 HaplotypeCallerで変異コール時にMAPQ<20 のリードを除外
3×深度:GotCloudで変異コール時にMAPQ<20のリードを除外
QC・フィルタリング
We set exclusion criteria for genotypes sequenced at high depth (30x and 15x) as follows:
(1) DP < 5, (2) GQ < 20, or (3) DP > 60 and GQ < 95, and regarded these genotypes as missing.
Variants with call rates < 90% were excluded before variant quality score recalibration (VQSR).
After VQSR, variants located in low-complexity regions (LCR), as defined by mdust software, were excluded in the high depth (30x) dataset.
Finally, we used BEAGLE to impute missing genotypes.
解析方法
15-30×深度:GATK 3.7 HaplotypeCaller
3×深度:GotCloud v1.17.5
カバレッジ (深度)
30x
15x
3x
バリアント数
4,535,276
80,753,886
85,328,475 variants