Human Data Logo
NBDC ヒトデータベース
JGAD000873
公開日
2024-11-29

更新日
2024-11-29

研究
hum0014

データの種類
バイオバンクジャパン7,472名のWGSデータと1000ゲノムプロジェクト(Phase3v5)2,504名のWGSのvcfファイルを統合したgenotype imputation用のreference panel

アクセス制限
制限公開(Type I)

JGA Study
JGAS000738

解析手法

WGS + リファレンスパネル (autosomes)

材料と対象者

【WGS】 BBJ第1コホート: 7,472名 15-30×深度: 3,256名、3×深度: 4,216名 (下記データを含む) ・2003年から2007年度にバイオバンク・ジャパンに登録された47疾患患者 1,026名(JGAD000220) ・バイオバンク・ジャパン第1コホートに含まれる胃がん 256名(JGAD000831) ・2003年から2017年度にバイオバンク・ジャパンに登録された症例 1,964名(JGAD000495) ・バイオバンク・ジャパン第1コホートに含まれる糖尿病のうち 2,157名(JGAD000833) ・バイオバンク・ジャパン第1コホートに含まれる胃がんのうち 2,059名(JGAD000834) 【reference panel】 ・BBJ第1コホート7,472名のWGSのvcfファイル ・1000ゲノムプロジェクト(Phase3v5)2,504名のWGSのvcfファイル(ftp://ftp.1000genomes.ebi.ac.uk/vol1/ftp/release/20130502/)

実験方法

WGS WGS解析により検出された変異情報の統合(常染色体上のvariants)

プラットフォーム

Illumina [HiSeq 2500/X Five]

試料説明

末梢血から抽出したgDNA

リード重複除去

15-30×深度: Picard 2.10.6 3×深度: Picard 1.106、2.5.0

再アライメント・塩基品質補正

GATK v.3.2-2

ライブラリ構築

TruSeq Nano DNA Library Preparation Kit

断片化

超音波断片化

リードタイプ

Paired-end

リード長

125 bp x 2、126 bp x 2、151 bp x 2、161 bp x 2

解析方法

15-30×深度: GATK 3.7 HaplotypeCaller 3×深度: GotCloud v1.17.5

フィルタリング

We set exclusion criteria for genotypes sequenced at high depth (30x and 15x) as follows: (1) DP < 5, (2) GQ < 20, or (3) DP > 60 and GQ < 95, and regarded these genotypes as missing. Variants with call rates < 90% were excluded before variant quality score recalibration (VQSR). After VQSR, variants located in low-complexity regions (LCR), as defined by mdust software, were excluded in the high depth (30x) dataset. Finally, we used BEAGLE to impute missing genotypes.

マッピング

15-30×深度: BWA mem 0.7.12 3×深度: BWA mem 0.7.5a

マッピング品質

15-30×深度: GATK 3.7 HaplotypeCallerで変異コール時にMAPQ<20 のリードを除外 3×深度: GotCloudで変異コール時にMAPQ<20のリードを除外

リファレンス配列

GRCh37

カバレッジ

30×、15×、3×

SNV数

80,753,886

INDEL数

4,535,276

バリアント数

85,328,475 variants

JGAデータセットAccession
総データ量

40.5 GB(vcf)

利用ポリシー