データセット ID
JGAD000881
- データの種類
- バイオバンクジャパン3,256名のWGSデータと1000ゲノムプロジェクト(Phase3v5)2,504名のWGSのvcfファイルを統合したgenotype imputation用のreference panel
- アクセス制限
- 制限公開(Type I)
- 総データ量
- 28.2 GB
- ファイル形式
- VCF
- 研究
- hum0014
- 公開日
- 2024-12-04
- 更新日
- 2024-12-04
- DDBJ Search
- JGAD000881 (新しいタブで開きます)
- JGA Study
- JGAS000746 (新しいタブで開きます)
解析手法
WGS + リファレンスパネル (autosomes + X)
- 材料と対象者
- 【WGS】
BBJ第1コホート:3,256名
(下記データを含む)
・2003年から2007年度にバイオバンク・ジャパンに登録された47疾患患者 1,026名(JGAD000220)
・バイオバンク・ジャパン第1コホートに含まれる胃がん 256名(JGAD000831)
・2003年から2017年度にバイオバンク・ジャパンに登録された症例 1,964名(JGAD000495)
【reference panel】
・BBJ第1コホート3,256名のWGSのvcfファイル
・1000ゲノムプロジェクト(Phase3v5)2,504名のWGSのvcfファイル(ftp://ftp.1000genomes.ebi.ac.uk/vol1/ftp/release/20130502/) - 健康状態混在
- 対象者数3256 (人数)
- コホート1000 Genomes Project、BioBank Japan
- 対象集団日本人
- 試料説明
- 末梢血から抽出したgDNA
- 組織末梢血
- 腫瘍 / 非腫瘍非腫瘍
- 試料の入手元
- N/A
- 実験方法
- WGS
- 測定対象
- N/A
- 試薬キット
- TruSeq Nano DNA Library Prep Kit
- 断片化
- 超音波断片化
- プラットフォーム
- Illumina HiSeq 2500
Illumina HiSeq X - リードタイプ
- ペアエンド
- リード長
- 125 bp
126 bp
151 bp
161 bp - 参照ゲノム
- GRCh37
- マッピング
- BWA mem 0.7.12
- リード重複除去
- Picard 2.10.6
- 再アライメント・塩基品質補正
- GATK v.3.2-2
- マッピング品質
- GATK 3.7 HaplotypeCallerで変異コール時にMAPQ<20 のリードを除外
- QC・フィルタリング
- We set exclusion criteria for genotypes sequenced as follows:
(1) DP < 5, (2) GQ < 20, or (3) DP > 60 and GQ < 95, and regarded these genotypes as missing.
Variants with call rates < 90% were excluded before variant quality score recalibration (VQSR).
After VQSR, variants located in low-complexity regions (LCR), as defined by mdust software were excluded.
Finally, we used BEAGLE to impute missing genotypes. - 解析方法
- GATK 3.7 HaplotypeCaller
- カバレッジ (深度)
- 30x
15x - バリアント数
- 4,057,373 (variants 常染色体)
44,444 (variants X染色体)
66,863,693 (variants 常染色体)
3,206,807 (variants X染色体)
74,210,602 variants
常染色体: 70,958,158 variants
X染色体: 3,252,444 variants - 加工データの種類
- リファレンスパネル