Human Data Logo
NBDC ヒトデータベース
JGAD000410
公開日
2021-06-21

更新日
2025-05-09

研究
hum0014

データの種類
158,284名のBMIデータ 182,505名のGenotypeデータ

アクセス制限
制限公開(Type I)

JGA Study
JGAS000114

解析手法

WGS

材料と対象者

2003年から2007年度にバイオバンク・ジャパンに登録された47疾患患者: 1,026名

実験方法

WGS

プラットフォーム

Illumina [HiSeq 2500]

試料説明

末梢血から抽出したgDNA

リード重複除去

Picard 2.10.6

再アライメント・塩基品質補正

GATK 3.7

ライブラリ構築

TruSeq Nano DNA Library Preparation Kit

断片化

超音波断片化

リードタイプ

Paired-end

リード長

160 bp

解析方法

GATK 3.7 HaplotypeCaller

フィルタリング

リードのbase qualityが全体的に悪い検体、リード毎の%GCの結果にて異常を示した検体を除去。 Alignment後、Low mapping rate検体、Insert sizeがおかしい検体、メタデータの性別情報とalingment結果より推定される性別情報が不一致な検体、性染色体異常疑いの検体を除去。 Genotyping時に、VQSR、DP/GP filter (DP < 5, GQ < 20, DP > 60 && GQ < 95を除去)、heterozygosity filter (F>=0.05 を除去)、HWE filter (p < 10-6を除去)、Repeat & Low Complexity filterを実施。 1000 genomes projectと合わせたPCAを実施し、日本人クラスタから大きく外れる検体を除外。 その後、Genome-In-A-Bottleプロジェクトから公開されているHighConfidenceRegionリストに記載のある領域のバリアントにフラグを付与。

マッピング

BWA mem 0.7.12

マッピング品質

GATK 3.7 HaplotypeCallerで変異コール時にMAPQ<20のリードを除外

リファレンス配列

GRCh37/hg19(hs37d5)

カバレッジ

31.8x

SNV数

76,768,387(常染色体) 2,898,518(X 染色体)

INDEL数

10,202,908(常染色体) 410,435(X 染色体)

JGAデータセットAccession

JGAD000410(bam、vcf)

総データ量

JGAD000220: 73 TB(fastq) JGAD000410: 49 TB(bam、vcf) JGAD000690: 52.1 TB(bam、bai、vcf、document) JGAD000758: 203.8 GB(vcf_aggregate、tabix)

利用ポリシー
DBCLSおよび生命情報・DDBJセンターによる加工データのID

JGAD000690 JGAD000758(joint call) 加工方法はこちら