Human Data Logo
NBDC ヒトデータベース
JGAD000868
公開日
2024-08-28

更新日
2025-05-09

研究
hum0014

データの種類
心筋梗塞1,765症例、認知症199症例のWGSデータ

アクセス制限
制限公開(Type I)

JGA Study
JGAS000381

解析手法

WGS

材料と対象者

2003年から2017年度にバイオバンク・ジャパンに登録された症例: 1,964名 心筋梗塞(ICD10: I21): 1,765症例 認知症(ICD10: F00-03): 199症例

実験方法

WGS

プラットフォーム

Illumina [HiSeq X Five]

試料説明

末梢血から抽出したgDNA

リード重複除去

Picard 2.10.6

再アライメント・塩基品質補正

GATK 3.7

ライブラリ構築

TruSeq DNA PCR-Free Prep kit

断片化

超音波断片化

リードタイプ

Paired-end

リード長

151 bp

解析方法

GATK 3.7 HaplotypeCaller

フィルタリング

リードのbase qualityが全体的に悪い検体、リード毎の%GCの結果にて異常を示した検体を除去。 Alignment後、Low mapping rate検体、Insert sizeがおかしい検体、メタデータの性別情報とalingment結果より推定される性別情報が不一致な検体、性染色体異常疑いの検体を除去。 Genotyping時に、VQSR、DP/GP filter (DP < 5, GQ < 20, DP > 60 && GQ < 95を除去)、heterozygosity filter (F>=0.05 を除去)、HWE filter (p < 10-6を除去)、Repeat & Low Complexity filterを実施。 1000 genomes projectと合わせたPCAを実施し、日本人クラスタから大きく外れる検体を除外。 その後、Genome-In-A-Bottleプロジェクトから公開されているHighConfidenceRegionリストに記載のある領域のバリアントにフラグを付与。

マッピング

BWA mem 0.7.12

マッピング品質

GATK 3.7 HaplotypeCallerで変異コール時にMAPQ<20のリードを除外

リファレンス配列

GRCh37/hg19(hs37d5)

カバレッジ

心筋梗塞: 15.0x、認知症: 30.0x

SNV数

76,768,387(常染色体) 2,898,518(X 染色体)

INDEL数

10,202,908(常染色体) 410,435(X 染色体)

JGAデータセットAccession

JGAD000495(fastq) JGAD000496(bam、vcf): GEnome Medical alliance Japan(GEM Japan, GEM-J)の取り組みとして、GATK Best Practicesに準拠した方法により、GRCh37の参照ゲノム配列へのマッピングおよびバリアント検知を実施した際のデータです。詳しくはこちらをご覧ください。

総データ量

188.4 TB(fastq、bam、vcf)

利用ポリシー

WGS インピュテーションパネル (autosomes + X)

材料と対象者

【JGAD000867】 バイオバンクジャパン1,026名のWGSデータ(JGAD000220)のvcfファイル(WGSデータの分子データは上記参照のこと) 【JGAD000868】 バイオバンクジャパン1,964名のWGSデータ(JGAD000495)のvcfファイル(WGSデータの分子データは上記参照のこと)

実験方法

WGS解析により検出された変異情報から遺伝型インピュテーションパネルを作成(常染色体およびX染色体上のvariants)

リード重複除去

GATK MarkDuplicates(version 4.1.0.0)

解析方法

GATK HaplotypeCaller -ERC GVCF(version 4.1.0.0) バリアント検出時のパラメータである ploidy は次のように設定した。 常染色体および pseudoautosomal region(PAR) 領域: ploidy=2 X染色体のnon-PAR領域: ploidy=2(女性) および ploidy=1(男性) Y染色体の non-PAR 領域: ploidy=1(男性)

フィルタリング

生殖系列(germline)の全ゲノムシークエンスデータの加工を行い、aggregate VCFを計算した。その後、下記の条件でvariantsのフィルタリングを行った。 (1) VQSRフィルタを通過しなかったvariantsの除外 (2) Multi-allelic sitesの除外 (3) Call rate が低い(95%未満)variantsの除外 (4) Hardy-Weinberg平衡から逸脱している(P<1e-10)variantsの除外 (5) Minor allele count(MAC)が小さい(< 2)variantsの除外

マッピング

bwa mem(version 0.7.15)

リファレンス配列

GRCh38

カバレッジ

Mean ± Standard deviation JGAD000867: 28.70 ± 4.16 JGAD000868: 19.61 ± 5.41

バリアント数

JGAD000867: 17,167,510 variants(常染色体: 16,677,000 variants、X染色体: 490,510 variants) JGAD000868: 21,596,248 variants(常染色体: 21,157,732 variants、X染色体: 438,516 variants)

JGAデータセットAccession
総データ量

JGAD000867: 3.3 GB(vcf.gz) JGAD000868: 6.2 GB(vcf.gz)

利用ポリシー
DBCLSおよび生命情報・DDBJセンターによる加工データのID