2026年4月1日付の組織体制変更により、当部門は「データサイエンス共同利用基盤施設 ライフサイエンス統合データベースセンター」から、「国立遺伝学研究所(NIG)バイオデータ研究拠点(BSI)ライフサイエンス統合データベース部門(DBCLS)」となりました。ガイドラインにおいて旧名称が残っております箇所につきましては、すべて新名称に読み替えて適用くださいますようお願いいたします
現在、多数のデータ提供申請をいただいており、確認作業に通常よりも時間を要しております。お待たせして大変申し訳ございませんが、何卒ご理解いただけますようお願い申し上げます。申請いただく際は、お時間に余裕を持ってお手続きいただけますと幸いです
- 公開日
- 2021-06-21
- 更新日
- 2025-05-09
- 研究
- hum0014
- データの種類
- 158,284名のBMIデータ 182,505名のGenotypeデータ
- アクセス制限
- 制限公開(Type I)
- JGA Study
- JGAS000114
解析手法
WGS
- 材料と対象者
2003年から2007年度にバイオバンク・ジャパンに登録された47疾患患者: 1,026名
- 実験方法
WGS
- プラットフォーム
Illumina [HiSeq 2500]
- 試料説明
末梢血から抽出したgDNA
- リード重複除去
Picard 2.10.6
- 再アライメント・塩基品質補正
GATK 3.7
- ライブラリ構築
TruSeq Nano DNA Library Preparation Kit
- 断片化
超音波断片化
- リードタイプ
Paired-end
- リード長
160 bp
- 解析方法
GATK 3.7 HaplotypeCaller
- フィルタリング
リードのbase qualityが全体的に悪い検体、リード毎の%GCの結果にて異常を示した検体を除去。 Alignment後、Low mapping rate検体、Insert sizeがおかしい検体、メタデータの性別情報とalingment結果より推定される性別情報が不一致な検体、性染色体異常疑いの検体を除去。 Genotyping時に、VQSR、DP/GP filter (DP < 5, GQ < 20, DP > 60 && GQ < 95を除去)、heterozygosity filter (F>=0.05 を除去)、HWE filter (p < 10-6を除去)、Repeat & Low Complexity filterを実施。 1000 genomes projectと合わせたPCAを実施し、日本人クラスタから大きく外れる検体を除外。 その後、Genome-In-A-Bottleプロジェクトから公開されているHighConfidenceRegionリストに記載のある領域のバリアントにフラグを付与。
- マッピング
BWA mem 0.7.12
- マッピング品質
GATK 3.7 HaplotypeCallerで変異コール時にMAPQ<20のリードを除外
- リファレンス配列
GRCh37/hg19(hs37d5)
- カバレッジ
31.8x
- SNV数
76,768,387(常染色体) 2,898,518(X 染色体)
- INDEL数
10,202,908(常染色体) 410,435(X 染色体)
- JGAデータセットAccession
JGAD000410(bam、vcf)
- 総データ量
JGAD000220: 73 TB(fastq) JGAD000410: 49 TB(bam、vcf) JGAD000690: 52.1 TB(bam、bai、vcf、document) JGAD000758: 203.8 GB(vcf_aggregate、tabix)
- 利用ポリシー
- DBCLSおよび生命情報・DDBJセンターによる加工データのID
JGAD000690 JGAD000758(joint call) 加工方法はこちら
