本文へ
NBDC ヒトデータベース

カートに入れたデータセットはありません。

現在、多数のデータ提供申請をいただいており、確認作業に通常よりも時間を要しております。お待たせして大変申し訳ございませんが、何卒ご理解いただけますようお願い申し上げます。申請いただく際は、お時間に余裕を持ってお手続きいただけますと幸いです

2026年4月1日付の組織体制変更により、当部門は「データサイエンス共同利用基盤施設 ライフサイエンス統合データベースセンター」から、「国立遺伝学研究所(NIG)バイオデータ研究拠点(BSI)ライフサイエンス統合データベース部門(DBCLS)」となりました。ガイドラインにおいて旧名称が残っております箇所につきましては、すべて新名称に読み替えて適用くださいますようお願いいたします

データセット ID

JGAD000220

データの種類
BBJ第1コホート1,026名のWGSデータ
アクセス制限
制限公開(Type I)
総データ量
75.1 TB
ファイル形式
  • FASTQ
  • VCF
  • HTML
研究
hum0014
公開日
2020-09-28
更新日
2022-08-23

解析手法

WGS

材料と対象者
2003年から2007年度にバイオバンク・ジャパンに登録された47疾患患者:1,026名
  • 健康状態
    罹患
  • 対象者数
    1026 (人数)
  • コホート
    BioBank Japan
試料説明
末梢血から抽出したgDNA
  • 組織
    末梢血
試料の入手元
N/A
実験方法
WGS
測定対象
N/A
試薬キット
TruSeq Nano DNA Library Prep Kit
断片化
超音波断片化
プラットフォーム
Illumina HiSeq 2500
リードタイプ
ペアエンド
リード長
160 bp
参照ゲノム
GRCh37
マッピング
BWA mem 0.7.12
リード重複除去
Picard 2.10.6
再アライメント・塩基品質補正
GATK 3.7
マッピング品質
GATK 3.7 HaplotypeCallerで変異コール時にMAPQ<20のリードを除外
QC・フィルタリング
リードのbase qualityが全体的に悪い検体、リード毎の%GCの結果にて異常を示した検体を除去。
Alignment後、Low mapping rate検体、Insert sizeがおかしい検体、メタデータの性別情報とalingment結果より推定される性別情報が不一致な検体、性染色体異常疑いの検体を除去。
Genotyping時に、VQSR、DP/GP filter (DP < 5, GQ < 20, DP > 60 && GQ < 95を除去)、heterozygosity filter (F>=0.05 を除去)、HWE filter (p < 10-6を除去)、Repeat & Low Complexity filterを実施。
1000 genomes projectと合わせたPCAを実施し、日本人クラスタから大きく外れる検体を除外。
その後、Genome-In-A-Bottleプロジェクトから公開されているHighConfidenceRegionリストに記載のある領域のバリアントにフラグを付与。
解析方法
GATK 3.7 HaplotypeCaller
カバレッジ (深度)
31.8x
バリアント数
常染色体: 10,202,908
X染色体: 410,435
常染色体: 76,768,387
X染色体: 2,898,518
加工データの種類
アライメント
変異コール
加工データのデータセットID
JGAD000690
JGAD000758(joint call)

WGS リファレンスパネル (autosomes + X)

材料と対象者
・1,026名のWGSデータ(JGAD000220)を含むバイオバンクジャパン1,037名のWGSデータのvcfファイル(WGSデータの分子データは上記参照のこと)
・1000ゲノムプロジェクト(Phase3v5)2,504名のWGSのvcfファイル(ftp://ftp.1000genomes.ebi.ac.uk/vol1/ftp/release/20130502/)
  • 対象者数
    1037 (人数)
  • コホート
    1000 Genomes Project、BioBank Japan
実験方法
WGS
測定対象
N/A
参照ゲノム
GRCh37
マッピング
BWA-MEM (version 0.7.5a)
リード重複除去
picard (versions 1.106)
再アライメント・塩基品質補正
GATK (version 3.2-2)
マッピング品質
MAPQ < 20 を除外(HaplotypeCaller)
QC・フィルタリング
We set exclusion criteria for genotypes as follows:
(1) DP < 5, (2) GQ < 20, or (3) DP > 60 and GQ < 95, and regarded these genotypes as missing.
Variants with call rates < 90% were excluded before variant quality score recalibration (VQSR).
After VQSR, we excluded variants located in low-complexity regions (LCR), as defined by mdust software were excluded.
Finally, we used BEAGLE to impute missing genotypes.
解析方法
GATK HaplotypeCaller (version 3.2-2)
カバレッジ (深度)
30x (目標深度)
バリアント数
61,608,817 variants
常染色体: 59,387,070 variants
X染色体: 2,221,747 variants
加工データの種類
リファレンスパネル
変異コール
加工データのデータセットID
JGAD000679

WGS インピュテーションパネル (autosomes + X)

材料と対象者
【JGAD000867】
バイオバンクジャパン1,026名のWGSデータ(JGAD000220)のvcfファイル(WGSデータの分子データは上記参照のこと)
【JGAD000868】
バイオバンクジャパン1,964名のWGSデータ(JGAD000495)のvcfファイル(WGSデータの分子データは上記参照のこと)
  • 対象者数
    2990 (人数)
  • コホート
    BioBank Japan
実験方法
WGS
測定対象
N/A
参照ゲノム
GRCh38
マッピング
bwa mem(version 0.7.15)
リード重複除去
GATK MarkDuplicates(version 4.1.0.0)
再アライメント・塩基品質補正
N/A
マッピング品質
N/A
QC・フィルタリング
生殖系列(germline)の全ゲノムシークエンスデータの加工を行い、aggregate VCFを計算した。その後、下記の条件でvariantsのフィルタリングを行った。
(1) VQSRフィルタを通過しなかったvariantsの除外
(2) Multi-allelic sitesの除外
(3) Call rate が低い(95%未満)variantsの除外
(4) Hardy-Weinberg平衡から逸脱している(P<1e-10)variantsの除外
(5) Minor allele count(MAC)が小さい(< 2)variantsの除外
解析方法
GATK HaplotypeCaller -ERC GVCF(version 4.1.0.0)
バリアント検出時のパラメータである ploidy は次のように設定した。
常染色体および pseudoautosomal region(PAR) 領域:ploidy=2
X染色体のnon-PAR領域:ploidy=2(女性) および ploidy=1(男性)
Y染色体の non-PAR 領域:ploidy=1(男性)
加工データの種類
リファレンスパネル
変異コール
加工データのデータセットID
JGAD000867
JGAD000868