本文へ
NBDC ヒトデータベース

カートに入れたデータセットはありません。

現在、多数のデータ提供申請をいただいており、確認作業に通常よりも時間を要しております。お待たせして大変申し訳ございませんが、何卒ご理解いただけますようお願い申し上げます。申請いただく際は、お時間に余裕を持ってお手続きいただけますと幸いです

2026年4月1日付の組織体制変更により、当部門は「データサイエンス共同利用基盤施設 ライフサイエンス統合データベースセンター」から、「国立遺伝学研究所(NIG)バイオデータ研究拠点(BSI)ライフサイエンス統合データベース部門(DBCLS)」となりました。ガイドラインにおいて旧名称が残っております箇所につきましては、すべて新名称に読み替えて適用くださいますようお願いいたします

データセット ID

JGAD000881

データの種類
バイオバンクジャパン3,256名のWGSデータと1000ゲノムプロジェクト(Phase3v5)2,504名のWGSのvcfファイルを統合したgenotype imputation用のreference panel
アクセス制限
制限公開(Type I)
総データ量
28.2 GB
ファイル形式
  • VCF
研究
hum0014
公開日
2024-12-04
更新日
2024-12-04

解析手法

WGS + リファレンスパネル (autosomes + X)

材料と対象者
【WGS】
BBJ第1コホート:3,256名
(下記データを含む)
・2003年から2007年度にバイオバンク・ジャパンに登録された47疾患患者 1,026名(JGAD000220)
・バイオバンク・ジャパン第1コホートに含まれる胃がん 256名(JGAD000831)
・2003年から2017年度にバイオバンク・ジャパンに登録された症例 1,964名(JGAD000495)
【reference panel】
・BBJ第1コホート3,256名のWGSのvcfファイル
・1000ゲノムプロジェクト(Phase3v5)2,504名のWGSのvcfファイル(ftp://ftp.1000genomes.ebi.ac.uk/vol1/ftp/release/20130502/)
  • 健康状態
    混在
  • 対象者数
    3256 (人数)
  • コホート
    1000 Genomes Project、BioBank Japan
  • 対象集団
    日本人
試料説明
末梢血から抽出したgDNA
  • 組織
    末梢血
  • 腫瘍 / 非腫瘍
    非腫瘍
試料の入手元
N/A
実験方法
WGS
測定対象
N/A
試薬キット
TruSeq Nano DNA Library Prep Kit
断片化
超音波断片化
プラットフォーム
Illumina HiSeq 2500
Illumina HiSeq X
リードタイプ
ペアエンド
リード長
125 bp
126 bp
151 bp
161 bp
参照ゲノム
GRCh37
マッピング
BWA mem 0.7.12
リード重複除去
Picard 2.10.6
再アライメント・塩基品質補正
GATK v.3.2-2
マッピング品質
GATK 3.7 HaplotypeCallerで変異コール時にMAPQ<20 のリードを除外
QC・フィルタリング
We set exclusion criteria for genotypes sequenced as follows:
(1) DP < 5, (2) GQ < 20, or (3) DP > 60 and GQ < 95, and regarded these genotypes as missing.
Variants with call rates < 90% were excluded before variant quality score recalibration (VQSR).
After VQSR, variants located in low-complexity regions (LCR), as defined by mdust software were excluded.
Finally, we used BEAGLE to impute missing genotypes.
解析方法
GATK 3.7 HaplotypeCaller
カバレッジ (深度)
30x
15x
バリアント数
4,057,373 (variants 常染色体)
44,444 (variants X染色体)
66,863,693 (variants 常染色体)
3,206,807 (variants X染色体)
74,210,602 variants
常染色体: 70,958,158 variants
X染色体: 3,252,444 variants
加工データの種類
リファレンスパネル