高通量测序数据在IGV中如何可视化?,步骤有哪些?
- 前端开发
- 2026-07-22
- 8
高通量测序数据(如全基因组、全外显子组、RNA-seq、ChIP-seq等)产出庞大的序列比对、变异检测和表达量信息,而IGV(Integrative Genomics Viewer)作为一款轻量、高效的基因组浏览器,能够直观展示这些数据在参考基因组上的分布、覆盖和变异特征,是科研和临床分析中不可或缺的辅助工具,以下从数据格式、加载流程、可视化操作及自定义技巧等方面详细说明如何利用 IGV 对高通量测序数据进行有效可视化。
常见数据格式及其特点
高通量测序下游分析产生多种文件类型,IGV 支持直接读取或索引后读取以下主要格式:
| 文件类型 | 示例格式 | 核心用途 | 索引要求 |
|---|---|---|---|
| 比对数据 | BAM / CRAM | 展示 reads 的比对位置、CIGAR、配对关系、碱基质量等 | 必须同时提供 .bai / .crai 索引 |
| 变异数据 | VCF / BCF | 显示 SNP、Indel、SV 等变异位点基因型、质量、深度 | 需要 .tbi / .csi 索引 |
| 片段/峰值数据 | BED / narrowPeak | 基因注释、ChIP-seq 富集区、拷贝数变化区域 | 大文件需排序并建立索引 |
| 连续信号数据 | BigWig / WIG | 展示覆盖度、甲基化水平、基因表达密度等连续值 | 直接使用,无需额外索引 |
| 基因组注释 | GTF / GFF | 基因结构、外显子、CDS、UTR 等 | 小文件可直接加载,大文件建议排序后使用 |
表格中列出的格式覆盖了绝大多数高通量测序分析结果,用户可根据数据类型选择相应格式,注意 BAM 和 VCF 必须在加载前建立索引,否则 IGV 无法随机访问特定区域。
数据加载与基因组选择
加载本地数据:通过菜单 File → Load from File 选择文件,或直接拖拽至 IGV 窗口,IGV 自动识别文件类型,并提示加载索引,若索引缺失,可使用 samtools index 或 tabix 预先生成。
加载远程数据:支持输入 URL 直接访问云端文件(如 S3、HTTP),但需确保网络稳定,同时索引文件需与数据文件放在同一路径下,IGV 也支持通过 File → Load from URL 加载。

选择参考基因组:加载测序数据前,必须确认参考基因组版本(如 hg19、hg38、mm10 等),IGV 内置常用基因组,也可通过 Genomes → Load Genome from File 加载自定义 FASTA 文件,若数据与参考基因组版本不匹配,可视化结果将出现错位或缺失。

导航与视口操作
可视化核心是对基因组特定区域的浏览和缩放:
- 跳转区域:在顶部搜索框输入坐标(如 chr7:55,240,000-55,280,000)或基因名称(如 EGFR),IGV 立即定位到该区域。
- 缩放:使用鼠标滚轮或工具栏的 +/按钮,可从小范围单碱基到全基因组范围查看,缩放级别影响显示内容:高分辨率下展示 reads 的碱基细节,低分辨率下自动切换为覆盖度图。
- 轨道管理:左侧轨道面板可拖拽调整顺序、右键设置显示模式(如 Squished、Expanded、Collapsed),多轨道并排便于对比不同样本(如肿瘤 vs 正常)的覆盖差异。
自定义可视化与高级分析
IGV 提供丰富的自定义选项来满足不同分析需求:
- 着色与样式:根据 reads 的比对质量、配对方向、插入片段长度等设置颜色规则,RNA-seq 数据中可区分正义链和反义链 reads。
- 覆盖度图:BAM 文件默认显示为覆盖度柱状图,可调整 Y-axis 范围以突出低丰度区域,对于 ChIP-seq 等信号富集,可叠加显示多个 BigWig 文件并开启 Autoscale 使轮廓清晰。
- 变异查看:加载 VCF 后,IGV 使用不同颜色标记纯合/杂合位点,鼠标悬停显示 AD、DP 等字段,结合 BAM 覆盖,可直观验证变异是否存在假阳性(如链偏好性、临近 indels 干扰)。
- 注释轨道:添加 dbSNP、ClinVar、COSMIC 等公共数据库注释,快速定位已知致病位点,IGV 支持通过 File → Load from Server 获取在线资源。
常见问题与实用技巧
- 内存不足:当加载多组 BAM 或大区域大数据时,IGV 响应变慢,建议使用 Preferences → Advanced → Set maximum memory 增加堆内存(如设为 4GB),关闭不必要轨道的 Expanded 显示模式可减轻渲染负担。
- 索引缺失:若提示 Missing index file,可使用命令行工具补齐,BAM 用 samtools index sample.bam,VCF 用 tabix -p vcf sample.vcf.gz,BED 用 sort-bed sample.bed | bgzip > sample.bed.gz 后再 tabix。
- 批量截图:通过 Tools → IGVt Reformatter 或脚本调用 Batch 模式,可自动对指定区域列表(如基因列表)输出截图,适用于报告制作。
- 与外部工具联动:IGV 支持 Export 功能将当前视图内的 reads 序列导出为 FASTA,或直接调出 IGV Web App 链接分享给合作者。
相关问答 FAQs
Q1:如何快速查看 reads 支持变异的证据?
A:在 IGV 中加载对应样本的 BAM 文件和 VCF 文件,定位到变异位点,将 BAM 轨道显示模式切换为 Expanded 或 Squished,并开启 Show all bases(右键菜单),reads 中与参考基因组不同的碱基会以彩色显示,可以直观统计支持变异 reads 的数量、变异频率、是否存在链偏好性或 read 末端错误,可加载 Alignment 轨道的 View as pairs 查看配对关系,以排除 PCR 重复产生的假阳性。
Q2:为什么加载 BigWig 文件后没有显示信号值?
A:通常原因如下:1)BigWig 文件对应的参考基因组版本与 IGV 当前选用的基因组不一致,导致信号定位到错误区域;2)缩放级别过低,IGV 在全局视图下可能隐去细节信号,建议放大到 ~100 kb 以内区域;3)文件可能损坏,可尝试重新生成或使用 bigWigToWig 工具检查;4)若 BigWig 为未压缩的旧版格式,需用 wigToBigWig 转换,可在偏好设置中开启 Signal track autoscale 以自动调整纵轴范围。
