十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

CD-HIT序列聚类实战指南:从3分钟上手到百万级数据调优

CD-HIT序列聚类实战指南:从3分钟上手到百万级数据调优 CD-HIT序列聚类实战指南从3分钟上手到百万级数据调优【免费下载链接】cdhitAutomatically exported from code.google.com/p/cdhit项目地址: https://gitcode.com/gh_mirrors/cd/cdhitCD-HIT是一套命令行序列聚类程序能把海量蛋白质或核酸序列按相似度分成若干簇每簇保留一条代表序列从而减少冗余、加快后续分析。做蛋白质库构建、转录组簇拆分、16S rRNA OTU划分的人都会用到它。如果只想先跑通复制下面这条最小命令即可默认按90%相似度聚类蛋白质cd-hit -i input.fasta -o output -c 0.9 -n 5 -T 8 -M 16000运行后生成两个文件output代表序列的FASTA和output.clstr每簇成员清单。 机制通俗版先切指纹再上书架CD-HIT 不做全两两比对而是贪心增量式处理先把输入序列按长度从长到短排序最长的一条直接成为第一个簇的代表之后每来一条新序列只跟排在前面的代表序列比够像就并入那个簇不像就自己开一个新簇。它快的关键在于把比对前的筛选做成了查表k-mer 指纹把序列切成长度为 k 的小段k-mer即给序列切指纹蛋白质 k 取 2~5核酸 k 取 4~11索引表每种指纹分配唯一编号查表比哈希快得多短词过滤两条序列若相似度达标必然共享足够多的相同指纹。指纹数不够就直接跳过不必逐位比对需要比对的还会定位出一条窄带只做带状对齐。一句话概括大多数明显不相似的序列在查表阶段就被淘汰了。️ CD-HIT安装与验证编译很简单只需 g较老系统可加openmpno关闭多线程。支持.gz输入依赖 zlib一般系统已自带缺失时先装 zlib 开发包Ubuntusudo apt install zlib1g-dev。git clone https://gitcode.com/gh_mirrors/cd/cdhit cd cdhit make cd cd-hit-auxtools make cd ..编译完执行./cd-hit -h能打印出参数帮助即安装成功。建议把make install默认装到 /usr/local/bin或把目录加入 PATH之后在任何位置直接敲cd-hit。系统要求最低配置推荐配置操作系统Linux/UnixUbuntu 20.04内存4GB16GBCPU双核8核以上磁盘10GB100GB️ CD-HIT参数怎么调什么场景动哪个与其背参数表不如记住四个问题1. 阈值-c定多严蛋白质常用 0.9~0.95核酸常用 0.95~0.98。调高阈值簇更碎、保留更多序列调低则更激进地去冗余。2.-n要和-c配套。短词过滤只在一定阈值区间有效-n必须落在对应区间内序列类型-n可用 -c 区间蛋白质50.7 ~ 1.0蛋白质4 / 3 / 20.6~0.7 / 0.5~0.6 / 0.4~0.5核酸10~11 / 8~90.95~1.0 / 0.90~0.953. 跑多快、占多少内存-T设线程数别超物理核心-M以 MB 限定内存常用 4000~32000。4. 结果留什么信息-d 0表示序列名截到第一个空格为止默认想保留完整 FASTA 头就把-d设为头长。-s控制短序列需占长序列的最小比例0.7~0.9-aL控制比对长度占长序列的比例0.5~0.8两者都是防误并入的刹车。 三个高频场景实战蛋白质库去冗余——标准流程cd-hit -i uniprot_sprot.fasta -o uniprot_nr -c 0.9 -n 5 -T 8 -M 16000 -d 0 -s 0.8转录本/EST 聚类——换用cd-hit-est默认 k-mer 为 10cd-hit-est -i transcripts.fasta -o est_clusters -c 0.95 -n 10 -T 4 -M 8000 -aS 0.916S rRNA 打 OTU——项目内自带 Miseq 流程脚本直接对 fastq 跑perl usecases/Miseq-16S/cd-hit-otu-miseq-PE.pl -i sample.fastq -r ref_16s.fasta -o otu_result -c 0.97百万级以上数据的分阶段策略先粗后细两遍聚类即可第一遍低阈值压规模第二遍高阈值精修cd-hit -i large_db.fasta -o stage1 -c 0.85 -n 5 -T 12 -M 24000 cd-hit -i stage1 -o final_clusters -c 0.95 -n 5 -T 8 -M 16000新数据入库不必重跑全库用cd-hit-2d与现有数据库比对即可多机环境可用cd-hit-para.pl把输入切成--S段并行提交。内存紧张时降到-M 4000 -T 8 -l 100 -s 0.9靠-l过滤短序列省内存。 踩坑速查症状→原因→解法症状常见原因解法报 memory allocation failed-M超过实际可用内存调低-M加-l过滤短序列改分阶段聚类簇数明显偏多或偏少阈值与数据不匹配按蛋白 0.9~0.95 / 核酸 0.95~0.98 重设-c用-aL收紧比对长度检查输入是否混入非目标序列百万级序列跑不动并行不足或序列冗余过高-T提到核心数-n适当调大如蛋白用 6预处理剔除低复杂度序列蛋白相似度低于 40% 聚不动短词过滤在低阈值下失效属算法边界改用同包的psi-cd-hit代表序列 ID 被截断默认-d 0只取第一个词需要完整标识时设置更大的-d值 进阶路径与延伸资源聚类结果的后处理基本靠项目内自带的 Perl 脚本脚本用途clstr_rep.pl从 .clstr 提取代表序列 FASTAclstr_size_stat.pl统计簇大小分布clstr2tree.pl把簇层级转成进化树文件clstr_quality_eval.pl评估聚类质量clstr_size_histogram.pl画簇大小直方图plot_2d.pl绘制二维聚类散点图深入阅读建议按此顺序用户手册、用户手册源文、16S rRNA 案例、并行脚本cd-hit-para.pl。算法细节索引表、短词统计在手册的 Algorithm 一节有完整推导。随着测序读长和多组学整合需求增长CD-HIT 系列仍在持续更新关注 更新日志 即可。引用说明使用 CD-HIT 发表成果时请引用Li W, Godzik A. CD-HIT: a fast program for clustering and comparing large sets of protein or nucleotide sequences. Bioinformatics. 2006.【免费下载链接】cdhitAutomatically exported from code.google.com/p/cdhit项目地址: https://gitcode.com/gh_mirrors/cd/cdhit创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表