新闻详情

新闻详情

首页 / 资讯中心 / 详情

umi_tools使用

发布时间:2026/9/30 1:40:30来源:尧图网络
umi_tools使用
首先保存两个网址umi_tools github网址https://github.com/CGATOxford/UMI-toolsumi_tools 官方网址https://umi-tools.readthedocs.io/en/latest/1. 提取UMI信息到readnameumi_tools extract --bc-patternNNNNNNN --bc-pattern2NNNNNNN \ -I ./V300056107_L01_1069_1.fq.gz \ -S ./test.extract.reconcile.1.pe_1.fq \ --read2-in./V300056107_L01_1069_2.fq.gz \ --read2-out./test.extract.reconcile.1.pe_2.fq \ --ignore-read-pair-suffixes还可以加一个“--reconcile-pairs”如果是在rawdata处开始做 extract的时候这个是没必要的。报错1.Read pairs do not matchF300002275L1C001R0030000002/1 ! F300002275L1C001R0030000002/2这种不是真正的不匹配而是umi_tools的一个bug。可以用 --ignore-read-pair-suffixes 参数来忽略 “/”及以后的内容。通过master branch 安装的umi_tools有这个“--ignore-read-pair-suffixes”参数原来那个umi_tools的问题是这个工具与相应的python版本不对应的问题。https://github.com/CGATOxford/UMI-tools/issues/431 #这是umi_tools项目组成员的解答报错2. 如果出现Read pairs do not matchF300002275L1C001R0030000005 ! F300002275L1C001R0030000013说明这是fq1和fq2里面的reads不是一一对应的readname也对应不上。它在输出文件中只会输出配对的reads处理后的结果其他不配对的全都在标准错误中输出。这时候可以加“--reconcile-pairs”这样就允许read1和read2中的read name不匹配。问题3umi_tools 跑得太慢的问题https://github.com/CGATOxford/UMI-tools/issues/257解决方法是 输出文件不要加“.gz”格式后缀。我试过加了gz后缀耗时8小时左右不加差不多40分钟。我从一开始用python2然后换到python3.7 最后换到python3.6CTTGCAAGTCACTAGAGTGGTGCAGCCTATTTTTTAAAAGTCGTGTGTGTCCTCTTACCCAGTACTTCCTCTTCATATGCACCTTCCGCGCTGCTACAGCCTTGCATTTACTGCAGGGGAAATAGTTGACATAAAGATGTACTTGCGTATTAGGCACTCCGATTTCAAAGATTTACTCGTATATTGGTCAAAGATATACTF300002275L1C001R0030000002/1_CTTGCAACTTGCATGTCACTAGAGTGGTGCAGCCTATTTTTTAAAAGTCGTGTGTGTCCTCTTACCCAGTACTTCCTCTTCATATGCACCTTCCGCGCTGCTACAGCF300002275L1C001R0030000002/2_CTTGCAACTTGCATTTACTGCAGGGGAAATAGTTGACATAAAGATGTACTTGCGTATTAGGCACTCCGATTTCAAAGATTTACTCGTATATTGGTCAAAGATATACT2. 去低质量、含Nreads mapping, sort, index 略3. dedup 类似picard的markdupumi_tools dedup -I ./test.coordinate.sort.bam \ --output-statsdeduplicated \ -S ./test.marked_duplicates.directional.bam \ --method directional --paired注 --method 参数有5种可选值作者认为directional是最好的https://github.com/CGATOxford/UMI-tools/issues/435--paired 参数对于PE reads来说必不可少否则它会只输出read2不输出read1.dedup太慢解决方法https://github.com/CGATOxford/UMI-tools/issues/340The biggest thing you can do here to improve things is not generate the stats #也就是不要--output-statsdeduplicated 这个参数。结果比较coordinate.sort.bam 38078276 #before_dedupmarked_duplicates.adjacency.bam 35220427 #adjacencymarked_duplicates.cluster.bam 35219515 #clustermarked_duplicates.directional.bam 35219616 #directional作者团队成员推荐这个marked_duplicates.percentile.bam 35483003 #percentilemarked_duplicates.unique.bam 35483001 #uniquemarked_duplicates.picard.bam 34350858 #picardUMI序列设置In the default basic mode we specify the location of barcodes and UMIs in a read using a simple string.Ns specify the location of bases to be treated as UMIs,Cs as bases to treated as cell barcode andXs as bases that are neither and that should be retained on the read. By default this pattern is applied to the 5’ end of the read, but we can tellextractto look on the 3’ end of the read using--3-primehttps://umi-tools.readthedocs.io/en/latest/regex.html一个extract的例子umi_tools extract \ --extract-method string \ --bc-patternNNNNNNN \ --bc-pattern2NNNNNNN \ -I /in_dir/F350071577_L01_23_1.part_001.fq.gz \ -S /out_dir/extract.1.pe_1.fq \ --read2-in/in_dir/F350071577_L01_23_2.part_001.fq.gz \ --read2-out/out_dir/extract.2.pe_2.fq \ --ignore-read-pair-suffixes用正则表达式更好可以区分UMI和容错碱基不将容错碱基错误纳入UMI。umi_tools extract \ --extract-method regex \ --bc-pattern^(?Pumi_1.{6})(?Pdiscard_1.{1})(.*)$ \ --bc-pattern2^(?Pumi_2.{6})(?Pdiscard_2.{1})(.*)$ \ -I /in_dir/F350071577_L01_23_1.part_001.fq.gz \ -S /out_dir/extract.1.pe_1.fq \ --read2-in/in_dir/F350071577_L01_23_2.part_001.fq.gz \ --read2-out/out_dir/extract.2.pe_2.fq \ --ignore-read-pair-suffixes注意umi_1discard_1之类的前缀不能变数字可以递增。但在PE reads条件下umi_1只能针对read_1, umi_2针对read_2, discard_*也是同理。umi_*的序列进入read_name从read序列和质量值序列(对应长度)删除。discard_*的序列直接丢弃不进入read_name从read序列和质量值序列(对应长度)删除。其他匹配内容拼接并保留到read序列和质量值序列(对应长度)中。
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

tldr 页面的 See also 相关命令引用规范:多语言翻译模板与自动同步实现 2026/9/30 2:28:28

tldr 页面的 See also 相关命令引用规范:多语言翻译模板与自动同步实现

文档教程知识库 【免费下载链接】tldr Collaborative cheatsheets for console commands 📚. 项目地址: https://gitcode.com/GitHub_Trending/tl/tldr 点击查看 免费下载 本文围绕 tldr 社区约定的 "See also"(另请参阅&#xff…

阅读更多 →
ReAct 到底是什么?从 Thought、Action、Observation 看 Agent 怎么工作 2026/9/30 2:28:28

ReAct 到底是什么?从 Thought、Action、Observation 看 Agent 怎么工作

🔒 关注后看全文 本文详细解析了 ReAct 框架的核心原理、实现机制和工程实践。为了获得更好的阅读体验,建议先关注作者,然后继续阅读完整内容。 关注后可以:1)查看完整技术细节;2)获取代码示例&…

阅读更多 →
合规咨询。 2026/9/30 2:28:28

合规咨询。

深耕国内财税服务领域,依托由资深税务师、注册会计师组成的专业实务团队,专注企业全维度合规经营体系搭建,始终以专业立本、以合规为纲,致力于成为各类企业发展路上可信赖的财税合规战略伙伴。 以专业税务能力为核心依托&#xff…

阅读更多 →
C语言函数指针三种定义方式与核心应用详解 2026/9/30 2:28:28

C语言函数指针三种定义方式与核心应用详解

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

阅读更多 →
Buzz 本地语音转文字:离线转写一条录音并导出可用字幕 2026/9/30 2:28:28

Buzz 本地语音转文字:离线转写一条录音并导出可用字幕

Buzz 本地语音转文字:离线转写一条录音并导出可用字幕 【免费下载链接】buzz Buzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper. 项目地址: https://gitcode.com/GitHub_Trending/buz/buzz Buzz 是一款…

阅读更多 →
MySQL常用操作 2026/9/30 2:28:22

MySQL常用操作

第1关:创建数据表并插入数据任务描述 本关任务:创建emp表,并向表中插入数据。相关知识 创建表结构CREATE TABLE 创建 MySQL 数据表需要以下信息:表名表字段名定义每个表字段以下为创建 MySQL 数据表的通用 SQL 语法:CR…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞 ✉