突变体库测序结果检查流程。

Code: Monica-Gao/mutlib-mapping

Run

首次运行,请检查 Preparation 部分

1
2
3
# Make sure all files are prepared, especially the seq-results:
conda activate mutlib
bash b1224.sh

Results

Quick check: 只需要看 filtered_bed.csv 即可,查看对应的 gene_name

  • filtered_bed.csv 没有显示查询序列片段自身是哪里比对上基因组的,通常我们希望是 150bp 左右开始比对上,目前只能先结合 blast 的结果 merged_results.csv,看一下这个 Query_start 的位置是不是在 150 左右,blast的结果文件提供了很多重要的信息,仅仅是没有基因注释
  • 有蛋白的会有两行注释,第二行是蛋白

Careful check: 生成的结果文件说明:

  • filtered_bed.csv: 筛选的注释后的比对结果, overlap > 450
  • annotated_bed.csv:未筛选的注释后的比对结果
  • merged_results.csv: blast的结果
    • results/ 是blast 的单个比对结果所在文件夹

Preparation

创建一个作为本次比对项目位置的空文件夹, 进入该文件夹所在路径

1
2
mkdir -p bn-1224
cd bn-1224

准备好脚本, 33277 基因组相关文件

1
2
3
4
cp /home/gmq/files-for-mutlib/blastn-map.py blastn-map.py
cp /home/gmq/files-for-mutlib/b1224.sh b1224.sh
cp /home/gmq/files-for-mutlib/genomic.gff genomic.gff
cp -r /home/gmq/files-for-mutlib/genome-33277/ .

准备生工的测序结果文件,只需要 .fasta 序列文件

1
2
3
4
5
mkdir -p seq-results
# cd seq-results
# Remember to copy your FASTA results here

# You might find that the files in this folder will be renamed after running. You can just ignore this, as it's a temporary solution for some bugs. Whatever, it works.

检查项目文件夹已准备好, 该项目文件夹内递归输出有这些子文件,准备完成:

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
ls -R

.:
b1224.sh blastn-map.py genome-33277 genomic.gff seq-results

./genome-33277:
GCF_000010505.1_ASM1050v1_genomic_db.ndb
GCF_000010505.1_ASM1050v1_genomic_db.nhr
GCF_000010505.1_ASM1050v1_genomic_db.nin
GCF_000010505.1_ASM1050v1_genomic_db.njs
GCF_000010505.1_ASM1050v1_genomic_db.not
GCF_000010505.1_ASM1050v1_genomic_db.nsq
GCF_000010505.1_ASM1050v1_genomic_db.ntf
GCF_000010505.1_ASM1050v1_genomic_db.nto
GCF_000010505.1_ASM1050v1_genomic.fna

./seq-results:
0001_31424121301174_(18C)_[SAMSeq-2].fasta
... ... ...
0015_31424121301188_(29J)_[SAMSeq-2].fasta

准备运行所需要的 conda 环境

1
2
cp /home/gmq/files-for-mutlib/mulib_environment_241224.txt .
conda create -n mutlib --file mulib_environment_241224.txt