#!/usr/bin/env bash

testnum=10000
seahorse_genome="../../../data/source_data/RNA_seq/seahorse/GCA_001891065.1_H_comes_QL1_v1_genomic.fna"
rainbow_genome="../../../data/source_data/RNA_seq/rainbow_trout/CCAF010000001-CCAF010192415.fasta"
seahorse_dir="../../../data/processing_data/Real_data/seahorse"
rainbow_dir="../../../data/processing_data/Real_data/rainbow"

mkdir ${seahorse_dir}
gffread -T ${seahorse_dir}/merged_no_G_0.gtf -g ${seahorse_genome} -w ${seahorse_dir}/merged_no_G_0.fa
../7.Misc/illegal_filter2.py ${seahorse_dir}/merged_no_G_0.fa > ${seahorse_dir}/merged_no_G.fa
../7.Misc/subset_fasta.py ${seahorse_dir}/merged_no_G.fa -l 200 -n ${testnum} --row_len 0 -o ${seahorse_dir}/merged_no_G.fasta
transeq -frame F ${seahorse_dir}/merged_no_G.fasta ${seahorse_dir}/merged_no_G.pf.fasta
#prepare gtf
cat ${seahorse_dir}/merged_no_G.fasta | grep ">" | cut -d '>' -f2 | cut -d '|' -f1 >${seahorse_dir}/merged_no_G.txt
cat ${seahorse_dir}/merged_no_G_0.gtf | awk '$3!~/transcript/{print}'| grep -v "#" |cgat gtf2gtf -m filter --filter-method=transcript --map-tsv-file=${seahorse_dir}/merged_no_G.txt |grep -v "#" > ${seahorse_dir}/merged_no_G.gtf

mkdir ${rainbow_dir}
gffread -T ${rainbow_dir}/merged_no_G_0.gtf -g ${rainbow_genome} -w ${rainbow_dir}/merged_no_G_0.fa
../7.Misc/illegal_filter2.py ${rainbow_dir}/merged_no_G_0.fa > ${rainbow_dir}/merged_no_G.fa
../7.Misc/subset_fasta.py ${rainbow_dir}/merged_no_G.fa -l 200 -n ${testnum} --row_len 0 -o ${rainbow_dir}/merged_no_G.fasta
transeq -frame F ${rainbow_dir}/merged_no_G.fasta ${rainbow_dir}/merged_no_G.pf.fasta
#prepare gtf
cat ${rainbow_dir}/merged_no_G.fasta | grep ">" | cut -d '>' -f2 | cut -d '|' -f1 >${rainbow_dir}/merged_no_G.txt
cat ${rainbow_dir}/merged_no_G_0.gtf | awk '$3!~/transcript/{print}'| grep -v "#" |cgat gtf2gtf -m filter --filter-method=transcript --map-tsv-file=${rainbow_dir}/merged_no_G.txt |grep -v "#" > ${rainbow_dir}/merged_no_G.gtf
