Fixed compression to happen at concatenation to save cpu time -> per-pod5-files are deleted anyways, so storage is not a concern.
This commit is contained in:
@@ -38,7 +38,7 @@ rule basecall_pod5:
|
||||
pod5='../data/raw_pod5/PBK98658_853a956f_57f83f46_{batch}.pod5',
|
||||
model=get_model_requirement
|
||||
output:
|
||||
'../data/basecalled_reads/{model}/PBK98658_853a956f_57f83f46_{batch}.fastq.gz'
|
||||
temp('../data/basecalled_reads/{model}/PBK98658_853a956f_57f83f46_{batch}.fastq')
|
||||
threads:
|
||||
32
|
||||
resources:
|
||||
@@ -52,12 +52,12 @@ rule basecall_pod5:
|
||||
model="hac|fast"
|
||||
shell:
|
||||
"""
|
||||
dorado basecaller --models-directory {config[dorado_model_dir]} --emit-fastq {params.benchmarking} {params.min_qscore} {params.dorado_model} {input.pod5} | gzip -c > {output}
|
||||
dorado basecaller --models-directory {config[dorado_model_dir]} --emit-fastq {params.benchmarking} {params.min_qscore} {params.dorado_model} {input.pod5} > {output}
|
||||
"""
|
||||
|
||||
rule concatenate_basecalled_fastq:
|
||||
input:
|
||||
expand('../data/basecalled_reads/{{model}}/PBK98658_853a956f_57f83f46_{batch}.fastq.gz',batch=range(1,config["pod5_dataset_size"]+1,config["pod5_stride"]))
|
||||
expand('../data/basecalled_reads/{{model}}/PBK98658_853a956f_57f83f46_{batch}.fastq',batch=range(1,config["pod5_dataset_size"]+1,config["pod5_stride"]))
|
||||
output:
|
||||
'../data/basecalled_reads/{model}.fastq.gz'
|
||||
threads: 1
|
||||
@@ -65,7 +65,7 @@ rule concatenate_basecalled_fastq:
|
||||
model="hac|fast"
|
||||
shell:
|
||||
"""
|
||||
zcat {input} > {output}
|
||||
cat {input} | gzip -c > {output}
|
||||
"""
|
||||
|
||||
rule align_reads_to_reference:
|
||||
|
||||
Reference in New Issue
Block a user