Fixed compression to happen at concatenation to save cpu time -> per-pod5-files are deleted anyways, so storage is not a concern.

This commit is contained in:
Tom Kasper
2026-09-19 09:19:23 +01:00
parent 15c56b9ffb
commit 3b93ceaf6e
+4 -4
View File
@@ -38,7 +38,7 @@ rule basecall_pod5:
pod5='../data/raw_pod5/PBK98658_853a956f_57f83f46_{batch}.pod5', pod5='../data/raw_pod5/PBK98658_853a956f_57f83f46_{batch}.pod5',
model=get_model_requirement model=get_model_requirement
output: output:
'../data/basecalled_reads/{model}/PBK98658_853a956f_57f83f46_{batch}.fastq.gz' temp('../data/basecalled_reads/{model}/PBK98658_853a956f_57f83f46_{batch}.fastq')
threads: threads:
32 32
resources: resources:
@@ -52,12 +52,12 @@ rule basecall_pod5:
model="hac|fast" model="hac|fast"
shell: shell:
""" """
dorado basecaller --models-directory {config[dorado_model_dir]} --emit-fastq {params.benchmarking} {params.min_qscore} {params.dorado_model} {input.pod5} | gzip -c > {output} dorado basecaller --models-directory {config[dorado_model_dir]} --emit-fastq {params.benchmarking} {params.min_qscore} {params.dorado_model} {input.pod5} > {output}
""" """
rule concatenate_basecalled_fastq: rule concatenate_basecalled_fastq:
input: input:
expand('../data/basecalled_reads/{{model}}/PBK98658_853a956f_57f83f46_{batch}.fastq.gz',batch=range(1,config["pod5_dataset_size"]+1,config["pod5_stride"])) expand('../data/basecalled_reads/{{model}}/PBK98658_853a956f_57f83f46_{batch}.fastq',batch=range(1,config["pod5_dataset_size"]+1,config["pod5_stride"]))
output: output:
'../data/basecalled_reads/{model}.fastq.gz' '../data/basecalled_reads/{model}.fastq.gz'
threads: 1 threads: 1
@@ -65,7 +65,7 @@ rule concatenate_basecalled_fastq:
model="hac|fast" model="hac|fast"
shell: shell:
""" """
zcat {input} > {output} cat {input} | gzip -c > {output}
""" """
rule align_reads_to_reference: rule align_reads_to_reference: