Skip to content

Commit 54269dc

Browse files
karini925claude
andcommitted
Drop unused sequence columns from insert/site summarization to fix OOM
The summarize_inserts and generate_seq_summary processes load insert_seq and site_seq columns (full DNA strings) that are never used downstream. With 22 samples this exceeds 18GB memory. Only read_id and length columns are needed for the barplot and seq_summary calculations. Co-Authored-By: Claude Opus 4.6 (1M context) <noreply@anthropic.com>
1 parent 41b1161 commit 54269dc

1 file changed

Lines changed: 3 additions & 3 deletions

File tree

bin/summarize_and_plot.py

Lines changed: 3 additions & 3 deletions
Original file line numberDiff line numberDiff line change
@@ -111,10 +111,10 @@ def concatenate_files(file_map, summary_type, output_file, save_file=True):
111111

112112
if summary_type == 'insert':
113113
print(f'Processing {val} for sample {key}')
114-
df = pd.read_table(val, names=['read', 'insert_seq', 'insert_len'], usecols=[0, 1, 3], engine='c', quoting=csv.QUOTE_NONE, sep="\t")
114+
df = pd.read_table(val, names=['read', 'insert_len'], usecols=[0, 3], engine='c', quoting=csv.QUOTE_NONE, sep="\t")
115115

116116
if summary_type == 'sites':
117-
df = pd.read_table(val, names=['read', 'site_seq', 'site_len'], usecols=[0, 1, 3], engine='c',
117+
df = pd.read_table(val, names=['read', 'site_len'], usecols=[0, 3], engine='c',
118118
quoting=csv.QUOTE_NONE, sep="\t")
119119
if summary_type == 'insert_coverage':
120120
cov = pd.read_table(val, header=None, engine='c', sep="\t")
@@ -231,7 +231,7 @@ def process(sample_file_map, summary_type, **kwargs):
231231
plot_copy_number(concatenated_df)
232232

233233
case 'insert_histogram':
234-
df = pd.read_table(sample_file_map, names=['read', 'insert_seq', 'insert_len'], usecols=[0, 1, 3], engine='c', quoting=csv.QUOTE_NONE, sep="\t")
234+
df = pd.read_table(sample_file_map, names=['read', 'insert_len'], usecols=[0, 3], engine='c', quoting=csv.QUOTE_NONE, sep="\t")
235235
plot_insert_length_histogram(df)
236236
case 'insert':
237237
concatenated_df = concatenate_files(sample_file_map, summary_type, None, False)

0 commit comments

Comments
 (0)