Output Files Reference¶
Complete guide to understanding pipeline outputs.
Directory Structure¶
results/
├── {sample_id}/
│ ├── boltzgen/ or complexa/ # Design outputs (depends on tool)
│ ├── proteinmpnn/ # Sequence optimization
│ ├── boltz2/ # Structure prediction (refolding)
│ ├── ipsae/ # Interface scoring
│ ├── prodigy/ # Affinity prediction
│ ├── foldseek/ # Structural search
│ └── consolidated/ # Combined metrics report
└── pipeline_info/
Design Tool Outputs¶
BoltzGen Outputs (default)¶
Description: Generated protein designs in PDB format from BoltzGen.
Complexa Outputs¶
Description: Generated protein designs from Proteina-Complexa.
:material-protein: ProteinMPNN Outputs¶
results/{sample}/proteinmpnn/
├── sequences/ # Optimized FASTA sequences
│ ├── design_1.fa
│ └── ...
└── scores/ # ProteinMPNN scores
├── design_1_scores.txt
└── ...
Description: Sequence optimization results — optimized amino acid sequences for each generated structure.
Boltz-2 Outputs¶
results/{sample}/boltz2/
├── structures/ # Predicted CIF structures
│ ├── design_1.cif
│ └── ...
├── confidence/ # Confidence scores (JSON)
│ ├── design_1_confidence.json
│ └── ...
└── npz/ # PAE NPZ files
├── design_1.npz
└── ...
Description: Structure prediction (refolding) results from Boltz-2, validating whether optimized sequences fold into the intended structure.
PRODIGY Outputs¶
Description: Complete PRODIGY output with binding affinity predictions including ΔG and Kd values.
ipSAE Outputs¶
Description: Interface scoring results measuring quality of the protein-protein interface.
Foldseek Outputs¶
Description: Structural similarity search results against known protein structures.
Consolidated Outputs¶
results/{sample}/consolidated/
├── consolidated_metrics.csv # Combined metrics for all designs
└── consolidated_report.html # Interactive HTML report
Description: Combined report merging all analysis module scores into a single ranked table for easy comparison.
Pipeline Info¶
Execution Report¶
Description: Interactive HTML report with: - Pipeline execution summary - Resource usage statistics - Process completion status - Error reports
Execution Timeline¶
Description: Visual timeline of process execution.
Execution Trace¶
Format: TSV file with detailed process information:
task_id hash native_id name status exit submit duration realtime %cpu rss vmem
1 ab/cd12 12345 COMPLEXA_RUN COMPLETED 0 2024-01-15 10:00:00 1h 23m 1h 21m 95.2% 16.2 GB 24.1 GB
File Formats¶
CIF Files¶
Description: Crystallographic Information File format
Usage:
YAML Files¶
Description: Design specifications
Example:
name: design1
target:
structure: target.pdb
residues: [10, 11, 12]
designed:
chain_type: protein
length: [60, 100]
CSV Files¶
Description: Comma-separated analysis results
Usage:
Result Organization¶
By Sample¶
All outputs for each sample grouped together:
By Analysis Type¶
Within each sample, organized by analysis:
{sample}/
├── complexa/ # Primary designs
├── prodigy/ # Binding affinity
└── ipsae/ # Interface scoring
Accessing Results¶
Command Line¶
# List all design structures
find results/ -name "*.pdb" -path "*/boltzgen/*"
# or for Complexa:
find results/ -name "*.pdb" -path "*/complexa/*"
# View consolidated metrics
cat results/*/consolidated/consolidated_metrics.csv | column -t -s,
# Count successful designs
find results/ -name "design_*.pdb" | wc -l
Python¶
from pathlib import Path
import pandas as pd
# Load consolidated metrics
results = []
for csv in Path('results').rglob('consolidated_metrics.csv'):
df = pd.read_csv(csv)
results.append(df)
combined = pd.concat(results)
print(combined.nsmallest(10, 'prodigy_delta_g'))
R¶
library(tidyverse)
# Load consolidated metrics
results <- list.files(
"results",
pattern = "consolidated_metrics.csv",
recursive = TRUE,
full.names = TRUE
) %>%
map_df(read_csv)
# Analyze — find top designs by binding affinity
results %>%
arrange(prodigy_delta_g) %>%
head(10)
Quality Control¶
Check Completion¶
# Verify all samples completed
grep "COMPLETED" results/pipeline_info/execution_trace.txt | \
wc -l
# Check for failures
grep "FAILED" results/pipeline_info/execution_trace.txt
Validate Outputs¶
# Ensure all expected output directories exist
for sample in sample1 sample2; do
if [ ! -d "results/${sample}/consolidated" ]; then
echo "Missing consolidated results for ${sample}"
fi
done
Export Results¶
Archive for Publication¶
# Create archive of final results
tar -czf protein_designs.tar.gz \
results/*/complexa/final_ranked_designs/ \
results/*/prodigy/*_summary.csv \
results/pipeline_info/execution_report.html
Upload to Repository¶
Next Steps¶
Reproducibility
Always save the execution report and trace files for reproducibility and troubleshooting.