Index
Parvotec Projekt
Parvotec entwickelt einen AAV-Vektor mit nozizeptiven Neuronen-Tropismus für die Schmerztherapie. Ein 4-schichtiges Machine Learning Framework nutzt ESM-2 Protein Language Models für optimale Kandidaten-Discovery.
Projektgoal
Entwicklung eines AAV-Vektors mit nozizeptiven Neuronen-Tropismus und retrogradem Transport für die Schmerztherapie an peripheren Nervenendigungen.
Klinischer Hintergrund: Chronische Schmerzen sind eine der häufigsten Erkrankungen weltweit. Traditionelle Analgetika (Morphin, NSAIDs) haben schwerwiegende Nebenwirkungen. Ein therapeutischer AAV könnte langfristige Schmerzreduktion durch genetische Modulation der Schmerzperzeption ermöglichen (z.B. durch Abschaltung von TRPV1-Kanälen oder Überexpression von Analgetika-Neuropeptiden).
Das 4-Schicht-ML-Framework
| Schicht | Technologie | Funktion |
|---|---|---|
| 1. Embedding | ESM-2 / ESM-3 | AAV-Capsid-Sequenzen → 1280/2560-dim kontextabhängige Vektoren. Ersetzt handcrafted Protein-Features. |
| 2. Predictor | Supervised NN | Multi-task Fitness-Vorhersage: Tropismus, Yield, Stabilität, Immunogenizität |
| 3. Generator | cVAE | Sequenzgenerierung unter Zielspezifikationen mit Latent Space Interpolation |
| 4. Optimizer | Multi-objective BO | Pareto-optimale Kandidaten über Tropismus/Yield/Stabilität/Immunogenizität |
Warum 4 Schichten? Ablauf der Datenverarbeitung
Naive Herangehensweise: "Testen Sie alle 10^120 möglichen AAV-Sequenzen" – unmöglich.
Parvotec Ansatz: Nutze ML um intelligente Vorhersagen zu treffen, reduziere Suchraum von 10^120 auf ~500 testbare Kandidaten pro Iteration.
- Schicht 1 (Embedding): Konvertiere jede AAV-Kandidaten-Sequenz in einen 1280-dim Vektor via ESM-2. ESM-2 wurde auf 33 Millionen natürliche Proteinsequenzen trainiert → "versteht" Protein-Chemie und biologische Muster.
- Schicht 2 (Predictor): Übersetze den Vektor in biologische Properties. Ein NN trainiert auf der Evotec Deep Mutational Scan Library (>1 Million getesteter AAV-Varianten) lernt: "Wenn ein Embedding diese Features hat, wird der Tropismus ~0.85 sein, Yield ~0.8".
- Schicht 3 (Generator): Erzeuge neue Kandidaten mit spezifizierten Zielen. cVAE lernt die Verteilung von Sequenzen mit hohem Tropismus, und generiert neue (biologisch plausible) Sequenzen in dieser Verteilung.
- Schicht 4 (Optimizer): Wähle beste Kandidaten aus 200 Generierungen. Multi-objective BO balanciert: "Ich möchte hohes Tropismus UND hohen Yield UND hohe Stabilität" → findet Pareto-Front (unverdominierte Kompromisse).
Iterativer Optimierungsprozess
Der Workflow über 3-4 Runden:
- Round 0 (Baseline): Wild-Type AAV (z.B. AAV2 oder AAV6) wird gescreent. Baseline Tropismus Score = 0.3
- Round 1: Evotec DMS Library wird mittels NGS analysiert. ESM-2 encodiert alle ~1 Million Varianten. NN trainiert auf Enrichment Scores. Top-100 theoretische Kandidaten werden experimentell validiert → beste Variante hat Tropismus ~0.55 (1.8× besser)
- Round 2: cVAE trainiert auf Round 1 Daten + Public DMS Daten. Generiert 500 neue Sequenzen mit Ziel: Tropismus>0.7, Yield>0.8. Bayesian BO wählt beste 50 aus. Round 2 Beste: Tropismus 0.72 (2.4× besser)
- Round 3: Multi-objective BO konvergiert. Optimiert jetzt Tropismus × Yield × Stabilität × Immunogenizität gleichzeitig. Pareto-Front umfasst 10-20 non-dominated Kandidaten. Best-in-Class: Tropismus 0.88, Yield 0.90, Stabilität 0.85 (2.9× besser, in allen Metriken optimiert)
Improvement Multiplier: 0.3 → 0.88 = ~3× Verbesserung in Tropismus allein. Mit vollständiger multi-objective Optimierung: 5-10× Gesamtverbesserung erschließbar.
Parvotec develops an AAV vector with nociceptive neuron tropism for pain therapy. A 4-layer machine learning framework leverages ESM-2 protein language models for optimal candidate discovery.
Project Goal
Development of an AAV vector with nociceptive neuron tropism and retrograde transport for pain therapy at peripheral nerve endings.
Clinical background: Chronic pain is one of the most common diseases worldwide. Traditional analgesics (morphine, NSAIDs) have severe side effects. A therapeutic AAV could enable long-term pain reduction through genetic modulation of pain perception (e.g., by silencing TRPV1 channels or overexpressing analgesic neuropeptides).
The 4-Layer ML Framework
| Layer | Technology | Function |
|---|---|---|
| 1. Embedding | ESM-2 / ESM-3 | AAV capsid sequences → 1280/2560-dim context-dependent vectors. Replaces handcrafted protein features. |
| 2. Predictor | Supervised NN | Multi-task fitness prediction: tropism, yield, stability, immunogenicity |
| 3. Generator | cVAE | Sequence generation with target specifications and latent space interpolation |
| 4. Optimizer | Multi-objective BO | Pareto-optimal candidates across tropism/yield/stability/immunogenicity |
Why 4 Layers? Data Processing Flow
Naive approach: "Test all 10^120 possible AAV sequences" – impossible.
Parvotec approach: Use ML to make intelligent predictions, reduce search space from 10^120 to ~500 testable candidates per iteration.
- Layer 1 (Embedding): Convert each AAV candidate sequence to 1280-dim vector via ESM-2. ESM-2 trained on 33 million natural protein sequences → "understands" protein chemistry and biological patterns.
- Layer 2 (Predictor): Translate vector to biological properties. NN trained on Evotec deep mutational scan library (>1 million tested AAV variants) learns: "If embedding has these features, tropism will be ~0.85, yield ~0.8".
- Layer 3 (Generator): Generate new candidates with specified targets. cVAE learns distribution of high-tropism sequences and generates new (biologically plausible) sequences in that distribution.
- Layer 4 (Optimizer): Select best candidates from 200 generations. Multi-objective BO balances: "I want high tropism AND high yield AND high stability" → finds Pareto front (undominated trade-offs).
Iterative Optimization Process
Workflow across 3-4 rounds:
- Round 0 (Baseline): Wild-type AAV (e.g., AAV2 or AAV6) screened. Baseline tropism score = 0.3
- Round 1: Evotec DMS library analyzed via NGS. ESM-2 encodes all ~1 million variants. NN trained on enrichment scores. Top-100 theoretical candidates experimentally validated → best variant tropism ~0.55 (1.8× better)
- Round 2: cVAE trained on Round 1 data + public DMS data. Generates 500 new sequences with target: tropism>0.7, yield>0.8. Bayesian BO selects best 50. Round 2 best: tropism 0.72 (2.4× better)
- Round 3: Multi-objective BO converges. Now optimizes tropism × yield × stability × immunogenicity simultaneously. Pareto front encompasses 10-20 non-dominated candidates. Best-in-class: tropism 0.88, yield 0.90, stability 0.85 (2.9× better, optimized across all metrics)
Improvement multiplier: 0.3 → 0.88 = ~3× improvement in tropism alone. With full multi-objective optimization: 5-10× total improvement achievable.
Iterativer Workflow
Parvotec folgt einem iterativen Optimierungsprozess mit 5-10× Verbesserungen über 3-4 Runden:
- Round 1: ESM-2 Embedding der Basis-Sequenzen
- Round 2: Fitness-Vorhersage mit supervised NN
- Round 3: cVAE-Generierung verbesserter Kandidaten
- Round 4: Bayesian Optimization für Pareto-Front-Kandidaten
- Feedback Loop: Experimentelle Validierung → nächste Round
Parvotec follows an iterative optimization process with 5-10× improvements over 3-4 rounds:
- Round 1: ESM-2 embedding of base sequences
- Round 2: Fitness prediction with supervised NN
- Round 3: cVAE generation of improved candidates
- Round 4: Bayesian optimization for Pareto-front candidates
- Feedback Loop: Experimental validation → next round
Machine Learning Strategien
Supervised Learning für Fitness-Vorhersage
Das Kernproblem: Given eine AAV-Sequenz (oder deren ESM-2 Embedding), vorhersagen: "Wird dieser Vektor nozizeptive Neuronen gut infizieren?"
Datengrundlage: Deep Mutational Scan Library von Evotec mit >1 Million AAV-Varianten. Jede Variante hat einen experimentellen NGS Enrichment Score (0-100+).
Architektur: Feed-Forward Neural Network mit 3-4 Hidden Layers:
- Input Layer: 1280-dim ESM-2 Embedding
- Hidden Layers: 512 → 256 → 128 Neuronen mit ReLU Aktivierung
- Output Layer: 4 Neuronen (Multi-task: Tropismus, Yield, Stabilität, Immunogenizität)
- Loss: Weighted MSE (Ridge Regression) um Overfitting zu vermeiden
Training-Split: 70% Training / 10% Validation / 20% Test. Cross-validation mit 5-Fold um Generalisierungsfähigkeit zu prüfen.
cVAE (Conditional VAE) für Sequenz-Generierung
Problem: Wie generieren wir neue AAV-Sequenzen mit gewünschten Eigenschaften, ohne zufällig Müll zu produzieren?
cVAE Architektur:
- Encoder: Wild-type (WT) Sequenz → 64-dim Latent Vector Z
- Bedingung: Zielvektor C = [Tropismus=0.9, Yield=0.8, ...] → wird mit Z konkateniert
- Decoder: [Z, C] → neue AAV-Sequenz (Amino-Säure Wahrscheinlichkeiten)
- KL-Divergence Loss: Regularisiert den Latent Space für glatte Interpolation
Inference: Spezifiziere Ziele → Decoder generiert Top-10 Sequenzen → Fitness Oracle rankt diese → Top-3 für experimentelle Validierung.
Bayesian Optimization für Multi-Objective Design
Problem: Unendlich viele mögliche Sequenzen, aber nur 100-200 pro Iteration experimentell testbar. Wie wählen wir optimal?
BO Workflow (3 Iterationen):
- Iteration 1 – Initial: Test 50 Random Varianten, Daten sammeln, Surrogate Model trainieren
- Iteration 2 – Guided: Acquisition Function (EHVI) bestimmt beste 50 neuen Kandidaten, Test experimentell, Update Modell
- Iteration 3 – Convergence: Generiere 200 Kandidaten, teste Top-50, Pareto-Front verbessert sich um ~30-50%
Multi-Objective Pareto-Front: 3D Plot (Tropismus vs Yield vs Stabilität). Jeder Punkt ist eine getestete Variante. Pareto-optimal Varianten bilden eine gekrümmte Oberfläche.
Active Learning & Latent Space Traversal
Das System "lernt, was es nicht weiß". Anstatt random zu testen, werden Regionen höchster Unsicherheit priorisiert (60% aus unsicheren Regionen, 40% aus vorhergesagten High-Value Regionen).
Latent Space Interpolation: Zwischen zwei Sequenzen interpolieren im cVAE Latent Space erzeugt "stepping stones" (Zwischenschritte), die biologisch stabiler sind als große Sprünge.
Transfer Learning mit ESM-2/3
Die pretrained ESM Embeddings enthalten biologisches Wissen von 33 Millionen Proteinsequenzen. Wir trainieren nur noch 2-3 obere NN Layers mit Early Stopping um Overfitting zu vermeiden.
Supervised Learning for Fitness Prediction
Core problem: Given an AAV sequence (or its ESM-2 embedding), predict: "Will this vector infect nociceptive neurons well?"
Data foundation: Deep mutational scan library from Evotec with >1 million AAV variants. Each has an experimental NGS enrichment score (0-100+).
Architecture: Feed-forward neural network with 3-4 hidden layers:
- Input layer: 1280-dim ESM-2 embedding
- Hidden layers: 512 → 256 → 128 neurons with ReLU activation
- Output layer: 4 neurons (multi-task: tropism, yield, stability, immunogenicity)
- Loss: Weighted MSE (ridge regression) to prevent overfitting
Training split: 70% training / 10% validation / 20% test with 5-fold cross-validation.
cVAE (Conditional VAE) for Sequence Generation
Problem: How to generate new AAV sequences with desired properties without randomly producing garbage?
cVAE architecture:
- Encoder: Wild-type sequence → 64-dim latent vector Z
- Condition: Target vector C = [tropism=0.9, yield=0.8, ...] → concatenated with Z
- Decoder: [Z, C] → new AAV sequence (amino acid probabilities)
- KL-divergence loss: Regularizes latent space for smooth interpolation
Inference: Specify targets → decoder generates top-10 sequences → fitness oracle ranks → top-3 for experimental validation.
Bayesian Optimization for Multi-Objective Design
Problem: Infinite possible sequences, but only 100-200 testable per iteration experimentally. How to choose optimally?
BO workflow (3 iterations):
- Iteration 1 – Initial: Test 50 random variants, collect data, train surrogate model
- Iteration 2 – Guided: Acquisition function (EHVI) determines best 50 new candidates, test experimentally, update model
- Iteration 3 – Convergence: Generate 200 candidates, test top-50, Pareto front improves ~30-50%
Multi-Objective Pareto Front: 3D plot (tropism vs yield vs stability). Each point is a tested variant. Pareto-optimal variants form a curved surface.
Active Learning & Latent Space Traversal
The system "learns what it doesn't know". Instead of random testing, regions of highest uncertainty are prioritized (60% from uncertain regions, 40% from predicted high-value regions).
Latent space interpolation: Interpolating between two sequences in cVAE latent space produces "stepping stones" that are biologically more stable than large jumps.
Transfer Learning with ESM-2/3
Pre-trained ESM embeddings contain biological knowledge from 33 million protein sequences. We train only 2-3 upper NN layers with early stopping to prevent overfitting.
Wissenschaftliche Basis
Grundlegende Arbeiten
Parvotec basiert auf 14 wissenschaftlichen Publikationen zum AAV-Capsid-Engineering mit Machine Learning:
- Voyager AAV Optimization (ASGCT 2023-2025)
- Deep mutational scanning für Fitness-Landschaften
- ESM-2/ESM-3 Protein Language Models
- Generative models für AAV-Diversifizierung
- Multi-objective Bayesian Optimization
Foundational Work
Parvotec is based on 14 scientific publications on AAV capsid engineering with machine learning:
- Voyager AAV Optimization (ASGCT 2023-2025)
- Deep mutational scanning for fitness landscapes
- ESM-2/ESM-3 protein language models
- Generative models for AAV diversification
- Multi-objective Bayesian optimization
Terminologie & Erklärungen
AAV (Adeno-Associated Virus)
Kleine, nicht-hüllbare DNA-Viren (~27 nm Durchmesser). Das Capsid (die Proteinschale) besteht aus ~60 Kopien der Proteine VP1, VP2, VP3 in präziser stochiometrischer Ratio. Es gibt 13 natürliche Serotypen (AAV1-13) mit unterschiedlichen Tropismen.
Warum AAV? AAV sind sicher (nicht pathogen beim Menschen), können jedoch lange Zeit im Körper bestehen und ihre Gene effizient an Zielzellen abgeben. Sie sind ideal für Gentherapie.
Tropismus (Targeting)
Die zelltypische Infektionsspezifität eines AAV-Vektors. Das bedeutet: welche Zelltypen kann der Vektor infizieren?
Beispiele:
- Leber-Tropismus (AAV8): Bevorzugte Infektion von Hepatozyten → für systemische Therapien
- Muskel-Tropismus (AAV6): Targeting von Skelett- und Herzmuskel
- Nozizeptiver Neuron-Tropismus (Parvotec-Ziel): Targeting von Schmerzfaser-Neuronen in den dorsal root ganglia (DRG)
Mechanismus: Der Tropismus wird durch die Oberflächensequenzen des Capsids (besonders die VP3-Proteine) bestimmt. Diese Sequenzen interagieren mit Rezeptoren auf der Zielzellmembran.
Retrograder Transport
Ein natürliches axonales Transportsystem, das Partikel vom peripheren axonalen Terminal (z.B. Nervenendigungen an den Füßen) zum Zellkörper (z.B. in den DRG im Rückenmark) transportiert.
Warum wichtig für Parvotec? Für Schmerztherapie müssen wir die AAV von der peripheren Nervenendiging (wo der Schmerz empfunden wird) bis zu den Nervenzellkörpern in den DRG transportieren. Das ist eine Distanz von bis zu 1 Meter!
Bestandteile: Der Transport erfolgt über spezialisierte Motorproteine (Dynein, Kinesin) und erfordert aktive Energieversorgung (ATP).
ESM-2 / ESM-3 (Evolutionary Scale Modeling)
Protein Language Models (pLMs) entwickelt von Meta AI. Sie funktionieren ähnlich wie GPT für Text, aber für Proteinsequenzen.
ESM-2: Erzeugt 1280-dimensionale Embeddings (Vektoren), trainiert auf UniRef50 (~33 Millionen Proteinsequenzen). Das bedeutet: jede Proteinsequenz wird in einen hochdimensionalen Raum umgewandelt, wo ähnliche Sequenzen nah beieinander liegen.
ESM-3 (2025): Erweiterte Version mit 2560-Dimensionen und Multi-Modal-Training (Sequenz + Struktur + Funktion integriert).
Vorteil: Ersetzt handcrafted Features (wie "Hydrophobizität", "Ladung", "Sekundärstruktur"). Das Modell lernt direkt aus Milliarden von Beispielen, welche Sequenzmuster biologisch wichtig sind.
Deep Mutational Scanning (DMS)
Eine experimentelle Methode, die systematisch Tausende oder Millionen von Mutationen an einer Proteinsequenz durchführt und deren Effekt auf eine Funktion misst (z.B. "Bindet dieses Protein gut an seinen Rezeptor?").
Workflow:
- Erstelle eine Library mit ~1 Million AAV-Varianten (mit verschiedenen 7-Amino-Säure Insertionen)
- Führe eine biologische Selektion durch (z.B. Infiziere nozizeptive Neuronen)
- Sequenziere mit NGS, welche Varianten überrepräsentiert sind
- Berechne ein "NGS Enrichment Score" für jede Mutation
Outcome: Eine Fitness-Landscape: eine Karte, die zeigt, welche Mutationen tropism-verbessert oder -verschlechtert.
cVAE (Conditional Variational Autoencoder)
Ein generatives neuronales Netzwerk, das neue Proteinsequenzen mit spezifizierten Eigenschaften erzeugen kann.
Wie funktioniert es?
- Encoder: Komprimiert eine Proteinsequenz in einen kontinuierlichen Latent-Vektor (z.B. 64-dimensional)
- Bedingung: Zusätzlich wird ein konditionaler Input gegeben: "Ich möchte 70% Leber-Tropismus + hohe Produktionseffizienz"
- Decoder: Generiert eine neue Sequenz, die diese Ziele erfüllt
- Latent Space Interpolation: Durch Bewegung im Latent-Raum können wir kontinuierlich zwischen Sequenzen interpolieren
Vorteil: Generiert biologisch plausible Sequenzen (trainiert auf realen Proteinen), nicht zufällige Strings.
Bayesian Optimization (BO)
Ein intelligentes Optimierungsframework für Szenarien, wo Evaluationen teuer sind (z.B. experimentelle Validierung kostet Zeit/Geld).
Komponenten:
- Surrogate-Modell: Ein schneller NN oder Gaussian Process, der vorhersagt, wie gut eine Kandidaten-Sequenz ist (ohne echte Experimente)
- Acquisition Function: Z.B. Expected Improvement (EI): "Welche Kandidaten sollten wir als nächstes testen, um die meiste Verbesserung zu erzielen?"
- Iterativ: Test Kandidat → Update Modell → Berechne nächste beste Kandidaten
Multi-Objective BO: Parvotec optimiert mehrere Ziele gleichzeitig: Tropismus (hoch) × Yield (hoch) × Stabilität (hoch) → Finde Pareto-Front (Kandidaten, die nicht von anderen dominiert werden).
7-Mer Insertion
Eine Standardstrategie im AAV-Engineering: Inseriere 7 Aminosäuren-Peptid an einer spezifischen Position (z.B. zwischen VP1-Aminosäure 583-584).
Warum 7 Aminosäuren? Empirisch hat sich diese Länge als optimal erwiesen. Sie ist groß genug, um neue Bindungseigenschaften zu schaffen, aber klein genug, um die Capsid-Struktur nicht zu zerstören.
Parvotec nutzt: Eine Library mit ~1 Million verschiedener 7-Mer-Insertionen (verschiedene Sequenzen an verschiedenen Positionen).
NGS (Next-Generation Sequencing) & Enrichment Score
NGS erlaubt es, Millionen von Sequenzen gleichzeitig zu zählen.
Enrichment Score Berechnung:
Enrichment = (Häufigkeit der Variante NACH Selektion) / (Häufigkeit VOR Selektion)
Beispiel: Eine Variante ist vor der Selektion 1× vorhanden, nach der Selektion 100×. Enrichment Score = 100. Das bedeutet: diese Variante hat gute nozizeptive Neuron-Tropismus.
Pareto-Optimaal
Ein Konzept aus der Multi-Objective Optimization. Eine Lösung ist "Pareto-optimal", wenn sie in mindestens einem Ziel am besten ist, aber in keinem Ziel von einer anderen Lösung dominiert wird.
Beispiel:
- Variante A: Tropismus 90%, Yield 60%, Stabilität 80%
- Variante B: Tropismus 80%, Yield 95%, Stabilität 85%
Beide sind Pareto-optimal (keine dominiert die andere). Die Pareto-Front ist die Menge aller solcher Lösungen.
Fitness Oracle
Das zentrale Machine Learning Modell in Parvotec, das AAV-Sequenzen → Biologische Eigenschaften mappt.
Input: ESM-2/ESM-3 Embeddings einer Proteinsequenz (1280 oder 2560 Dimensionen)
Output: Multi-task Vorhersagen:
- Tropismus Score (Wahrscheinlichkeit, nozizeptive Neuronen zu infizieren)
- Production Efficiency (Wie viele AAV Partikel können produziert werden?)
- Thermostabilität (Wie lange bleibt der Vektor stabil?)
- Immunogenizität (Wieviel Immunreaktion löst der Vektor aus?)
Training: Auf experimentelle Deep Mutational Scan Daten (Evotec-Library mit >1 Million AAV-Capsid-Mutanten).
AAV (Adeno-Associated Virus)
Small, non-enveloped DNA viruses (~27 nm diameter). The capsid (protein shell) consists of ~60 copies of proteins VP1, VP2, VP3 in precise stoichiometric ratios. There are 13 natural serotypes (AAV1-13) with different tropisms.
Why AAV? AAVs are safe (non-pathogenic to humans), can persist in the body long-term, and efficiently deliver genes to target cells. They are ideal for gene therapy.
Tropism (Targeting)
The cell-type-specific infectivity of an AAV vector. In other words: which cell types can the vector infect?
Examples:
- Liver Tropism (AAV8): Preferential infection of hepatocytes → for systemic therapies
- Muscle Tropism (AAV6): Targeting skeletal and cardiac muscle
- Nociceptive Neuron Tropism (Parvotec target): Targeting pain-sensing neurons in dorsal root ganglia (DRG)
Mechanism: Tropism is determined by capsid surface sequences (especially VP3 proteins). These sequences interact with receptors on target cell membranes.
Retrograde Transport
A natural axonal transport system that moves particles from peripheral axon terminals (e.g., nerve endings in the feet) to the cell body (e.g., in DRG in the spinal cord).
Why important for Parvotec? For pain therapy, we need to transport AAV from peripheral nerve endings (where pain is sensed) to nerve cell bodies in the DRG. This is a distance of up to 1 meter!
Machinery: Transport occurs via specialized motor proteins (dynein, kinesin) and requires active ATP supply.
ESM-2 / ESM-3 (Evolutionary Scale Modeling)
Protein language models (pLMs) developed by Meta AI. They work like GPT for text, but for protein sequences.
ESM-2: Generates 1280-dimensional embeddings (vectors), trained on UniRef50 (~33 million protein sequences). This means: each protein sequence is converted to a high-dimensional space where similar sequences are close together.
ESM-3 (2025): Enhanced version with 2560 dimensions and multi-modal training (sequence + structure + function integrated).
Advantage: Replaces hand-crafted features (like "hydrophobicity", "charge", "secondary structure"). The model learns directly from billions of examples which sequence patterns are biologically important.
Deep Mutational Scanning (DMS)
An experimental method that systematically performs thousands or millions of mutations on a protein sequence and measures their effect on a function (e.g., "Does this protein bind well to its receptor?").
Workflow:
- Create a library with ~1 million AAV variants (with different 7-amino acid insertions)
- Perform biological selection (e.g., infect nociceptive neurons)
- Sequence with NGS to find which variants are overrepresented
- Calculate an "NGS enrichment score" for each mutation
Outcome: A fitness landscape: a map showing which mutations improve or worsen tropism.
cVAE (Conditional Variational Autoencoder)
A generative neural network that can generate new protein sequences with specified properties.
How does it work?
- Encoder: Compresses a protein sequence into a continuous latent vector (e.g., 64-dimensional)
- Condition: Additionally, a conditional input is provided: "I want 70% liver tropism + high production efficiency"
- Decoder: Generates a new sequence that meets these objectives
- Latent Space Interpolation: By moving in latent space, we can smoothly interpolate between sequences
Advantage: Generates biologically plausible sequences (trained on real proteins), not random strings.
Bayesian Optimization (BO)
A smart optimization framework for scenarios where evaluations are expensive (e.g., experimental validation costs time/money).
Components:
- Surrogate Model: A fast NN or Gaussian process predicting how good a candidate sequence is (without real experiments)
- Acquisition Function: E.g., Expected Improvement (EI): "Which candidates should we test next to achieve the most improvement?"
- Iterative: Test candidate → Update model → Compute next best candidates
Multi-Objective BO: Parvotec optimizes multiple objectives simultaneously: Tropism (high) × Yield (high) × Stability (high) → Find Pareto front (candidates not dominated by others).
7-Mer Insertion
A standard strategy in AAV engineering: Insert a 7-amino acid peptide at a specific position (e.g., between VP1 amino acids 583-584).
Why 7 amino acids? Empirically, this length has proven optimal. It's large enough to create new binding properties but small enough not to destroy capsid structure.
Parvotec uses: A library with ~1 million different 7-mer insertions (different sequences at different positions).
NGS (Next-Generation Sequencing) & Enrichment Score
NGS enables simultaneous counting of millions of sequences.
Enrichment Score Calculation:
Enrichment = (Variant frequency AFTER selection) / (Variant frequency BEFORE selection)
Example: A variant is present 1× before selection, 100× after. Enrichment score = 100. This means: this variant has good nociceptive neuron tropism.
Pareto-Optimal
A concept from multi-objective optimization. A solution is "Pareto-optimal" if it's best in at least one objective but not dominated by any other solution in all objectives.
Example:
- Variant A: Tropism 90%, Yield 60%, Stability 80%
- Variant B: Tropism 80%, Yield 95%, Stability 85%
Both are Pareto-optimal (neither dominates the other). The Pareto front is the set of all such solutions.
Fitness Oracle
The central machine learning model in Parvotec that maps AAV sequences → biological properties.
Input: ESM-2/ESM-3 embeddings of a protein sequence (1280 or 2560 dimensions)
Output: Multi-task predictions:
- Tropism score (probability of infecting nociceptive neurons)
- Production efficiency (how many AAV particles can be produced?)
- Thermal stability (how long does the vector remain stable?)
- Immunogenicity (how much immune response does the vector trigger?)
Training: On experimental deep mutational scan data (Evotec library with >1 million AAV capsid variants).