calyr.aí RESEARCH

Parvotec — Projektproposal

Work Packages · Gantt · Fitness Oracle Manual

AAV Capsid Engineering × ML-guided Optimization · August 2026

Executive Summary

Parvotec entwickelt einen AAV-Vektor mit selektivem Tropismus für nozizeptive Neuronen (Dorsal Root Ganglia, DRG) und effizienter retrograder Transportkapazität als Plattform für periphere Schmerzgentherapie.

Kernhypothese: Durch Kombination von experimentellem Deep Mutational Scanning (DMS), ESM-2 Protein Language Model Embeddings, konditionaler generativer Modellierung (cVAE) und Multi-objective Bayesian Optimization kann in 3–4 iterativen Runden ein nozizeptiver DRG-spezifischer AAV-Vektor mit 5–10× verbessertem Tropismus gegenüber Wild-type identifiziert werden.

Projektzeitraum & Umfang

ParameterWert
Laufzeit24 Monate (M1–M24)
Work Packages5 (WP1–WP5)
SchlüsseltechnologienESM-2/3, cVAE, Multi-objective BO, DMS, NGS
Ziel-ZelltypNozizeptive Neuronen (TRPV1+, CGRP+) in DRG L4–S1
ApplikationsrouteIntrathecal (IT) oder intraplantar peripheral
Primäre ErfolgsmetrikTropismus Score ≥0.80 in primären Ratten-DRG-Neuronen

Work Packages

WP1 · M1–M3

Target Definition & Competitive Intelligence

Systematische Literaturrecherche und Wettbewerbsanalyse. Definition des Zielprofils (Target Product Profile, TPP) für den AAV-Vektor.

Aufgaben

  • Systematisches Review aller relevanten AAV-DRG-Tropismus-Publikationen (2020–2026)
  • Competitive Landscape Matrix: Exgenesis EXG117, SereNeuro SN102, Sangamo, Sanofi GMU037, WhiteLab CapsidFlow, PackGene π-Icosa
  • Definition des primären Zelltyps: TRPV1+ CGRP+ nozizeptive Neuronen in DRG L4–S1
  • Serotyp-Selektion: AAV6 als Backbone. 7-Mer Insertion Library-Design: VP1 533–540, 587–594
  • Entwurf des Target Product Profile (TPP) mit Go/No-Go Kriterien
RessourcenBioinformatiker (1 FTE), Wissenschaftlicher Berater Budget (est.)€30k–50k RisikoNiedrig
Deliverables: D1.1 Target Product Profile (TPP) · D1.2 Competitive Landscape Report · D1.3 Library Design Spec
WP2 · M2–M8

DMS Library Design, Synthese & Datenerhebung

Experimentelle Generierung des Trainings-Datasets. Synthese einer ~1 Million Varianten AAV-Capsid-Library, Selection in nozizeptiven DRG-Neuronen, NGS-basierte Quantifizierung.

Aufgaben

  • M2–M3: Computationales Design der 7-Mer Insertion Library. Oligonukleotid-Pool Synthese (Twist Bioscience). Klonierung in AAV-Backbone. Produktion in HEK293T. Titer ≥10¹² vg/mL
  • M4–M6: Primäre Ratten-DRG-Neuron-Kulturen (TRPV1-GFP+). Infektion mit Library (MOI = 10⁴ vg/cell). FACS-Sort für GFP+ (nozizeptive) vs. GFP− Neuronen
  • M5–M7: PCR-Amplifikation der Barcode-Region. Illumina Sequenzierung (>100M Reads/Sample). Enrichment = log2(Freq_post/Freq_pre)
  • M6–M8: In vivo Retrograde Transport Screen: Injektion in Pfote, DRG L4–L5 Entnahme nach 14d
RessourcenLab-Team (3 FTE), Evotec-CRO Partnerschaft Budget (est.)€280k–400k RisikoMittel (Library-Qualität, Zell-Variabilität)
Deliverables: D2.1 AAV Library (~1M) · D2.2 In Vitro DMS Dataset · D2.3 In Vivo Retrograde Dataset · D2.4 Curated Training Dataset (>500k)
WP3 · M4–M10

Fitness Oracle Infrastruktur & Modelltraining

Aufbau des ML-Stacks: ESM-2 Embedding Pipeline, Multi-task Fitness Predictor, cVAE Generator. Produktion von Fitness Oracle v1.0.

Aufgaben

  • M4–M5: ETL-Pipeline für DMS-Daten. Quality Filters (Coverage ≥10 reads). Train/Val/Test Split (70/15/15)
  • M5–M6: ESM-2 650M Deployment (A100 GPU). Batch-Processing ~1M Sequenzen → 1280-dim Vektoren
  • M6–M8: Multi-task NN: 1280→512→256→128, ReLU, Dropout=0.15. 4 Outputs. Optuna Hyperparameter-Suche
  • M7–M9: cVAE Training. Latent Dim=128. Conditioning auf Fitness-Zielvektor. Diversity/Validity/Novelty Evaluation
  • M8–M10: End-to-End Integration. Benchmark vs. Random Baseline. Oracle v1.0 Release
RessourcenML-Engineer (2 FTE), GPU Compute (A100) Budget (est.)€150k–220k RisikoMittel (Datenmenge, Generalisierung)
Deliverables: D3.1 ESM-2 Embedding Service · D3.2 Fitness Predictor v1.0 (Spearman r ≥0.65) · D3.3 cVAE v1.0 · D3.4 Evaluation Report
WP4 · M8–M18

Iterative ML-guided Optimierungskampagnen

Drei Bayesian Optimization Runden mit experimenteller Validierung. Multi-objective Pareto-Front über Tropismus × Yield × Stabilität × Immunogenizität.

Aufgaben

  • Runde 1 (M8–M11): cVAE generiert 500 Kandidaten. EHVI selektiert Top-50. FACS/qPCR/DSF Validierung. Oracle Update
  • Runde 2 (M11–M14): Active Learning: 60% Uncertainty-Regions, 40% High-Value. Erwartet: Tropismus ≥0.65
  • Runde 3 (M14–M18): Convergenz. 200 Kandidaten, 30 validiert. Pareto-Front: 10–20 non-dominated. Erwartet: Tropismus ≥0.80
RessourcenLab (2 FTE) + ML (1 FTE) Budget (est.)€320k–480k RisikoMittel-Hoch (Oracle-Generalisierung über Runden)
Deliverables: D4.1–D4.2 Runden-Reports · D4.3 Lead Candidate Panel (Top-10 Pareto) · D4.4 Oracle v2.0
WP5 · M14–M24

Lead Candidate Validierung & IND-Enabling

Tiefergehende in vitro und in vivo Validierung der Top-3 Lead Kandidaten. Datengenerierung für IND-Antrag.

Aufgaben

  • M14–M17: Primäre Ratten & Maus DRG-Neuronenkulturen. scRNAseq Zelltyp-Analyse. Transduktionseffizienz >80% in TRPV1+ als Go-Kriterium
  • M16–M20: CFA inflammatorisch & SNI neuropathisch Rattenmodell (n=10/Gruppe). qPCR Genomkopien DRG nach 14d. Endpoint: ≥3× retrograder Transport vs. WT
  • M18–M22: Histopathologie DRG. NAb-Titer Serum. T-Zell-ELISpot. DRG-spezifische Biodistribution (kein Cardiac Ganglia)
  • M20–M24: GMP-Herstellungsprozess. 6-Monat Stabilitätsstudien. Toxikologie GLP. FDA Pre-IND Briefing Document
RessourcenLab (3 FTE), CRO (Tox), Reg. Affairs Budget (est.)€450k–650k RisikoMittel (in vivo Variabilität)
Deliverables: D5.1 In Vitro Report · D5.2 In Vivo Efficacy · D5.3 Safety & Immunogenicity · D5.4 IND Package Draft

Budget-Übersicht

Work PackageBudget
WP1 — Target Definition & Competitive Intelligence€30k–50k
WP2 — DMS Library Design, Synthese & Datenerhebung€280k–400k
WP3 — Fitness Oracle Infrastruktur & Modelltraining€150k–220k
WP4 — Iterative ML-guided Optimierungskampagnen€320k–480k
WP5 — Lead Candidate Validierung & IND-Enabling€450k–650k
Total — 24 Monate · 6–8 peak €1.23M–1.8M

Gantt Chart — 24 Monate

WP1 — Target Definition & Competitive Intelligence
WP2 — DMS Library Design, Synthese & Datenerhebung
WP3 — Fitness Oracle Infrastruktur & Modelltraining
WP4 — Iterative ML-guided Optimierungskampagnen
WP5 — Lead Candidate Validierung & IND-Enabling
Meilenstein
Work Package
Q1
M2
M3
Q2
M5
M6
Q3
M8
M9
Q4
M11
M12
Q5
M14
M15
Q6
M17
M18
Q7
M20
M21
Q8
M23
M24
WP1Target Definition & Competitive Intelligence
WP1 — Target Definition & Competitive Intelligence
TPP
WP2DMS Library Design, Synthese & Datenerhebung
WP2 — DMS Library Design, Synthese & Datenerhebung
Dataset
WP3Fitness Oracle Infrastruktur & Modelltraining
WP3 — Fitness Oracle Infrastruktur & Modelltraining
v1.0
WP4Iterative ML-guided Optimierungskampagnen
WP4 — Iterative ML-guided Optimierungskampagnen
Lead Panel
Optimierung ✓
WP5Lead Candidate Validierung & IND-Enabling
WP5 — Lead Candidate Validierung & IND-Enabling
IND

DRG Fitness Oracle — Systemarchitektur

Layer 1

Embedding

ESM-2 650M / ESM-3 3B
Protein Language Model
Output: 1280-dim Vektor

Layer 2

Predictor

Feed-Forward NN
Multi-task (4 Outputs)
Spearman r ≥ 0.65

Layer 3

Generator

Conditional VAE (cVAE)
Latent Dim = 128
Conditional auf Fitness-Ziele

Layer 4

Optimizer

Multi-objective Bayesian Opt.
EHVI Acquisition Function
Pareto-Front Tracking

Oracle Outputs

OutputRangeLoss WeightBeschreibung
Tropismus Score0–150%Nozizeptive Neuron-Infektionseffizienz
Production Yield0–125%Relative AAV-Partikelproduktion vs. WT
Thermostabilität0–115%Schmelztemperatur normalisiert
Immunogenizität0–110%NAb-Titer-Vorhersage (niedrig = gut)

DRG Fitness Oracle — Datenpipeline

Das Oracle wird auf experimentellen DMS-Daten trainiert. Jede Variante erhält Labels für alle Outputs. Fehlende Labels (z.B. SAXS nur für Top-100) werden als NaN geführt — der Task-specific Loss maskiert NaN-Werte automatisch.

Composite Score: Gewichteter Score aller Outputs gemäß Loss-Weighting. Ranking aller Kandidaten vor BO-Selektion.

DRG Fitness Oracle — Modell

Architektur: ESM-2 650M → 1280-dim Embedding → Feed-Forward NN (1280→512→256→128, ReLU, Dropout=0.15) → Task-spezifische Heads → Multi-task MSE Loss. Training: AdamW, CosineAnnealing, Early Stopping (patience=15).

DRG Fitness Oracle — Betrieb & API

Jede Optimierungsrunde folgt einem fixierten 5-Schritt Protokoll: (1) cVAE Kandidaten-Generierung mit Constraint-Filter, (2) BO-Selektion via EHVI, (3) Experimentelle Validierung (28d), (4) Data Integration, (5) Oracle Re-Training auf kumulativen Daten.

API: oracle.predict(sequence) · oracle.generate(targets, n, strategy) · oracle.pareto_front(objectives)

Meilensteine & Deliverables

MonatMeilensteinDeliverableWP
M3Target Product Profile finalisiertD1.1–D1.3WP1
M5AAV Library produziert (QC: Titer, Coverage)Library QC ReportWP2
M8DMS Dataset abgeschlossenD2.2 + D2.4 Training DatasetWP2
M10Fitness Oracle v1.0 Release (Spearman r ≥0.65)D3.1–D3.4WP3
M11BO Runde 1 abgeschlossen (50 Kandidaten)D4.1WP4
M14BO Runde 2 abgeschlossen, Lead Panel DraftD4.2WP4
M18Lead Candidate Panel Final (Top-10 Pareto)D4.3 + D4.4 Oracle v2.0WP4
M20In Vitro Vollcharakterisierung Top-3D5.1WP5
M22In Vivo Wirksamkeit + BiodistributionD5.2 + D5.3WP5
M24IND-Enabling PackageD5.4 — Projektziel erreichtWP5

Risiko-Register

RisikoWahrscheinlichkeitImpactMitigation
DMS Library Coverage <50%MittelHochParallele Library mit kleinerer Komplexität als Backup
Oracle generalisiert nicht auf neue InsertionenMittelMittelActive Learning priorisiert unsichere Regionen, robuste Benchmarks
Kein Kandidat erfüllt In-Vivo Kriterien M20Niedrig-MittelSehr HochFrühzeitige In-Vivo Pilotdaten für Top-Kandidaten aus Runde 2
IP-Konflikte mit WhiteLab/PackGeneNiedrigMittelFreedom-to-Operate Analyse in WP1 (M1)