← Back to Blog

INSPIRE: Machine Learning für Indikations-Priorisierung in der Onkologie

by 21Stable Team

Die Auswahl der richtigen Indikation für einen neuen Wirkstoff ist eine der kritischsten Entscheidungen in der Arzneimittelentwicklung. Ein falscher Entscheid kostet Jahre und Milliarden. Eine neue in *npj Precision Oncology* veröffentlichte Methode namens **INSPIRE** nutzt maschinelles Lernen auf Real-World-Daten, um diese Entscheidung zu optimieren.

Das Problem

Die Indikationswahl in der Onkologie-Entwicklung steht vor fundamentalen Herausforderungen:

  • Hohe Kosten: Entwicklung eines neuen Krebsmedikaments kostet im Durchschnitt 1–2 Milliarden USD
  • Lange Timelines: 10–15 Jahre von der Entdeckung bis zur Zulassung
  • Niedrige Erfolgsraten: Nur 5–10% der onkologischen Phase-I-Studien erreichen die Zulassung
  • Fehlende Granularität: Traditionelle ICD-Codes differenzieren nicht nach histologischen Subtypen
  • Gerade in der Onkologie ist die histologische Klassifizierung essenziell – ein Adenokarzinom der Lunge reagiert anders als ein Plattenepithelkarzinom, selbst wenn beide im selben Organ entstehen.

    Kernerkenntnis

    INSPIRE (INdication Selection and Prioritization In Real-world data and Evaluation) nutzt Representation Learning auf Real-World-Daten, um Indikationen basierend auf ihrer Ähnlichkeit zu bereits bekannten wirksamen Indikationen zu ranken.

    Die in *npj Precision Oncology* veröffentlichte Studie zeigt:

    Der Ansatz simuliert ein Szenario, in dem PD-1-Inhibitoren noch neu waren (Pre-2015), und sagt erfolgreich die später zugelassenen Indikationen voraus – ohne Kenntnis der zukünftigen Daten.

    Forschungsmethodik

    Datengrundlage

    Die Studie nutzte **Optum's de-identified Market Clarity Data**:

  • 2,17 Millionen onkologische Patienten
  • Informationen zu Diagnosen, Behandlungen, Prozeduren, Labortests, Biomarkern, Histologien
  • Zeitraum: historische Daten vor PD-1-Zulassung (2012–2015)
  • Methodischer Ansatz

    INSPIRE erweitert frühere RWD-basierte Methoden durch drei onkologiespezifische Innovationen:

  • **Histologie-basierte Indikationen**: Anstatt generischer ICD-Codes werden histologische Berichte verwendet – essentiell für die korrekte Klassifizierung onkologischer Subtypen
  • **Patient-Journey-Enrichment**: Biomarker-Tests, Staging-Informationen und Metastasenlokalisation werden integriert
  • **Indication Broadcasting**: Technik zur Bewältigung der Sparsity onkologischer Datensätze
  • Validierungsdesign

    Das Proof-of-Concept verwendete einen rigorosen zeitlichen Split:

  • Training Phase (blinded): Nur Daten von 2012–2015, keine PD-1-Verschreibungen
  • Referenz-Indikationen: 3 bekannte PD-1-wirksame Indikationen (als "Anker")
  • Evaluation Phase: Wie gut wurden die Post-2015 zugelassenen Indikationen gerankt?
  • Kernergebnisse

    Die Studie validierte den Ansatz beispielhaft an der PD-1-Inhibition:

  • Korrekte Priorisierung: Später zugelassene PD-1-Indikationen wurden korrekt als hochrangig eingestuft
  • Histologische Granularität: Der Ansatz unterscheidet zwischen histologischen Subtypen desselben Organs
  • Zeitliche Robustheit: Training auf historischen Daten erfolgreich ohne Information Leakage
  • Klinische Relevanz

    Für die Pharma-Entwicklung:

  • Frühe Indikations-Selektion: Bereits mit wenigen Referenzindikationen können weitere vielversprechende Ziele identifiziert werden
  • Ressourcen-Optimierung: Fokus auf die Indikationen mit höchster Erfolgswahrscheinlichkeit
  • Drug Repurposing: Auch für etablierte Wirkstoffe neue Indikationen finden
  • Für die Precision Oncology:

  • Integration von Biomarker-Informationen
  • Berücksichtigung des TNM-Stagings
  • Metastasenspezifische Analysen möglich
  • Methodische Stärken

    Gegenüber traditionellen Ansätzen

    Traditionelle Methoden verlassen sich auf:

  • ICD-basierte Kodierungen (zu grob für Onkologie)
  • Experimentelle High-Throughput-Screens (teuer, limitierte Validität)
  • Klinische Serendipität (nicht systematisch)
  • INSPIRE bietet:

  • Datengesteuerte Priorisierung aus echten Patientenpfaden
  • Klinisch relevante Granularität durch Histologie-Integration
  • Validierbar durch zeitliche Splits
  • Technische Innovation

    Der **Representation-Learning-Ansatz** erstellt numerische Vektoren (Embeddings) für jede Indikation, die implizit phänotypische Ähnlichkeiten erfassen – inklusive Therapieansprechen.

    Fazit

    INSPIRE demonstriert, dass Real-World-Daten in Kombination mit modernem maschinellem Lernen die Indikationswahl in der Onkologie systematisieren können. Der Ansatz überwindet die Limitationen traditioneller ICD-basierter Methoden und bietet eine klinisch relevante Granularität.

    Für Biometriker und Drug-Development-Teams bedeutet dies: Datengestützte Entscheidungsfindung wird von retrospektiver Analyse zu prädiktiver Strategie. Der PD-1-Proof-of-Concept zeigt, dass die Methode funktioniert – die Anwendung auf neue Targets und Drug-Repurposing-Szenarien steht noch aus.

    ---

    Key Findings

  • **2.17M Patient Cohort**: One of the largest real-world datasets used for indication prioritization in oncology
  • **Histology-Based Granularity**: Novel approach overcomes ICD-10 limitations for oncological subtypes
  • **Time-Validated**: PD-1 proof-of-concept successfully predicted post-2015 approved indications using only pre-2015 data
  • **Reference-Based Ranking**: Small set of known effective indications suffices to prioritize new targets
  • **Drug Repurposing Potential**: Method applicable to finding new indications for established drugs
  • Clinical Implications

  • Earlier Decision Support: Indication prioritization before expensive clinical trials
  • Resource Allocation: Focus development resources on highest-probability indications
  • Biomarker Integration: Native support for precision oncology biomarkers
  • Regulatory Validation: Approach aligns with FDA's growing acceptance of real-world evidence
  • References

  • Eckhoff, M., Klingelschmitt, S., Van Ruijssevelt, L. et al. Finding the most promising indications for novel treatments in oncology. *npj Precis. Onc.* (2026). https://doi.org/10.1038/s41698-026-01352-x
  • FDA. Real-World Data: Assessing Electronic Health Records and Medical Claims Data To Support Regulatory Decision-Making for Drug and Biological Products. Guidance for Industry (2021).
  • Eckhoff, M. et al. Unsupervised Machine Learning for Indication Prioritization in Immunology. *np* (2024).
  • Adamek, K. et al. Machine learning-based indication prioritization from real-world data. *Journal of Clinical Oncology* (2024).
  • Sung, H. et al. Global Cancer Statistics 2020: GLOBOCAN Estimates of Incidence and Mortality Worldwide for 36 Cancers in 185 Countries. *CA: A Cancer Journal for Clinicians* 71, 209–249 (2021). https://doi.org/10.3322/caac.21660