OBSERVATOIRE DES PATIENTS TRAUMATISÉS SÉVÈREStraumabase.eu
TRAUMABASE · GOLDEN BASE

TraumaBase — Documentation de la Golden Base

Sources de données, définitions des variables et guide pour l’analyse de la Golden Base.

La Traumabase est un registre français dédié aux patients traumatisés sévères. Elle rassemble les données des centres participants pour soutenir la recherche et mieux comprendre leur prise en charge.

La Golden Base est le jeu de données harmonisé issu des sources MediaXtend, CleanWeb V1 et CleanWeb V2. Cette documentation décrit les données et les règles nécessaires à leur interprétation.

01

Sources de données

La Traumabase est constituée de trois bases successives. Au fil du temps, des variables ont été ajoutées ou supprimées, certains formats et définitions ont changé, et les liens entre les données se sont structurés.

2012–2017

MediaXtend

9 882 patients

Base définitivement clôturée01
2017–2021

CleanWeb V1

18 145 patients

Base définitivement clôturée02
2021–aujourd’hui

CleanWeb V2

37 700 patients

Collecte en cours03

65 727 patients au total dans les trois sources, au .

Différences entre les sources

Un pipeline aligne et traite les données des trois sources pour construire la Golden Base. Certaines définitions ont évolué au cours du temps ; il faut en tenir compte lors de l’analyse.

Quelques exemples de différences entre les sources :

Définition du choc hémorragique

CHOC_HEMORRAG_V1≥ 4 unités de CGR
CHOC_HEMORRAG_V2≥ 1 unité de CGR

La définition évolue de quatre unités à une unité de concentré de globules rouges au cours des six premières heures. Les deux variables sont conservées pour rendre cette différence explicite.

Dates et délais

Dans MediaXtend, les dates et les délais étaient renseignés manuellement. Dans CleanWeb V1 et V2, les délais sont calculés automatiquement à partir des dates et heures renseignées. Ces modalités de recueil différentes sont à prendre en compte dans l’évaluation de la qualité des dates et des délais.

02

Guide des valeurs manquantes

Définition des marqueurs

La Traumabase utilise quatre marqueurs pour distinguer différentes significations et origines des données manquantes. Leur sens doit être pris en compte dans l’analyse des données et dans le choix d’une stratégie de traitement des valeurs manquantes, en tenant compte du mécanisme de données manquantes.

ND

Non disponible

L’information est attendue, mais n’a pas été retrouvée dans le dossier du patient.

NA

Non applicable

La question ou la mesure ne s’applique pas dans ce contexte, souvent en raison de la réponse à une question mère.

NR

Non renseigné

La variable n’était pas collectée dans cette source ou pendant cette période.

IMP

Imprenable

Une mesure physiologique n’a pas pu être obtenue, par exemple en raison d’un signal trop faible ou absent.

Prise en compte dans l’analyse

NA : utiliser le contexte clinique

Une imputation fondée sur le sens clinique de la variable peut être justifiée pour NA. Lorsque la réponse à la question mère établit l’absence d’un événement ou d’un traitement, la réponse attendue peut être « Non » ou 0. Par exemple, si un traitement n’a pas été administré, sa dose est codée NA par défaut dans la Traumabase. Dans ce contexte, elle peut être imputée à 0 avec une relative fiabilité.

Relations mère–fille

Dans le formulaire de recueil (eCRF), une réponse peut ouvrir ou fermer une autre question. La variable mère détermine si la variable fille est applicable.

Exemple mère-fille : Transport médicalisé – Catécholamines

Transport médicalisé ?

OuiCatécholamines : Oui / Nonou ND si non disponible
NonNAQuestion sur les catécholamines non applicable
NDNDInformation inconnue

Exemple d’imputation : dose de catécholamines

Si aucune catécholamine n’a été administrée, la dose est codée NA dans la Traumabase. L’absence de traitement permet alors d’imputer cette dose à 0 pour l’analyse.

Exemple d’imputation des NA : arrêt cardiaque
Contexte cliniqueArrêt cardiaqueAbsence de circulation spontanée
Dans les donnéesFréquence cardiaque (FC) : NAPression artérielle systolique (PAS) : NAPression artérielle diastolique (PAD) : NAMesures codées non applicables dans ce contexte
Pour l’analyse0 peut être retenuSi cette convention est justifiée pour la variable et le moment étudié
Voir la carte des dépendances mère–fille

ND, NR et IMP : méthodes statistiques

Pour ND, NR et IMP (ainsi que dans les rares cas où NA ne peut pas être imputé à partir d’une hypothèse clinique), il faut choisir une méthode statistique adaptée à la question de recherche et au mécanisme de données manquantes. Selon le contexte, cela peut inclure une imputation multiple, une méthode d’estimation tenant compte des données manquantes et des analyses de sensibilité.

NR peut concerner une période entière de collecte ; IMP peut être lié à l’état clinique.

Ressources suggérées pour le traitement des valeurs manquantes

R-miss-tastic propose des méthodes, références, tutoriels et exemples en R et Python pour choisir une approche adaptée aux données manquantes.

03

Notes techniques

La Golden Base contient la chaîne de caractères littérale "NA" pour « Non applicable ». Certains logiciels la convertissent automatiquement en valeur manquante générique à l’import, ce qui efface cette distinction. Préserver les quatre marqueurs avant de préparer les variables pour l’analyse.

Python / pandas

Pour importer un fichier CSV ou Excel de la Golden Base, utiliser keep_default_na=False afin de préserver le marqueur littéral "NA", et na_values pour préciser les valeurs à convertir en valeurs manquantes génériques. L’option dtype=str importe les colonnes sous forme de texte.

import pandas as pd

na_values = ["", "nan", "NaN"]

df_csv = pd.read_csv(
    "golden_base.csv",
    sep=";",
    keep_default_na=False,
    na_values=na_values,
    dtype=str,
)

df_excel = pd.read_excel(
    "golden_base.xlsx",
    keep_default_na=False,
    na_values=na_values,
    dtype=str,
)

Seules les cellules vides et les chaînes "nan" et "NaN" deviennent des valeurs manquantes génériques. Les chaînes "NA", "ND", "NR" et "IMP" sont conservées. dtype=str seul ne suffit pas à empêcher la conversion de "NA".

Documentation de référence

R

read.csv() interprète également "NA" comme une valeur manquante par défaut : définir na.strings sans y inclure "NA". Pour Excel, readxl::read_excel() ne convertit par défaut que les cellules vides ; ses options sont rendues explicites ci-dessous pour obtenir le même comportement que dans l’exemple pandas.

df_csv <- read.csv(
  "golden_base.csv",
  sep = ";",
  na.strings = c("", "nan", "NaN"),
  colClasses = "character",
  check.names = FALSE
)

df_excel <- readxl::read_excel(
  "golden_base.xlsx",
  na = c("", "nan", "NaN"),
  col_types = "text"
)

Adapter le séparateur et l’encodage au fichier reçu. Après avoir traité les marqueurs selon le plan d’analyse, convertir les colonnes utiles en nombres ou en dates ; ces exemples les importent volontairement sous forme de texte.

Documentation de référence

Équipe et remerciements

Ce travail de préparation, de traitement et de documentation des données a été réalisé par l’équipe ci-dessous. Nous remercions l’ensemble de ses membres pour leurs contributions.

Groupe Traumabase

  • Dr. Anatole Harrois
  • Dr. Arthur James
  • Dr. Tobias Gauss

INRIA

  • Julie Josse
  • Dhia Merzougui

Capgemini Invent

  • Sofiane Medjkoune
  • Virginie Lam
  • Marie-Flore Huret
  • Adnene Khalbous

URC Lariboisière

  • Béatrice HORCHOLLE