Vos questions sur l'apprentissage fédéré confidentiel, nos réponses
Une page pour répondre aux questions qui reviennent : ce qu'est l'apprentissage fédéré confidentiel, si vos données sortent, si un modèle collectif bat le solo, ce que l'on perd à ne pas centraliser, ce que vous gardez en partant, comment se traite la qualité des sources, combien ça coûte, combien de temps, et où se situe le RGPD. On distingue à chaque fois ce qui est construit de ce qui relève de la feuille de route.
Questions fréquentes
Qu'est-ce que l'apprentissage fédéré confidentiel ?
C'est une manière d'entraîner un modèle d'IA à plusieurs sans jamais rassembler les données. Au lieu de rapatrier les données vers un modèle central, on envoie le modèle vers les données : chaque acteur entraîne localement, sur ses propres données, et ne partage que les paramètres appris. Les données brutes ne quittent jamais leur détenteur. → définition détaillée.
Mes données sortent-elles de chez moi ?
Non. Les données brutes ne sont ni copiées, ni transférées, ni rassemblées ailleurs. Seuls les paramètres appris circulent, et leur transport est chiffré de bout en bout. Le coordinateur voit des mises à jour de modèle chiffrées, jamais les données brutes. C'est le mécanisme lui-même qui garantit ce point, pas une promesse ajoutée. → détail sur la sécurité.
Un modèle collectif est-il meilleur qu'un modèle entraîné seul ?
Sur nos trois jeux publics réels, le modèle du collectif gagne de 6 à 8 points d'AUC sur la moyenne de ce qu'obtiennent les acteurs seuls, et le gain est positif dans les vingt et une exécutions du banc : il exploite des signaux qu'un acteur isolé ne voit pas. C'est une démonstration de mécanisme, à valider sur vos propres données en pilote. Nous ne promettons pas de battre systématiquement le solo : l'ampleur du gain dépend des données et du cas d'usage, et se mesure avant tout engagement.
Qu'est-ce que je perds à ne pas centraliser les données ?
Rien de mesurable. Sur les trois jeux publics du banc, le modèle fédéré est à 0,3 point d'AUC au plus du modèle qu'on obtiendrait en réunissant toutes les données au même endroit, alors que l'incertitude d'une telle mesure est au moins six fois plus grande : l'écart ne se distingue pas du bruit statistique. Le gain du collectif, lui, se distingue : de 6 à 8 points d'AUC sur la moyenne des acteurs seuls, soit trois à quatre fois cette incertitude. Garder les données chez soi ne coûte donc pas de performance, et évite le dépôt de données qui bloque le projet. → la démonstration et ses chiffres.
Est-ce que je garde le modèle si je quitte le collectif ou si Mesh disparaît ?
Oui, pour la copie technique. Le modèle est distribué à chaque membre qui le reçoit : un artefact léger qui tourne chez lui, hors ligne, et que Mesh ne retient jamais. Il continue de fonctionner même si vous partez ou si Mesh disparaît. Une nuance : le ré-entraînement collectif s'arrête sans le collectif. Ce qui continue, c'est le modèle tel qu'il était à votre départ, que vous pouvez ensuite entraîner en privé sur vos propres données. → détail sur la propriété du modèle.
Comment se protège-t-on d'une source d'entraînement pourrie ?
Deux niveaux, à distinguer. Ce qui est construit : le transport des paramètres est chiffré de bout en bout, et rien de brut ne circule. Ce qui relève de la feuille de route : la robustesse aux contributions malveillantes ou d'empoisonnement (agrégation robuste, agrégation sécurisée) n'est pas encore déployée. La qualité des sources se traite aussi, en amont, par la gouvernance du consortium et le cadrage du vocabulaire commun. → détail sur la sécurité et la qualité des sources.
Qui fait partie du consortium, et qui voit quoi ?
C'est la gouvernance du consortium qui définit qui voit quoi : le périmètre des échanges, les règles d'accès et la composition se fixent dans l'accord entre participants, au cadrage. Sur le plan technique, chaque acteur n'accède qu'à ses propres données et au modèle agrégé, jamais aux données d'un autre. → voir le déroulement d'un projet.
Combien ça coûte ?
La facturation repose sur une mise en place unique puis une licence annuelle par membre, à partir de trois acteurs. La structure est publique ; le montant se discute au cas par cas et se compare à la valeur estimée pour votre organisation. Pour chiffrer cet enjeu de valeur, voir le calculateur de ROI.
Combien de temps prend un projet ?
La durée réelle est celle de l'amorçage : réunir au moins trois acteurs prêts à co-entraîner un modèle prend en général 6 à 12 mois. C'est un cycle de vente, pas un délai de livraison. Le pilote vient ensuite, une fois le consortium constitué. → déroulement d'un projet.
L'apprentissage fédéré est-il conforme au RGPD ?
Il aide la conformité sans la garantir. En gardant les données chez leur détenteur, il applique nativement la minimisation, ce qui facilite la mise en conformité, l'EDPS (TechDispatch #1/2025) le relève, sous conditions. La conformité finale dépend du déploiement concret et se valide, cas par cas, avec un juriste. → détail sur souveraineté et RGPD.
Une question qui n'est pas ici ?
On répond directement, sans rendez-vous obligatoire : décrivez votre cas, on vous envoie les éléments utiles.