Web scraping et IA générative : quelles règles RGPD ?
Web scraping IA générative : le 8 juillet 2026, le Comité européen de la protection des données a ouvert à consultation de nouvelles lignes directrices consacrées au web scraping dans le contexte de l’IA générative. En effet, l’entraînement et l’amélioration des modèles peuvent reposer sur la collecte automatisée de très grandes quantités de données accessibles en ligne, dont certaines constituent des données personnelles.
Le fait qu’une donnée soit publiquement accessible ne signifie pas qu’elle peut être librement aspirée, conservée et réutilisée pour n’importe quelle finalité. Le RGPD continue à s’appliquer lorsque les informations permettent d’identifier directement ou indirectement une personne physique.
I. Qu’est-ce que le web scraping dans le contexte de l’IA ?
Le web scraping consiste à collecter automatiquement des informations depuis des sites ou services en ligne. À grande échelle, il permet de constituer des corpus contenant du texte, des images, des profils, des publications ou d’autres contenus utilisés pour entraîner ou améliorer des modèles d’IA.
Les lignes directrices 03/2026 du CEPD examinent précisément ce contexte et rappellent que la collecte automatisée doit être analysée au regard des principes du RGPD.
II. Une donnée publique peut-elle être librement réutilisée ? – Web scraping IA générative
Non. La publication volontaire d’une information sur Internet ne vaut pas autorisation générale de la réutiliser à toute fin. Le responsable de traitement doit identifier une base légale, respecter la finalité poursuivie, limiter les données collectées et tenir compte des attentes raisonnables des personnes.
Cette analyse devient particulièrement délicate lorsque les données ont été publiées dans un contexte social, professionnel ou personnel très éloigné de l’entraînement d’un modèle d’intelligence artificielle.
III. Peut-on invoquer l’intérêt légitime ?
L’intérêt légitime peut être envisagé dans certaines situations, mais il ne constitue pas une autorisation automatique. Il suppose d’identifier un intérêt réel, de démontrer la nécessité du traitement et de mettre en balance cet intérêt avec les droits et libertés des personnes concernées.
La nature des données, leur contexte de publication, le volume collecté, la possibilité d’opposition et les effets du traitement sont autant de critères à examiner. Une collecte massive sans mécanisme de filtrage ou de limitation sera plus difficile à justifier.
IV. Qu’en est-il des données sensibles ?
Les données révélant notamment la santé, les opinions politiques, la religion, l’orientation sexuelle ou certaines caractéristiques biométriques bénéficient d’un régime renforcé. Le fait qu’une personne ait publié une information sensible n’efface pas les conditions spécifiques applicables à leur traitement.
Les développeurs de modèles doivent donc prévoir des mécanismes de détection, d’exclusion ou de limitation lorsque leurs opérations de collecte sont susceptibles de capturer ce type de données.
V. Comment informer les personnes lorsqu’on collecte à grande échelle ?
Le RGPD impose en principe une information des personnes. Dans le contexte d’une collecte massive sur Internet, cette obligation peut être complexe à mettre en œuvre, mais elle ne disparaît pas pour autant. L’entreprise doit examiner les règles relatives à la collecte indirecte et documenter les éventuelles exceptions invoquées.
La transparence doit également permettre aux personnes d’exercer leurs droits. La gouvernance du projet doit donc intégrer dès l’origine la question de l’accès, de l’opposition, de l’effacement et des moyens permettant d’identifier les données concernées.
VI. Quelles précautions pour une entreprise utilisant des données web pour son IA ?
- identifier précisément les sources utilisées ;
- qualifier la nature personnelle ou non des données ;
- déterminer la base légale avant la collecte ;
- exclure ou limiter les données sensibles ;
- prévoir des mécanismes d’exercice des droits ;
- documenter les mesures de minimisation et d’anonymisation.
Ces démarches s’inscrivent dans une gouvernance plus générale des données, qui peut nécessiter l’intervention du DPO et, selon les risques, une analyse d’impact.
Votre avocat en IA, web scraping et données personnelles
Le cabinet de Me Jonathan POUGET accompagne les entreprises qui développent ou utilisent des solutions d’IA pour analyser leurs sources de données, qualifier les bases légales et organiser leur conformité RGPD.


