La copie d'articles pour l'IA était un vol sans précédent, selon un cadre de Microsoft
Un document interne présenté cette semaine dans le cadre d’un procès aux États-Unis relance le débat sur l’entraînement des intelligence artificielle génératives à partir de contenus journalistiques. Selon ce document, un cadre de Microsoft aurait lui-même qualifié cette pratique de vol « sans précédent ». Cette révélation intervient alors que le New York Times poursuit OpenAI et Microsoft depuis fin 2023, une affaire suivie de près par l’ensemble du secteur des médias.
Un document interne qui embarrasse Microsoft
Le document versé jeudi à la procédure judiciaire contient des écrits attribués à Brent Hecht, directeur des sciences appliquées chez Microsoft. Dans ces messages, il décrit la copie de millions d’articles utilisés pour développer l’IA d’OpenAI comme, selon ses propres termes, potentiellement « le plus grand vol de travaux de l’histoire de l’humanité ». Une formule qui, si elle se confirme comme authentique et représentative des échanges internes, pourrait peser lourd dans la procédure en cours devant la justice fédérale de Manhattan.
Face à ces révélations, un porte-parole de Microsoft a réagi en indiquant que ces propos relevaient du « point de vue personnel d’un employé » et ne reflétaient pas la position officielle de l’entreprise. Cette mise à distance est une stratégie classique dans ce type de contentieux, mais elle ne fait pas disparaître le document, qui reste désormais partie du dossier judiciaire.
Une procédure qui s'élargit depuis fin 2023
Le New York Times a lancé son action en justice contre OpenAI et Microsoft fin 2023, reprochant aux deux entreprises une infraction au droit de la propriété intellectuelle. Depuis cette assignation initiale, des dizaines d’écrivains et de groupes de médias ont rejoint la procédure devant la justice civile fédérale de Manhattan, ce qui donne à cette affaire une portée qui dépasse largement le seul cas du quotidien new-yorkais.
Cette dynamique illustre une inquiétude plus large du secteur de la presse et de l’édition face à l’utilisation de contenus protégés pour entraîner des modèles d’IA générative, sans autorisation ni compensation explicite pour les auteurs et éditeurs concernés.
Le rôle de Microsoft dans le développement d'OpenAI
Microsoft n’est pas un acteur périphérique dans cette affaire. Le groupe basé à Redmond a été l’un des premiers investisseurs majeurs d’OpenAI, dès 2019, et a fourni à la start-up californienne des ressources informatiques essentielles au développement de ses modèles. Microsoft a par ailleurs intégré l’IA d’OpenAI à ses propres produits, notamment son moteur de recherche Bing, ce qui renforce le lien de responsabilité invoqué par les plaignants.
C’est précisément cette collaboration étroite, à la fois financière et technique, qui justifie que Microsoft soit poursuivi aux côtés d’OpenAI, et non uniquement en tant que partenaire commercial extérieur.
Comment fonctionnent les modèles mis en cause
Pour comprendre l’enjeu du procès, il faut rappeler le fonctionnement des IA génératives comme celle qui a donné naissance à ChatGPT en novembre 2022. Ces systèmes sont construits à partir de quantités massives de textes rédigés par des humains, qui permettent au modèle d’apprendre à anticiper et formuler une réponse cohérente à une question posée par un utilisateur. Le document versé au dossier cite également des messages attribués au responsable de ChatGPT, ce qui suggère que les échanges internes documentant l’ampleur de la collecte de données remontent au moment même du lancement du robot conversationnel.
Les limites de cette révélation
Il convient de nuancer la portée de ce document. Les propos de Brent Hecht, tels que rapportés, restent qualifiés officiellement par Microsoft de position personnelle, sans valeur d’aveu juridique formel de l’entreprise. Le procès est loin d’être tranché, et l’issue dépendra de l’interprétation que fera la justice fédérale de ces échanges internes ainsi que d’autres pièces du dossier. Il reste également difficile, à ce stade, de mesurer l’ampleur exacte des contenus concernés ou les conséquences financières potentielles pour les entreprises visées.
Ce que cela signifie pour les lecteurs et les créateurs de contenu
Cette affaire dépasse le cadre strictement juridique et interroge la manière dont les contenus journalistiques et créatifs sont valorisés à l’ère de l’IA générative. Voici quelques points de vigilance pour les lecteurs, auteurs et professionnels des médias :
- Suivre l’évolution de ce procès, qui pourrait créer un précédent pour d’autres litiges similaires entre médias et entreprises d’IA.
- Rester attentif aux conditions d’utilisation des contenus que vous publiez en ligne, notamment sur les plateformes susceptibles d’être exploitées pour l’entraînement de modèles d’IA.
- Ne pas confondre les déclarations internes d’un employé avec la position officielle d’une entreprise, tout en reconnaissant leur valeur d’indice dans une procédure judiciaire.
- Garder à l’esprit que le débat sur la rémunération des contenus utilisés par l’IA reste ouvert et évolue rapidement selon les décisions de justice.
Conclusion
Ce document interne, qui décrit la copie de millions d’articles pour l’IA comme un vol sans précédent, ajoute une pièce significative à un procès déjà suivi de près par l’ensemble du secteur des médias. Sans préjuger de l’issue judiciaire, cette révélation illustre les tensions grandissantes entre les entreprises d’intelligence artificielle et les producteurs de contenus originaux, dans un contexte où les règles encadrant l’usage de ces contenus pour entraîner des modèles restent encore largement à définir.