Données d’entraînement des IA : les procès américains révèlent davantage que la transparence européenne
L’exemple le plus frappant est celui d’Anthropic. Son RSD pour Claude Opus 5 évoque notamment Common Crawl, des jeux de données spécialisés, des accords de licence, des données privées et des livres physiques acquis par l’entreprise, pudiquement désignés comme « acquired physical texts », sans jamais fournir de précision sur les oeuvres dont il peut s’agir. Pourtant, aux États-Unis, la procédure Bartz v. Anthropic a… permis d’établir qu’Anthropic avait téléchargé plusieurs millions de livres depuis LibGen et PiLiMi, deux bibliothèques pirates, mais aussi acheté des millions d’ouvrages imprimés, ensuite découpés et numérisés pour constituer des données d’entraînement. Le jugement décrit les méthodes d’acquisition, les catalogues bibliographiques et la constitution des corpus utilisés par différents modèles. Les modèles et périodes concernés ne sont pas nécessairement identiques, mais l’écart de précision est…