CourionAI
FR
Newsletter
← Toutes les actus
privacy 3 min de lecture

De vraies personnes lisent de vraies conversations ChatGPT, et la plupart des utilisateurs n'en ont aucune idée

404 Media a obtenu des documents internes décrivant le projet Lily, le programme d'OpenAI consistant à embaucher des centaines de sous-traitants pour lire les véritables invites des utilisateurs et noter les réponses. Les données personnelles passent à travers les filtres et le paramètre qui les contrôle est activé par défaut.

Une pile d'enveloppes scellées avec celle du haut ouverte et une loupe au-dessus de la lettre

404 Media a publié une enquête sur un programme OpenAI appelé en interne Project Lily, basée sur des documents divulgués et sur des invites réelles présentées au média. La version courte : des centaines de sous-traitants sont payés pour lire de véritables conversations entre des personnes et ChatGPT et noter les réponses du chatbot sur une échelle de un à sept. Pas de résumés anonymisés, pas de questions de test synthétiques. Discussions réelles, y compris, de l’aveu même d’OpenAI, celles qui contiennent encore des données personnelles.

Les entrepreneurs sont recrutés par une entreprise appelée Crossing Hurdles et payés via la plateforme de recrutement Mercor, un travailleur rapportant plus de 50 dollars de l’heure. Ils ne voient pas les noms d’utilisateur et OpenAI affirme essayer de supprimer les informations personnelles avant que les invites ne parviennent à un évaluateur, mais la société reconnaît que les détails sensibles passent de toute façon. Ce qui n’est pas surprenant quand on imagine ce que les gens écrivent réellement : le souci médical, le message adressé à un proche difficile, le contrat qu’ils ont collé pour se faire expliquer. ChatGPT compte plus de 900 millions d’utilisateurs et, sur les forfaits grand public, le paramètre permettant d’utiliser les conversations pour améliorer le modèle est activé, sauf si vous le désactivez. Pour être honnête, ce n’est pas une particularité d’OpenAI. Anthropic et Google gèrent des programmes d’évaluation humaine comparables, tout comme pratiquement toutes les entreprises qui ont dû enseigner à un modèle à quoi ressemble une bonne réponse.

Qu’est-ce qu’il y a derrière ça

Les modèles n’apprennent pas le goût uniquement à partir d’un plus grand nombre de données. Quelqu’un doit examiner deux réponses possibles et dire laquelle est la meilleure, et que quelqu’un, jusqu’à présent, est une personne. La technique a un nom, l’apprentissage par renforcement à partir des commentaires humains, et c’est en grande partie pourquoi les chatbots modernes se sentent utiles plutôt que simplement fluides. Ce qui est gênant, c’est que les vraies conversations constituent le matériel de formation le plus précieux, précisément parce qu’elles sont réelles : désordonnées, spécifiques, parfois désespérées. Un modèle axé uniquement sur des questions artificielles polies devient efficace dans les questions artificielles polies. Ainsi, l’industrie utilise la réalité, la divulgue dans la politique de confidentialité et s’appuie sur le fait que presque personne ne lit les politiques de confidentialité.

Ce que cela signifie pour vous : Supposons que tout ce que vous tapez dans un chatbot à usage général puisse être lu par un être humain, et décidez quoi taper sur cette base. Ce n’est pas de la paranoïa, c’est juste un modèle mental précis. Si vous souhaitez le réduire, le contrôle existe : dans ChatGPT, ouvrez Paramètres, puis Contrôles des données, et désactivez l’option d’amélioration du modèle pour tout le monde, ce qui empêche l’utilisation de vos futurs chats de cette manière. Des commutateurs similaires existent dans Claude et Gemini, et les forfaits professionnels ou d’entreprise excluent généralement vos données par défaut. Pour les choses véritablement sensibles, les détails de santé, les documents clients, tout ce qui est soumis à une obligation de confidentialité, la meilleure habitude est de supprimer les noms et numéros avant de les coller, ou d’utiliser un modèle fonctionnant sur votre propre machine. Et si vous avez une entreprise : c’est la raison pour laquelle les comptes de chatbot gratuits et les données clients n’appartiennent pas à la même phrase.

Sources

Sources: https://www.404media.co/inside-project-lily-the-humans-reading-your-chatgpt-chats/

Article suivant

Le nouveau rack de Nvidia est 10x, 30x ou 67x meilleur, selon celui qui compte

De nouveaux chiffres pour le Vera Rubin NVL72 sont arrivés cette semaine de Nvidia et de SemiAnalysis, et les multiplicateurs varient énormément. Cette propagation n’est pas de la malhonnêteté, c’est une leçon sur la façon dont les allégations d’efficacité sont construites.

Trois règles de longueurs et d'échelles différentes appuyées contre le même bloc haut