CourionAI
IT
Newsletter
← Tutte le notizie
privacy 3 min di lettura

Le persone reali leggono conversazioni ChatGPT reali e la maggior parte degli utenti non ne ha idea

404 Media ha ottenuto documenti interni che descrivono Project Lily, il programma di OpenAI che prevede l'assunzione di centinaia di collaboratori esterni per leggere i suggerimenti autentici degli utenti e valutare le risposte. I dettagli personali scivolano attraverso i filtri e l'impostazione che li controlla è attiva per impostazione predefinita.

Una pila di buste sigillate con quella superiore aperta e una lente d'ingrandimento sopra la lettera

404 Media ha pubblicato un’indagine su un programma OpenAI chiamato internamente Project Lily, basata su documenti trapelati e su suggerimenti reali mostrati. La versione breve: centinaia di collaboratori vengono pagati per leggere conversazioni autentiche tra persone e ChatGPT e valutare le risposte del chatbot su una scala da uno a sette. Non riassunti anonimizzati, non domande sintetiche. Chat vere e proprie, comprese, per stessa ammissione di OpenAI, quelle che contengono ancora dettagli personali.

Gli appaltatori vengono reclutati da una società chiamata Crossing Hurdles e pagati attraverso la piattaforma di assunzione Mercor, con un lavoratore che guadagna oltre 50 dollari l’ora. Non vedono i nomi utente e OpenAI afferma che tenta di eliminare le informazioni personali prima che le richieste raggiungano un revisore, ma la società riconosce che i dettagli sensibili vengono comunque trasmessi. Il che non sorprende se si immagina ciò che le persone effettivamente digitano: la preoccupazione medica, il messaggio a un parente difficile, il contratto che hanno incollato per farsi spiegare. ChatGPT ha più di 900 milioni di utenti e nei piani consumer l’impostazione che consente di utilizzare le conversazioni per migliorare il modello è attivata a meno che non venga disattivata. Questa non è una peculiarità di OpenAI, ad essere onesti. Anthropic e Google gestiscono programmi di revisione umana comparabili, e lo stesso vale essenzialmente per ogni azienda che ha dovuto insegnare a un modello come dovrebbe essere una buona risposta.

Cosa c’è dietro tutto questo?

I modelli non apprendono il gusto solo da più dati. Qualcuno deve considerare due possibili risposte e dire quale è la migliore e che qualcuno, finora, è una persona. La tecnica ha un nome, apprendimento per rinforzo dal feedback umano, ed è in gran parte il motivo per cui i moderni chatbot si sentono utili piuttosto che semplicemente fluenti. La parte imbarazzante è che le conversazioni reali sono il materiale formativo più prezioso proprio perché sono reali: disordinate, specifiche, a volte disperate. Un modello sintonizzato solo su domande artificiali educate diventa bravo con domande artificiali educate. Quindi l’industria utilizza la realtà, la rende pubblica nella politica sulla privacy e fa affidamento sul fatto che quasi nessuno legge le politiche sulla privacy.

Che cosa significa per te: presumi che tutto ciò che digiti in un chatbot generico possa essere letto da un essere umano e decidi cosa digitare su tale base. Questa non è paranoia, è solo un modello mentale accurato. Se vuoi ridurlo, il controllo esiste: in ChatGPT, apri Impostazioni, quindi Controlli dati e disattiva l’opzione sul miglioramento del modello per tutti, che impedisce che le tue chat future vengano utilizzate in questo modo. Esistono switch simili in Claude e Gemini e i piani aziendali o aziendali generalmente escludono i tuoi dati per impostazione predefinita. Per le cose veramente sensibili, dettagli sanitari, documenti dei clienti, qualsiasi cosa soggetta a un obbligo di riservatezza, l’abitudine migliore è eliminare nomi e numeri prima di incollarli o utilizzare un modello in esecuzione sul proprio computer. E se hai un’azienda: ecco perché gli account chatbot gratuiti e i dati dei clienti non rientrano nella stessa frase.

Fonti

Fonti: https://www.404media.co/inside-project-lily-the-humans-reading-your-chatgpt-chats/

Articolo successivo

Il nuovo rack di Nvidia è 10x, 30x o 67x migliore, a seconda di chi conta

Nuovi numeri per Vera Rubin NVL72 sono arrivati ​​questa settimana da Nvidia e da SemiAnalysis, e i moltiplicatori variano notevolmente. Lo spread non è disonestà, è una lezione su come vengono costruite le pretese di efficienza.

Tre righelli di diverse lunghezze e scale appoggiati allo stesso alto blocco