nexa
By thread
nexa@server-nexa.polito.it
By month
Messages by month
- ----- 2026 -----
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2025 -----
- December
- November
- October
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2024 -----
- December
- November
- October
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2023 -----
- December
- November
- October
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2022 -----
- December
- November
- October
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2021 -----
- December
- November
- October
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2020 -----
- December
- November
- October
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2019 -----
- December
- November
- October
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2018 -----
- December
- November
- October
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2017 -----
- December
- November
- October
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2016 -----
- December
- November
- October
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2015 -----
- December
- November
- October
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2014 -----
- December
- November
- October
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2013 -----
- December
- November
- October
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2012 -----
- December
- November
- October
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2011 -----
- December
- November
- October
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2010 -----
- December
- November
- October
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2009 -----
- December
- November
- October
- September
- August
- July
- June
- May
- 39 participants
- 30614 messages
Re: [nexa] The Curious Case of David Mayer, the man ChatGPT cannot name
by 380°
Buongiorno,
da _dilettante_ del diritto e di filosofia mi permetto un paio di commenti
Carlo Blengino <blengino(a)penalistiassociati.it> writes:
[...]
> Non sono sicuro che la cessione nel caso GEDI fosse per sperimentare
> servizi basati su RAG, ma se anche così fosse, e i dati non fossero
> utilizzati per addestramento, vi sarebbe comunque un trasferimento di dati
> ad OpenAI,
lasciando da parte gli "esercizi di cattivo gusto" (giuridico) degli
accordi tra editori e aziende informatiche, che differenza c'è tra
l'indicizzazione degli articoli pubblicati - e sottolineo ottanta volte
pubblicati - e altri tipi di elaborazione, dal punto di vista del GDPR?
scusa l'ignoranza ma la circostanza che i _presunti_ "dati" siano stati
resi _pubblici_ (pubblicati) da un organo di /informazione/ non rende
quei "dati" /liberi/ da GDPR? (cioè: io non li ottengo dalla persona, li
ottengo da una pubblicazione)
[...]
> il problema per cui un archivio pubblico come l'archivio di un grande
> quotidiano per il GDPR non sarà mai usabile da un fornitore per
> l'addestramento è vera, quale che sia la modalità di acquisizione (che
> sia con lo scraping o con accordi).
Tipo il /dato/ che un tale è stato condannato a X anni di carcere con
sentenza passata in giudicato, ecc, ecc, ecc: quello è /trattamento di
dati personali/?
Questo vale anche per i libri nelle biblioteche, giusto?
Questo vale solo per "l'addestramento LLM" o per qualsiasi tipo di
trattamento per mezzo di elaboratore?
> Non ci sarà mai infatti per fini
> commeriali/imprenditoriali una base giuridica che legittimi il
> trattamento di archivi così rilevanti, almeno in UE, perchè quel
> dataset contiene per forza dati particolari ex art.9 e dati giudiziari
> ex art. 10, circostanza questa che esclude il legittimo
> interesse.
Quindi la Treccani non è legittimata a trattare gli archivi delle
sentenze passate in giudicato, per esempio?
Nelle questioni /pubbliche/ (cioè _pubblicate_) non è forse mio
legittimo interesse conoscere i fatti e le circastanze (dati) che
determinano la vita della mia nazione, inclusi dati personali?
[...]
> Per salvare il trattamento dei motori di ricerca quali titolari del
> trattamento sulla base del legittimo interesse si sono compiute
> capriole interpretative notevoli là dove tale base è recessiva
> rispetto al divieto di trattamento di dati particolari,
faranno delle capriole ancora più contorte anche per gli LLM
...fino a riformare il GDPR :-)
> ma lì era più facile e nessuno poteva vietare Google Search.
"Too big to stop"?
[...]
> E mi chiedo cosa intenda il Garante quando parla di "licenza",
farà parte delle capriole (sgraziate) che tocca fare al Garante
[...]
> i dati personali, a maggior ragione se pubblici, non sono di nessuno
> (il titolare è il titolare del trattamento, non dei dati, e
> l'interessato non possiede i suoi dati, può pretenderne la protezione,
> a determinate condizioni).
protezione tipo che nessuno può leggere la sua corrispondenza privata
(email, chat, compiti in classe, risultati di test scolastici, risultati
di visite mediche, ecc. ecc. ecc. ecc.) come parte integrante del
/servizio/, perché questo ha sempre fatto schifo e deve continuare a
farlo?
il GDPR dovrebbe servire a _questo_, non a stabilire chi può e chi non
può trattare dati, anche personali, contenuti in archivi _pubblici_
(pubblicati)
> E bene che sia così, perchè i dati, rectius le informazioni, anche
> personali devono circolare santo cielo! Sono la base della conoscenza,
Amen.
[...]
> Quando uscì il GDPR (2016) ricordo che in studio ci dicemmo: ma sta roba è
> incompatibile con il BigData (in allora il termine era una buzzword).
Io, che sono ingenuo da fare paura, ho sempre pensato che il GDPR
servisse a garantire che i dati _privati_ - e sottolineo ottanta volte
privati - rimanessero tali, ovvero /riservati/ tra me e il mio
fornitore, che non si deve azzardare a trasmetterli a terzi se non per
l'esecuzione degli _specifici_ compiti inclusi nel rapporto
_contrattuale_ (e di tali trasferimenti devo essere informato).
...e invece, il mio numero di cellulare è da anni in una lista che
innumerevoli "agenti del male" (quello che sento per loro) usano
insistentemente per tentare di interrompermi almeno 3 volte al giorno
non mi risulta che i numeri di cellulare siano _pubblicati_ dagli organi
di informazione, sicuramente non il mio
> Minimizzazione, limitazione della conservazione, stretta finalità...tutta
> roba contraria al valore informativo dei dati,
non capisco perché i miei dati personali non debbano essere trattati
secondo quei principi, _soprattutto_ perché il valore informativo dei
miei dati personali VOGLIO che diventi zero una volta che con quel
determinato fornitore ho cessato ogni rapporto
cosa ben diversa è la _pubblicazione_ di ALCUNI dati personali, che SE
avviene nell'ambito del c.d. interesse pubblico dovrebbe già essere
ampiamente tutelata dal codice penale e civile, che superano di gran
lunga il GDPR... ma io sono dilettante e ingenuo
il solo pensiero che "la privacy" venga di tanto in tanto abusata come
mezzo di CENSURA sia di attività di pubblica informazione che di
attività di pubblica sicurezza mi disturba alquanto
[...]
> Però non facciamolo usando il GDPR come fosse il baluardo che difende
> l'umanità
soprattutto non facciamolo usando il GDPR come una _clava_ contro "la
qualsiasi", perché fa malissimo allo stato di diritto
> dall'AI cattiva e dai cattivi che la governano. I problemi sono altri
> e necessitano di risposte diverse.
tipo: vogliamo vietare o no che TONNELLATE di dati personali
riservatissimi quali email, chat, compiti in classe, risultati di test
scolastici, risultati di visite mediche, ecc. vengano raccolti ed
elaborati? Certe cose non dovrebbero essere fatte NEMMENO col consenso
dei "titolari dei diritti", perché sono comunque /minorati/.
[...]
Grazie per l'attenzione.
Saluti, 380°
--
380° (Giovanni Biscuolo public alter ego)
«Noi, incompetenti come siamo,
non abbiamo alcun titolo per suggerire alcunché»
Disinformation flourishes because many people care deeply about injustice
but very few check the facts. Ask me about <https://stallmansupport.org>.
Dec. 5, 2024
Re: [nexa] The Curious Case of David Mayer, the man ChatGPT cannot name
by Andrea Bolioli
Grazie mille per le integrazioni.
Per quanto riguarda i dati personali presenti nei testi, dal punto di vista
tecnico NLP una soluzione sarebbe l’anonimizzazione (eliminare dai testi i
dati personali / identificatori per cui non si ha l’autorizzazione al
trattamento). Soluzione complicata ma teoricamente possibile, che si può
fare in modo più o meno restrittivo.
Inoltre, i tipi di testi, e quindi anche le news, possono essere
classificati automaticamente, scartando quelli che non si possono
riutilizzare . Riguardo alle persone, si possono ad es fare distinzioni tra
personaggi pubblici e no.
Si tratta di tecnologie/metodologie di cui le grandi aziende Ai dispongono.
Fino a un paio di anni fa, per creare LLM si è buttato dentro tutto,
“ramazzando” tutto quanto con poco preprocessing.
Buona giornata,
Andrea
Il giorno gio 5 dic 2024 alle 00:41 Carlo Blengino <
blengino(a)penalistiassociati.it> ha scritto:
> Sono molto d'accordo con Guido Vetere, e questo mi dà l'occasione di
> chiarire la mia affermazione, forse un po' troppo secca,
> sull'incompatibilità del GDPR, e anche di rispondere indirettamente alle
> considerazioni che precedono. Non mi riferivo infatti solo al problema
> del diritto alla cancellazione.
>
> Non sono sicuro che la cessione nel caso GEDI fosse per sperimentare
> servizi basati su RAG, ma se anche così fosse, e i dati non fossero
> utilizzati per addestramento, vi sarebbe comunque un trasferimento di dati
> ad OpenAI, quanto meno per la vettorializzazione (credo si dica così) e si
> aprirebbero comunque infinite diatribe sulla corretta attribuzione dei
> ruoli di titolare e responsabile tra i diversi soggetti. Risolto
> faticosamente quello, il problema per cui un archivio pubblico come
> l'archivio di un grande quotidiano per il GDPR non sarà mai usabile da un
> fornitore per l'addestramento è vera, quale che sia la modalità di
> acquisizione (che sia con lo scraping o con accordi). Non ci sarà mai
> infatti per fini commeriali/imprenditoriali una base giuridica che
> legittimi il trattamento di archivi così rilevanti, almeno in UE, perchè
> quel dataset contiene per forza dati particolari ex art.9 e dati giudiziari
> ex art. 10, circostanza questa che esclude il legittimo interesse. Solo che
> quella è l'unica possibilità di liceità del trattamento (il consenso
> ovviamente non è neppure pensabile), ed è già stata piegata e forzata fin
> troppo per i motori di ricerca dopo la sentenza Costeja Gonzales della ECJ.
> Per salvare il trattamento dei motori di ricerca quali titolari del
> trattamento sulla base del legittimo interesse si sono compiute capriole
> interpretative notevoli là dove tale base è recessiva rispetto al divieto
> di trattamento di dati particolari, ma lì era più facile e nessuno poteva
> vietare Google Search.
> Con gli LLM però non se ne esce, ed i tempi sono cambiati.
> Eppure gli archivi sono una fonte credo fondamentale e viene usata a man
> bassa, tant'è che adesso è oggetto di "licenze" e di monetizzazione.
> E mi chiedo cosa intenda il Garante quando parla di "licenza", termine più
> consono alle privative legate alla proprietà intellettuale (altra normativa
> in frizione) che non al tema della protezione dati. Nel GDPR non esiste
> nessuna "esclusiva" e nessuna licenza (c'è qualcosa di simile nel Data Act,
> ma è riferito ad altro); i dati personali, a maggior ragione se pubblici,
> non sono di nessuno (il titolare è il titolare del trattamento, non dei
> dati, e l'interessato non possiede i suoi dati, può pretenderne la
> protezione, a determinate condizioni). E bene che sia così, perchè i dati,
> rectius le informazioni, anche personali devono circolare santo cielo! Sono
> la base della conoscenza, anche quella delle macchine spara stronzate
> (frankfurtianamente)
> Aggiungo che, dal mio punto di vista, questo tipo di accordi sono un
> disastro per tutti, ma non perchè violino chissà quale diritto fondamentale
> dei cittadini o la protezione dei dati, ma perché generano delle privative
> e delle barriere economiche distorsive basate sul nulla, almeno sotto il
> profilo della data protection (a mio giudizio anche sotto il profilo della
> proprietà intellettuale, ma li le privative esistono davvero!).
>
> E di situazioni così, di incompatibilità, è piena la strada delle
> tecnologie dell'informazione che necessitano della ruminazione di molte
> informazioni.
>
> Quando uscì il GDPR (2016) ricordo che in studio ci dicemmo: ma sta roba è
> incompatibile con il BigData (in allora il termine era una buzzword).
> Minimizzazione, limitazione della conservazione, stretta finalità...tutta
> roba contraria al valore informativo dei dati, ma per fortuna c'erano mille
> eccezioni, varianti e deroghe e soprattutto quei principi si potevano
> piegare, adattare e soprattutto i pochi che si occupavano di protezione
> dati dal 1995 sapevano che era un diritto dai confini incerti, bilanciabile
> e recessivo, molto diverso dalla riservatezza (che quella sì se la passava
> già davvero male).
>
> Possiamo decidere che quelle macchine e quelle tecnologie sono un male,
> che i Salami non hanno alcun interesse per l'umanità, e che non meritano
> tutela alcuna. Bene. Non ne so abbastanza per dirlo e conto molto su di voi
> tecnici. Decidiamolo e lasciamole morire. Però non facciamolo usando il
> GDPR come fosse il baluardo che difende l'umanità dall'AI cattiva e dai
> cattivi che la governano. I problemi sono altri e necessitano di risposte
> diverse.
>
> Forse ho peggiorato la mia posizione e temo gli sfottò del buon Tesio, ma
> sono comunque sempre grato a tutti in questa lista per gli stimoli e le
> riflessioni che mi suscitate.
> CB
>
>
>
> ne fondi il trattamento
>
>
> Il giorno mer 4 dic 2024 alle ore 22:40 Guido Vetere <
> vetere.guido(a)gmail.com> ha scritto:
>
>> Credo che il rilievo del Garante sul caso GEDI sia un atto dovuto: non si
>> possono cedere dati sensibili di cui si è responsabili, che i giornali
>> pubblicano in base al diritto di cronaca, a soggetti terzi che ne vogliono
>> farne usi diversi senza il consenso degli interessati. Quindi la cessione
>> sarebbe illecita anche se OpenAI (o chi per essa) avesse modo di correggere
>> e smentire le notizie 'on the fly' come possono fare i giornali.
>>
>> Il problema è che i LLM acquisiscono competenze linguistiche generali (ad
>> es. quelle che servono per fare summarization) e fattuali (chi è David
>> Mayer) allo stesso modo, e anche se sulla modularizzazione si sono fatti
>> progressi, tutto è più o meno fuso in un sol blocco.
>>
>> Diverso è il caso in cui gli LLM sono usati per fare Retrieval Augmented
>> Generation (RAG). In questi casi, le competenze fattuali si trovano nei
>> documenti 'in chiaro' dove il RAG va a pescare, e alla componente LLM
>> spetta solo il compito di mettere in bella prosa alcuni passaggi
>> informativi che non si trovano nel modello ma appunto in qualche testo
>> leggibile e emendabile.
>>
>> La notizia è che per questo esercizio bastano modelli relativamente
>> piccoli, anche 'aperti', e non è impensabile che questi possano essere
>> costruiti con dati 'puliti'.
>> Nota a margine: quello che GEDI dice di voler fare, da quello che
>> capisco, è esattamente un RAG, come quello che altre testate (es.
>> Washington Post) stanno sperimentando. Non c'è davvero bisogno che OpenAI
>> faccia training sul loro archivio.
>>
>> G.
>>
>>
>> On Tue, 3 Dec 2024 at 12:04, Stefano Quintarelli via nexa <
>> nexa(a)server-nexa.polito.it> wrote:
>>
>>> Ciao Carlo
>>>
>>> On 02/12/24 23:55, Carlo Blengino wrote:
>>> > Grazie!
>>> > Interessante leggere come da lontano vedano il GDPR e il diritto
>>> > all'oblio (o quello che è).
>>> > La cosa più certa, al di là del caso Mayer, è che, mi pare, il GDPR se
>>> > interpretato restrittivamente non è compatibile con la tecnologia
>>> degli
>>> > LLM. Punto. Si possono fare un po' di accrocchi, ma di fondo c'è un
>>> > totale contrasto, su più principi di base. E questo è un problema per
>>> > l'Europa.
>>>
>>> non mi pare.
>>> se non ricordo male c'e' un termine di 3 mesi, il che vorrebbe dire 4
>>> re-training del modello all'anno.
>>>
>>> per l'azienda si tratta di trovare il punto di equilibrio costi/benefici
>>> rispetto alle dimensioni del proprio modello (e per il sistema, fare un
>>> po' di ricerca su metodi di ottimizzazione)
>>>
>>> https://neuralmagic.com/blog/24-sparse-llama-smaller-models-for-efficient-g…
>>>
>>> d'altronde, anche il consorzio obbligatorio degli olii usati è una
>>> maggiorazione di costi per i meccanici...
>>> :-)
>>>
>>>
>>>
>>> > Il caso GEDI https://www.ilsole24ore.com/art/nel-mirino-garante-l-
>>> > accordo-gedi-openai-AGJLoOTB <https://www.ilsole24ore.com/art/nel-
>>> > mirino-garante-l-accordo-gedi-openai-AGJLoOTB> ne è ulteriore riprova
>>> > (quell'accordo e tutti gli accordi in atto sono una pessima deriva,
>>> sia
>>> > chiaro, ma per altre ragioni)
>>> > Aggiungo a scanso di equivoci, che questa considerazione non vuol dire
>>> a
>>> > mio parere che vi sia incompatibilità tra queste tecnologie ed il
>>> > sacrosanto diritto fondamentale alla protezione dei dati personali.
>>> > CB
>>> >
>>> >
>>> >
>>> > Il giorno lun 2 dic 2024 alle ore 22:32 Daniela Tafani
>>> > <daniela.tafani(a)unipi.it <mailto:daniela.tafani@unipi.it>> ha scritto:
>>> >
>>> > Dec 01, 2024 - Georg Zoeller (AILTI)
>>> > The Curious Case of David Mayer, the man ChatGPT cannot name.
>>> >
>>> > ChatGPT users have noticed a curious behavior: It refuses to talk
>>> > about a 'David Mayer'. We have the explanation and point out less
>>> > obvious implications.
>>> >
>>> > TL;DR: While not a juicy conspiracy, OpenAI cut some corners on
>>> > regulatory compliance and the implications are less benign than
>>> they
>>> > seem. In fact, they can be weaponized with unexpected consequences.
>>> >
>>> > ChatGPT is well known for not knowing when to stop talking - the
>>> > underlying transformer architecture lends itself to hallucinations
>>> > in situations when the model is asked to generate text beyond the
>>> > context it was trained on. Even more curious, sometimes it starts
>>> > giving a response, only to change its mind mid sentence, and
>>> > terminating the conversation.
>>> >
>>> > So naturally, when the software stops and refuses to answer, users
>>> > take notice. In this case, ChatGPT users found that mention of the
>>> > name “David Mayer”, whenever included in a message, would
>>> > consistently cause the model to terminate the conversation.
>>> >
>>> > It’s a conspiracy!
>>> > Creating even more mystery, chatGPT rejection messages quickly move
>>> > from unhelpful to ominously threatening when the user starts
>>> > investigating the phenomenon.
>>> >
>>> > Continua qui:
>>> > <https://centreforaileadership.org/resources/
>>> > analysis_the_curious_case_of_one_david_mayer/ <https://
>>> > centreforaileadership.org/resources/
>>> > analysis_the_curious_case_of_one_david_mayer/>>
>>> >
>>> >
>>> >
>>> > --
>>> > *
>>> > *
>>> > *Avv. Carlo Blengino*
>>> > *
>>> > *
>>> > /Via Duchessa Jolanda n. 19,/
>>> <https://www.google.com/maps/search/Via+Duchessa+Jolanda+n.+19,%2F+%0D%0A+%2…>
>>>
>>> <https://www.google.com/maps/search/Via+Duchessa+Jolanda+n.+19,%2F+%0D%0A+%2…>>
>>> /10138 Torino (TO) - Italy
>>> <https://www.google.com/maps/search/Via+Duchessa+Jolanda+n.+19,%2F+%0D%0A+%2…>
>>> /
>>> > /tel. +39 011 4474035/
>>> > Penalistiassociati.it
>>> > //
>>>
>>> --
>>> You can reach me on Signal: @quinta.01 (no Whatsapp, no Telegram)
>>>
>>>
>
> --
> *Avv. Carlo Blengino*
> *Via Duchessa Jolanda n. 19,
> <https://www.google.com/maps/search/Via+Duchessa+Jolanda+n.+19,+10138+Torino…>*
> *10138 Torino (TO) - Italy
> <https://www.google.com/maps/search/Via+Duchessa+Jolanda+n.+19,+10138+Torino…>*
> *tel. +39 011 4474035*
> Penalistiassociati.it
>
Dec. 5, 2024
Re: [nexa] The Curious Case of David Mayer, the man ChatGPT cannot name
by Carlo Blengino
Sono molto d'accordo con Guido Vetere, e questo mi dà l'occasione di
chiarire la mia affermazione, forse un po' troppo secca,
sull'incompatibilità del GDPR, e anche di rispondere indirettamente alle
considerazioni che precedono. Non mi riferivo infatti solo al problema
del diritto alla cancellazione.
Non sono sicuro che la cessione nel caso GEDI fosse per sperimentare
servizi basati su RAG, ma se anche così fosse, e i dati non fossero
utilizzati per addestramento, vi sarebbe comunque un trasferimento di dati
ad OpenAI, quanto meno per la vettorializzazione (credo si dica così) e si
aprirebbero comunque infinite diatribe sulla corretta attribuzione dei
ruoli di titolare e responsabile tra i diversi soggetti. Risolto
faticosamente quello, il problema per cui un archivio pubblico come
l'archivio di un grande quotidiano per il GDPR non sarà mai usabile da un
fornitore per l'addestramento è vera, quale che sia la modalità di
acquisizione (che sia con lo scraping o con accordi). Non ci sarà mai
infatti per fini commeriali/imprenditoriali una base giuridica che
legittimi il trattamento di archivi così rilevanti, almeno in UE, perchè
quel dataset contiene per forza dati particolari ex art.9 e dati giudiziari
ex art. 10, circostanza questa che esclude il legittimo interesse. Solo che
quella è l'unica possibilità di liceità del trattamento (il consenso
ovviamente non è neppure pensabile), ed è già stata piegata e forzata fin
troppo per i motori di ricerca dopo la sentenza Costeja Gonzales della ECJ.
Per salvare il trattamento dei motori di ricerca quali titolari del
trattamento sulla base del legittimo interesse si sono compiute capriole
interpretative notevoli là dove tale base è recessiva rispetto al divieto
di trattamento di dati particolari, ma lì era più facile e nessuno poteva
vietare Google Search.
Con gli LLM però non se ne esce, ed i tempi sono cambiati.
Eppure gli archivi sono una fonte credo fondamentale e viene usata a man
bassa, tant'è che adesso è oggetto di "licenze" e di monetizzazione.
E mi chiedo cosa intenda il Garante quando parla di "licenza", termine più
consono alle privative legate alla proprietà intellettuale (altra normativa
in frizione) che non al tema della protezione dati. Nel GDPR non esiste
nessuna "esclusiva" e nessuna licenza (c'è qualcosa di simile nel Data Act,
ma è riferito ad altro); i dati personali, a maggior ragione se pubblici,
non sono di nessuno (il titolare è il titolare del trattamento, non dei
dati, e l'interessato non possiede i suoi dati, può pretenderne la
protezione, a determinate condizioni). E bene che sia così, perchè i dati,
rectius le informazioni, anche personali devono circolare santo cielo! Sono
la base della conoscenza, anche quella delle macchine spara stronzate
(frankfurtianamente)
Aggiungo che, dal mio punto di vista, questo tipo di accordi sono un
disastro per tutti, ma non perchè violino chissà quale diritto fondamentale
dei cittadini o la protezione dei dati, ma perché generano delle privative
e delle barriere economiche distorsive basate sul nulla, almeno sotto il
profilo della data protection (a mio giudizio anche sotto il profilo della
proprietà intellettuale, ma li le privative esistono davvero!).
E di situazioni così, di incompatibilità, è piena la strada delle
tecnologie dell'informazione che necessitano della ruminazione di molte
informazioni.
Quando uscì il GDPR (2016) ricordo che in studio ci dicemmo: ma sta roba è
incompatibile con il BigData (in allora il termine era una buzzword).
Minimizzazione, limitazione della conservazione, stretta finalità...tutta
roba contraria al valore informativo dei dati, ma per fortuna c'erano mille
eccezioni, varianti e deroghe e soprattutto quei principi si potevano
piegare, adattare e soprattutto i pochi che si occupavano di protezione
dati dal 1995 sapevano che era un diritto dai confini incerti, bilanciabile
e recessivo, molto diverso dalla riservatezza (che quella sì se la passava
già davvero male).
Possiamo decidere che quelle macchine e quelle tecnologie sono un male, che
i Salami non hanno alcun interesse per l'umanità, e che non meritano tutela
alcuna. Bene. Non ne so abbastanza per dirlo e conto molto su di voi
tecnici. Decidiamolo e lasciamole morire. Però non facciamolo usando il
GDPR come fosse il baluardo che difende l'umanità dall'AI cattiva e dai
cattivi che la governano. I problemi sono altri e necessitano di risposte
diverse.
Forse ho peggiorato la mia posizione e temo gli sfottò del buon Tesio, ma
sono comunque sempre grato a tutti in questa lista per gli stimoli e le
riflessioni che mi suscitate.
CB
ne fondi il trattamento
Il giorno mer 4 dic 2024 alle ore 22:40 Guido Vetere <vetere.guido(a)gmail.com>
ha scritto:
> Credo che il rilievo del Garante sul caso GEDI sia un atto dovuto: non si
> possono cedere dati sensibili di cui si è responsabili, che i giornali
> pubblicano in base al diritto di cronaca, a soggetti terzi che ne vogliono
> farne usi diversi senza il consenso degli interessati. Quindi la cessione
> sarebbe illecita anche se OpenAI (o chi per essa) avesse modo di correggere
> e smentire le notizie 'on the fly' come possono fare i giornali.
>
> Il problema è che i LLM acquisiscono competenze linguistiche generali (ad
> es. quelle che servono per fare summarization) e fattuali (chi è David
> Mayer) allo stesso modo, e anche se sulla modularizzazione si sono fatti
> progressi, tutto è più o meno fuso in un sol blocco.
>
> Diverso è il caso in cui gli LLM sono usati per fare Retrieval Augmented
> Generation (RAG). In questi casi, le competenze fattuali si trovano nei
> documenti 'in chiaro' dove il RAG va a pescare, e alla componente LLM
> spetta solo il compito di mettere in bella prosa alcuni passaggi
> informativi che non si trovano nel modello ma appunto in qualche testo
> leggibile e emendabile.
>
> La notizia è che per questo esercizio bastano modelli relativamente
> piccoli, anche 'aperti', e non è impensabile che questi possano essere
> costruiti con dati 'puliti'.
> Nota a margine: quello che GEDI dice di voler fare, da quello che capisco,
> è esattamente un RAG, come quello che altre testate (es. Washington Post)
> stanno sperimentando. Non c'è davvero bisogno che OpenAI faccia training
> sul loro archivio.
>
> G.
>
>
> On Tue, 3 Dec 2024 at 12:04, Stefano Quintarelli via nexa <
> nexa(a)server-nexa.polito.it> wrote:
>
>> Ciao Carlo
>>
>> On 02/12/24 23:55, Carlo Blengino wrote:
>> > Grazie!
>> > Interessante leggere come da lontano vedano il GDPR e il diritto
>> > all'oblio (o quello che è).
>> > La cosa più certa, al di là del caso Mayer, è che, mi pare, il GDPR se
>> > interpretato restrittivamente non è compatibile con la tecnologia degli
>> > LLM. Punto. Si possono fare un po' di accrocchi, ma di fondo c'è un
>> > totale contrasto, su più principi di base. E questo è un problema per
>> > l'Europa.
>>
>> non mi pare.
>> se non ricordo male c'e' un termine di 3 mesi, il che vorrebbe dire 4
>> re-training del modello all'anno.
>>
>> per l'azienda si tratta di trovare il punto di equilibrio costi/benefici
>> rispetto alle dimensioni del proprio modello (e per il sistema, fare un
>> po' di ricerca su metodi di ottimizzazione)
>>
>> https://neuralmagic.com/blog/24-sparse-llama-smaller-models-for-efficient-g…
>>
>> d'altronde, anche il consorzio obbligatorio degli olii usati è una
>> maggiorazione di costi per i meccanici...
>> :-)
>>
>>
>>
>> > Il caso GEDI https://www.ilsole24ore.com/art/nel-mirino-garante-l-
>> > accordo-gedi-openai-AGJLoOTB <https://www.ilsole24ore.com/art/nel-
>> > mirino-garante-l-accordo-gedi-openai-AGJLoOTB> ne è ulteriore riprova
>> > (quell'accordo e tutti gli accordi in atto sono una pessima deriva, sia
>> > chiaro, ma per altre ragioni)
>> > Aggiungo a scanso di equivoci, che questa considerazione non vuol dire
>> a
>> > mio parere che vi sia incompatibilità tra queste tecnologie ed il
>> > sacrosanto diritto fondamentale alla protezione dei dati personali.
>> > CB
>> >
>> >
>> >
>> > Il giorno lun 2 dic 2024 alle ore 22:32 Daniela Tafani
>> > <daniela.tafani(a)unipi.it <mailto:daniela.tafani@unipi.it>> ha scritto:
>> >
>> > Dec 01, 2024 - Georg Zoeller (AILTI)
>> > The Curious Case of David Mayer, the man ChatGPT cannot name.
>> >
>> > ChatGPT users have noticed a curious behavior: It refuses to talk
>> > about a 'David Mayer'. We have the explanation and point out less
>> > obvious implications.
>> >
>> > TL;DR: While not a juicy conspiracy, OpenAI cut some corners on
>> > regulatory compliance and the implications are less benign than they
>> > seem. In fact, they can be weaponized with unexpected consequences.
>> >
>> > ChatGPT is well known for not knowing when to stop talking - the
>> > underlying transformer architecture lends itself to hallucinations
>> > in situations when the model is asked to generate text beyond the
>> > context it was trained on. Even more curious, sometimes it starts
>> > giving a response, only to change its mind mid sentence, and
>> > terminating the conversation.
>> >
>> > So naturally, when the software stops and refuses to answer, users
>> > take notice. In this case, ChatGPT users found that mention of the
>> > name “David Mayer”, whenever included in a message, would
>> > consistently cause the model to terminate the conversation.
>> >
>> > It’s a conspiracy!
>> > Creating even more mystery, chatGPT rejection messages quickly move
>> > from unhelpful to ominously threatening when the user starts
>> > investigating the phenomenon.
>> >
>> > Continua qui:
>> > <https://centreforaileadership.org/resources/
>> > analysis_the_curious_case_of_one_david_mayer/ <https://
>> > centreforaileadership.org/resources/
>> > analysis_the_curious_case_of_one_david_mayer/>>
>> >
>> >
>> >
>> > --
>> > *
>> > *
>> > *Avv. Carlo Blengino*
>> > *
>> > *
>> > /Via Duchessa Jolanda n. 19,/
>> > /10138 Torino (TO) - Italy/
>> > /tel. +39 011 4474035/
>> > Penalistiassociati.it
>> > //
>>
>> --
>> You can reach me on Signal: @quinta.01 (no Whatsapp, no Telegram)
>>
>>
--
*Avv. Carlo Blengino*
*Via Duchessa Jolanda n. 19,*
*10138 Torino (TO) - Italy*
*tel. +39 011 4474035*
Penalistiassociati.it
Dec. 4, 2024
Re: [nexa] The Curious Case of David Mayer, the man ChatGPT cannot name
by Guido Vetere
Credo che il rilievo del Garante sul caso GEDI sia un atto dovuto: non si
possono cedere dati sensibili di cui si è responsabili, che i giornali
pubblicano in base al diritto di cronaca, a soggetti terzi che ne vogliono
farne usi diversi senza il consenso degli interessati. Quindi la cessione
sarebbe illecita anche se OpenAI (o chi per essa) avesse modo di correggere
e smentire le notizie 'on the fly' come possono fare i giornali.
Il problema è che i LLM acquisiscono competenze linguistiche generali (ad
es. quelle che servono per fare summarization) e fattuali (chi è David
Mayer) allo stesso modo, e anche se sulla modularizzazione si sono fatti
progressi, tutto è più o meno fuso in un sol blocco.
Diverso è il caso in cui gli LLM sono usati per fare Retrieval Augmented
Generation (RAG). In questi casi, le competenze fattuali si trovano nei
documenti 'in chiaro' dove il RAG va a pescare, e alla componente LLM
spetta solo il compito di mettere in bella prosa alcuni passaggi
informativi che non si trovano nel modello ma appunto in qualche testo
leggibile e emendabile.
La notizia è che per questo esercizio bastano modelli relativamente
piccoli, anche 'aperti', e non è impensabile che questi possano essere
costruiti con dati 'puliti'.
Nota a margine: quello che GEDI dice di voler fare, da quello che capisco,
è esattamente un RAG, come quello che altre testate (es. Washington Post)
stanno sperimentando. Non c'è davvero bisogno che OpenAI faccia training
sul loro archivio.
G.
On Tue, 3 Dec 2024 at 12:04, Stefano Quintarelli via nexa <
nexa(a)server-nexa.polito.it> wrote:
> Ciao Carlo
>
> On 02/12/24 23:55, Carlo Blengino wrote:
> > Grazie!
> > Interessante leggere come da lontano vedano il GDPR e il diritto
> > all'oblio (o quello che è).
> > La cosa più certa, al di là del caso Mayer, è che, mi pare, il GDPR se
> > interpretato restrittivamente non è compatibile con la tecnologia degli
> > LLM. Punto. Si possono fare un po' di accrocchi, ma di fondo c'è un
> > totale contrasto, su più principi di base. E questo è un problema per
> > l'Europa.
>
> non mi pare.
> se non ricordo male c'e' un termine di 3 mesi, il che vorrebbe dire 4
> re-training del modello all'anno.
>
> per l'azienda si tratta di trovare il punto di equilibrio costi/benefici
> rispetto alle dimensioni del proprio modello (e per il sistema, fare un
> po' di ricerca su metodi di ottimizzazione)
>
> https://neuralmagic.com/blog/24-sparse-llama-smaller-models-for-efficient-g…
>
> d'altronde, anche il consorzio obbligatorio degli olii usati è una
> maggiorazione di costi per i meccanici...
> :-)
>
>
>
> > Il caso GEDI https://www.ilsole24ore.com/art/nel-mirino-garante-l-
> > accordo-gedi-openai-AGJLoOTB <https://www.ilsole24ore.com/art/nel-
> > mirino-garante-l-accordo-gedi-openai-AGJLoOTB> ne è ulteriore riprova
> > (quell'accordo e tutti gli accordi in atto sono una pessima deriva, sia
> > chiaro, ma per altre ragioni)
> > Aggiungo a scanso di equivoci, che questa considerazione non vuol dire a
> > mio parere che vi sia incompatibilità tra queste tecnologie ed il
> > sacrosanto diritto fondamentale alla protezione dei dati personali.
> > CB
> >
> >
> >
> > Il giorno lun 2 dic 2024 alle ore 22:32 Daniela Tafani
> > <daniela.tafani(a)unipi.it <mailto:daniela.tafani@unipi.it>> ha scritto:
> >
> > Dec 01, 2024 - Georg Zoeller (AILTI)
> > The Curious Case of David Mayer, the man ChatGPT cannot name.
> >
> > ChatGPT users have noticed a curious behavior: It refuses to talk
> > about a 'David Mayer'. We have the explanation and point out less
> > obvious implications.
> >
> > TL;DR: While not a juicy conspiracy, OpenAI cut some corners on
> > regulatory compliance and the implications are less benign than they
> > seem. In fact, they can be weaponized with unexpected consequences.
> >
> > ChatGPT is well known for not knowing when to stop talking - the
> > underlying transformer architecture lends itself to hallucinations
> > in situations when the model is asked to generate text beyond the
> > context it was trained on. Even more curious, sometimes it starts
> > giving a response, only to change its mind mid sentence, and
> > terminating the conversation.
> >
> > So naturally, when the software stops and refuses to answer, users
> > take notice. In this case, ChatGPT users found that mention of the
> > name “David Mayer”, whenever included in a message, would
> > consistently cause the model to terminate the conversation.
> >
> > It’s a conspiracy!
> > Creating even more mystery, chatGPT rejection messages quickly move
> > from unhelpful to ominously threatening when the user starts
> > investigating the phenomenon.
> >
> > Continua qui:
> > <https://centreforaileadership.org/resources/
> > analysis_the_curious_case_of_one_david_mayer/ <https://
> > centreforaileadership.org/resources/
> > analysis_the_curious_case_of_one_david_mayer/>>
> >
> >
> >
> > --
> > *
> > *
> > *Avv. Carlo Blengino*
> > *
> > *
> > /Via Duchessa Jolanda n. 19,/
> > /10138 Torino (TO) - Italy/
> > /tel. +39 011 4474035/
> > Penalistiassociati.it
> > //
>
> --
> You can reach me on Signal: @quinta.01 (no Whatsapp, no Telegram)
>
>
Dec. 4, 2024
"New report highlights the scientific impact of open source software"
by J.C. DE MARTIN
*New report highlights the scientific impact of open source software*
Two of the scientists who won this year’s Nobel Prize
<https://www.nobelprize.org/prizes/chemistry/2024/press-release/> for
cracking the code of proteins’ intricate structures relied, in part, on
a series of computing models that anyone with a computer and the right
understanding can access and run.
Their creation, collectively called AlphaFold, quickly and accurately
predicts the three-dimensional structure of each of the millions of
proteins in the human body, a key to understanding their unique
functions. In designing this model, Demis Hassabis and John Jumper
relied on the shared work of tens of thousands of scientists and
publicly available open source software, underscoring how open science
is powering scientific discovery.
Open source software refers to blocks of code that are developed and
maintained online for anyone to use, improve, or share as they see fit —
all for free. Biomedical scientists depend on these public tools to
analyze large, complex data sets, paving the way for the development of
new drugs and treatments.
[...]
continua qui:
https://www.statnews.com/sponsor/2024/11/26/new-report-highlights-the-scien…
Dec. 4, 2024
"Why ‘open’ AI systems are actually closed, and why this matters"
by J.C. DE MARTIN
Published: 27 November 2024
*Why ‘open’ AI systems are actually closed, and why this matters
*
David Gray Widder, Meredith Whittaker & Sarah Myers West
/
Nature/ *635*, 827–833 (2024). https://doi.org/10.1038/s41586-024-08141-1
Abstract
This paper examines ‘open’ artificial intelligence (AI). Claims about
‘open’ AI often lack precision, frequently eliding scrutiny of
substantial industry concentration in large-scale AI development and
deployment, and often incorrectly applying understandings of ‘open’
imported from free and open-source software to AI systems. At present,
powerful actors are seeking to shape policy using claims that ‘open’ AI
is either beneficial to innovation and democracy, on the one hand, or
detrimental to safety, on the other. When policy is being shaped,
definitions matter. To add clarity to this debate, we examine the basis
for claims of openness in AI, and offer a material analysis of what AI
is and what ‘openness’ in AI can and cannot provide: examining models,
data, labour, frameworks, and computational power. We highlight three
main affordances of ‘open’ AI, namely transparency, reusability, and
extensibility, and we observe that maximally ‘open’ AI allows some forms
of oversight and experimentation on top of existing models. However, we
find that openness alone does not perturb the concentration of power in
AI. Just as many traditional open-source software projects were co-opted
in various ways by large technology companies, we show how rhetoric
around ‘open’ AI is frequently wielded in ways that exacerbate rather
than reduce concentration of power in the AI sector.
https://www.nature.com/articles/s41586-024-08141-1
Dec. 4, 2024
Articolo per il Manifesto
by J.C. DE MARTIN
Mie riflessioni oggi sul Manifesto:
https://ilmanifesto.it/smartphone-cambiare-prima-di-vietare
Per leggere, basta registrarsi. Se qualcuno avesse comunque problemi, mi
scriva.
juan carlos
Dec. 3, 2024
Nuovo rapporto: "Reclaiming Digital Sovereignty"
by J.C. DE MARTIN
Oggi alle 16 è stato pubblicato questo rapporto dal titolo "Reclaiming
Digital Sovereignty"
https://www.ucl.ac.uk/bartlett/public-purpose/publications/2024/dec/reclaim…
Penso che meriti una lettura :-)
juan carlos
Dec. 3, 2024
Re: [nexa] The Curious Case of David Mayer, the man ChatGPT cannot name
by Stefano Quintarelli
Ciao Carlo
On 02/12/24 23:55, Carlo Blengino wrote:
> Grazie!
> Interessante leggere come da lontano vedano il GDPR e il diritto
> all'oblio (o quello che è).
> La cosa più certa, al di là del caso Mayer, è che, mi pare, il GDPR se
> interpretato restrittivamente non è compatibile con la tecnologia degli
> LLM. Punto. Si possono fare un po' di accrocchi, ma di fondo c'è un
> totale contrasto, su più principi di base. E questo è un problema per
> l'Europa.
non mi pare.
se non ricordo male c'e' un termine di 3 mesi, il che vorrebbe dire 4
re-training del modello all'anno.
per l'azienda si tratta di trovare il punto di equilibrio costi/benefici
rispetto alle dimensioni del proprio modello (e per il sistema, fare un
po' di ricerca su metodi di ottimizzazione)
https://neuralmagic.com/blog/24-sparse-llama-smaller-models-for-efficient-g…
d'altronde, anche il consorzio obbligatorio degli olii usati è una
maggiorazione di costi per i meccanici...
:-)
> Il caso GEDI https://www.ilsole24ore.com/art/nel-mirino-garante-l-
> accordo-gedi-openai-AGJLoOTB <https://www.ilsole24ore.com/art/nel-
> mirino-garante-l-accordo-gedi-openai-AGJLoOTB> ne è ulteriore riprova
> (quell'accordo e tutti gli accordi in atto sono una pessima deriva, sia
> chiaro, ma per altre ragioni)
> Aggiungo a scanso di equivoci, che questa considerazione non vuol dire a
> mio parere che vi sia incompatibilità tra queste tecnologie ed il
> sacrosanto diritto fondamentale alla protezione dei dati personali.
> CB
>
>
>
> Il giorno lun 2 dic 2024 alle ore 22:32 Daniela Tafani
> <daniela.tafani(a)unipi.it <mailto:daniela.tafani@unipi.it>> ha scritto:
>
> Dec 01, 2024 - Georg Zoeller (AILTI)
> The Curious Case of David Mayer, the man ChatGPT cannot name.
>
> ChatGPT users have noticed a curious behavior: It refuses to talk
> about a 'David Mayer'. We have the explanation and point out less
> obvious implications.
>
> TL;DR: While not a juicy conspiracy, OpenAI cut some corners on
> regulatory compliance and the implications are less benign than they
> seem. In fact, they can be weaponized with unexpected consequences.
>
> ChatGPT is well known for not knowing when to stop talking - the
> underlying transformer architecture lends itself to hallucinations
> in situations when the model is asked to generate text beyond the
> context it was trained on. Even more curious, sometimes it starts
> giving a response, only to change its mind mid sentence, and
> terminating the conversation.
>
> So naturally, when the software stops and refuses to answer, users
> take notice. In this case, ChatGPT users found that mention of the
> name “David Mayer”, whenever included in a message, would
> consistently cause the model to terminate the conversation.
>
> It’s a conspiracy!
> Creating even more mystery, chatGPT rejection messages quickly move
> from unhelpful to ominously threatening when the user starts
> investigating the phenomenon.
>
> Continua qui:
> <https://centreforaileadership.org/resources/
> analysis_the_curious_case_of_one_david_mayer/ <https://
> centreforaileadership.org/resources/
> analysis_the_curious_case_of_one_david_mayer/>>
>
>
>
> --
> *
> *
> *Avv. Carlo Blengino*
> *
> *
> /Via Duchessa Jolanda n. 19,/
> /10138 Torino (TO) - Italy/
> /tel. +39 011 4474035/
> Penalistiassociati.it
> //
--
You can reach me on Signal: @quinta.01 (no Whatsapp, no Telegram)
Dec. 3, 2024
Re: [nexa] The Curious Case of David Mayer, the man ChatGPT cannot name
by Stefano Borroni Barale
Buongiorno,
da fisico (quindi turista del diritto e da semplice 'smanettone' informatico) non sono certo di aver ben compreso su che base si fonda il ragionamento secondo il quale tale tecnologia non sarebbe compatibile con la protezione dei dati personali (la vedo abbastanza come Giacomo, direi). Ammesso e non concesso che lo sia, direi che sarebbe una cattiva notizia per l'Ai sub-simbolica, che andrebbe abbandonata di corsa.
Osservazioni:
- non sarebbe la prima volta che l'Ai sub-simbolica viene abbandonata. Basti dire che John McCarthy scriveva che non credeva nella bontà dell'approccio sub-simbolico, che ha già conosciuto un "inverno". E certamente non era uno scettico dell'Ai;
- non sarebbe la prima volta che una tecnologia/materiale/sostanza viene abbandonata, senza che questo causi non solo l'arresto del progresso, ma nemmeno l'arresto di un determinato campo tecnologico. Per esempio l'abbandono del piombo come additivo per alimentare i motori a scoppio non ha certo fermato la diffusione di tali motori (purtroppo);
- molti, e non da oggi (da oggi non più solo Gary Marcus), pensano che il puro approccio sub-simbolico non basti e che l'Ai dovrebbe evolvere verso qualcosa che sia capace di avere almeno un semplice modello di realtà "embedded", cosa che credo aiuterebbe assai a risolvere il problema in questione.
Insomma, come sempre, There Are Thousands of Alternatives.
Stefano
Inviato con l'email sicura [Proton Mail](https://proton.me/mail/home).
lunedì 2 dicembre 2024 23:55, Carlo Blengino <blengino(a)penalistiassociati.it> ha scritto:
> Grazie!
> Interessante leggere come da lontano vedano il GDPR e il diritto all'oblio (o quello che è).
> La cosa più certa, al di là del caso Mayer, è che, mi pare, il GDPR se interpretato restrittivamente non è compatibile con la tecnologia degli LLM. Punto. Si possono fare un po' di accrocchi, ma di fondo c'è un totale contrasto, su più principi di base. E questo è un problema per l'Europa.
> Il caso GEDI https://www.ilsole24ore.com/art/nel-mirino-garante-l-accordo-gedi-openai-AG… ne è ulteriore riprova (quell'accordo e tutti gli accordi in atto sono una pessima deriva, sia chiaro, ma per altre ragioni)
> Aggiungo a scanso di equivoci, che questa considerazione non vuol dire a mio parere che vi sia incompatibilità tra queste tecnologie ed il sacrosanto diritto fondamentale alla protezione dei dati personali.
> CB
>
> Il giorno lun 2 dic 2024 alle ore 22:32 Daniela Tafani <daniela.tafani(a)unipi.it> ha scritto:
>
>> Dec 01, 2024 - Georg Zoeller (AILTI)
>> The Curious Case of David Mayer, the man ChatGPT cannot name.
>>
>> ChatGPT users have noticed a curious behavior: It refuses to talk about a 'David Mayer'. We have the explanation and point out less obvious implications.
>>
>> TL;DR: While not a juicy conspiracy, OpenAI cut some corners on regulatory compliance and the implications are less benign than they seem. In fact, they can be weaponized with unexpected consequences.
>>
>> ChatGPT is well known for not knowing when to stop talking - the underlying transformer architecture lends itself to hallucinations in situations when the model is asked to generate text beyond the context it was trained on. Even more curious, sometimes it starts giving a response, only to change its mind mid sentence, and terminating the conversation.
>>
>> So naturally, when the software stops and refuses to answer, users take notice. In this case, ChatGPT users found that mention of the name “David Mayer”, whenever included in a message, would consistently cause the model to terminate the conversation.
>>
>> It’s a conspiracy!
>> Creating even more mystery, chatGPT rejection messages quickly move from unhelpful to ominously threatening when the user starts investigating the phenomenon.
>>
>> Continua qui:
>> <https://centreforaileadership.org/resources/analysis_the_curious_case_of_on…>
>
> --
>
> Avv. Carlo Blengino
> Via Duchessa Jolanda n. 19,
> 10138 Torino (TO) - Italy
>
> tel. +39 011 4474035
> Penalistiassociati.it
Dec. 3, 2024