nexa
By thread
nexa@server-nexa.polito.it
By month
Messages by month
- ----- 2026 -----
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2025 -----
- December
- November
- October
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2024 -----
- December
- November
- October
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2023 -----
- December
- November
- October
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2022 -----
- December
- November
- October
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2021 -----
- December
- November
- October
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2020 -----
- December
- November
- October
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2019 -----
- December
- November
- October
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2018 -----
- December
- November
- October
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2017 -----
- December
- November
- October
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2016 -----
- December
- November
- October
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2015 -----
- December
- November
- October
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2014 -----
- December
- November
- October
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2013 -----
- December
- November
- October
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2012 -----
- December
- November
- October
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2011 -----
- December
- November
- October
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2010 -----
- December
- November
- October
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2009 -----
- December
- November
- October
- September
- August
- July
- June
- May
September 2024
- 45 participants
- 214 messages
Re: [nexa] AI Training is Copyright Infringement
by Guido Vetere
>
> Microsoft stessa non nega la natura di opera derivata dei LLM (pur
> tentando disperatamente di giustificarla). Ad esempio in "Elephant
> never forget..." [2] i suoi ricercatori scrivono: "This investigation
> reveals that LLMs have memorized many popular tabular datasets
verbatim".
per completezza, riporto un passaggio seguente del suddetto articolo:
Research has also shown that memorization occurs if
an LLM sees a text repeatedly during training (Carlini et al., 2022b;
Biderman et al., 2023).
Because of this, *memorization can be seen as an extreme case of training
data contamination*
where a dataset is not only seen during training but repeated within the
training set so often
that the LLM becomes able to consistently generate it.
La memorizzazione, insomma, è un caso degenere. Infatti, si applicano
usualmente tecniche di filtering per deduplicare i passaggi che occorrono
molte volte nei dataset di training, magari proprio perché gli umani li
hanno plagiarizzati molte volte :-)
Cheers,
G.
On Sun, 8 Sept 2024 at 15:48, Giacomo Tesio <giacomo(a)tesio.it> wrote:
> Ciao Maria Chiara,
>
> riporto il subject al valore iniziale perché non ho molto da aggiungere
> sugli interessi rappresentati da Axel Voss: le norme su copyright,
> brevetti e segreti industriali sono intrinsecamente oscurantiste,
> e rallentano il progresso culturale e tecnologico dell'umanità vietando
> alla maggioranza delle persone di conoscere e/o ragionare liberamente
> sulle informazioni che i dati cui vengono applicate rappresentano.
>
> Detto questo, l'eccitazione di Axel Voss dipende dalla stessa ignoranza
> informatica di coloro che si strappano le vesti di fronte ad uno studio
> che afferma una semplice ovvietà tecnica: le "AI generative" sono opere
> derivate meccanicamente delle opere utilizzate per programmarle
> statisticamente e di cui, come spiegavo in una mail precedente
> costituiscono l'eseguibile compilato per una determinata architettura.
>
> On Sun, 8 Sep 2024 10:33:05 +0200 Maria Chiara Pievatolo wrote:
>
> > Dove i SALAMI rimescolano, bisognerebbe cambiare il copyright
> > estendendo a tutte le espressioni delle idee (recensioni, riassunti
> > umani e no etc.) la stessa disciplina che si applica, secondo me
> > incoerentemente (slide 22: https://zenodo.org/records/11163103)
> > alle traduzioni.
>
> Non serve: il copyright com'è protegge già gli eseguibili compilati a
> partire da testi chiamati "codice sorgente", senza bisogno di alcuna
> modifica alla normativa o alcuna estensione alla sua interpretazione.
>
> Anche il processo di compilazione di un comune software scritto in C è
> un processo di compressione particolarmente evidente laddove non vi
> siano molte dipendenze esterne. Ad esempio, il kernel di linux versione
> 5.10 è un testo da quasi un gigabyte. Compresso in tar.xz [1] occupa
> circa 115 Mega (un fattore di compressione senza perdita di
> informazione di 8 a 1, circa) mentre una volta compilato occupa circa 7
> megabyte (un fattore di compressione CON perdita di informazione di
> oltre 100 volte).
>
>
> L'eseguibile che i fautori delle "AI generative" chiamano impropriamente
> "modello" subisce una compressione concettualmente analoga attraverso
> il processo di compilazione dei dataset sorgenti.
>
>
> Non è dunque necessario modificare il diritto d'autore per riconoscere
> i "modelli AI" (le matrici eseguibili da quelle macchine virtuali) come
> opere derivate dai testi sorgenti.
>
> Anche se poi le aziende forniscono accesso a quelle opere derivate "a
> pezzetti", le opere sono state integralmente incluse nel processo di
> programmazione statistica (il "training" della "AI").
> In altri termini, il "modello" deriva dalla totalità di ciascun opera
> usata per la sua programmazione, nonché dalla totalità di TUTTE le
> opere utilizzate (pubblicamente note, o meno).
> Ciò rende inapplicabili ai modelli le eccezioni che permettono di citare
> piccoli frammenti di un opera in un'altra.
>
>
> Dunque, indipendentemente dall'articolo e dalle ragioni di chi l'ha
> scritto, affermare che "AI Training is Copyright Infringement" significa
> semplicemente prendere atto di come funziona il processo in questione e
> ciò che produce (il "modello").
>
> Microsoft stessa non nega la natura di opera derivata dei LLM (pur
> tentando disperatamente di giustificarla). Ad esempio in "Elephant
> never forget..." [2] i suoi ricercatori scrivono: "This investigation
> reveals that LLMs have memorized many popular tabular datasets
> verbatim".
>
>
> Dunque nessun bisogno di estendere o rafforzare il diritto d'autore:
> basta applicare le norme vigenti anche a chi approfitta dell'ignoranza
> altrui per sottrarvisi attraverso software che pochi comprendono
> (anzitutto fra coloro che ne parlano)
>
>
>
> Giacomo
>
>
> [1]
> https://cdn.kernel.org/pub/linux/kernel/v5.x/linux-5.10.225.tar.x
>
> [2] https://arxiv.org/abs/2404.06209
>
Sept. 8, 2024
Re: [nexa] AI Training is Copyright Infringement
by Giacomo Tesio
Caro Giancarlo,
On Sun, 8 Sep 2024 13:46:50 +0100 GC F <gcfrosio(a)gmail.com> wrote:
> La τέχνη specifica è irrilevante.
Non parliamo infatti di tecniche ma di finalità.
Il data mining è definito dalla finalità di estrarre informazioni
intellegibili da grandi volumi di dati, NON dal generare in output
testi o immagini che appaiano plausibili ai profani della materia.
Dunque le eccezioni specifiche per il data-mining non sono applicabili
alle "AI generative", anche nei casi in cui alcune tecniche usate per
la programmazione di questi software siano utilizzabili anche per il
data mining.
Attenzione però a non affermare che le AI generative siano "un processo
connesso, simile ma diverso o alternativo" rispetto al data mining.
Sarebbe grossolanamente sbagliato, evidenza di una assoluta ignoranza
rispetto alla materia oggetto del discorso.
Significherebbe affermare che non giò la τέχνη, ma la realtà stessa
sia irrilevante.
A quel punto non sarebbero gli LLM ad "allucinare", ma i giuristi. ;-)
Cui prodest?
> Che sia propriamente text-and-and-data mining o processo
> connesso, simile ma diverso, o alternativo è di rilevanza
> tangenziale. I principi di diritto sono strutturati per adattarsi
> all'evoluzione tecnologica. Dottrina e giurisprudenza svolgono questo
> ruolo, quando non intervenga una riforma legislativa, applicando
> principi e precedenti giurisprudenziali a nuova casistica per
> analogia.
Tangenziale?
Solo chi non ha mai fatto né data mining né "training" di una "IA
generativa" può immaginare l'esistenza di analogie fra le due attività.
Non ce ne sono, anche quando si utilizzano gli stessi strumenti.
Un po' come non ci sono analogie fra le norme applicabili ad un omicida
e ad un fabbro che abbiano entrambi utilizzato un martello.
Giacomo
Sept. 8, 2024
Re: [nexa] AI Training is Copyright Infringement - Axel Voss
by Guido Vetere
>
> Suvvia, non servono supercazzole su Nexa: ci sono migliaia di esempi di
> LLM che restituiscono frammenti più o meno vasti di opere riconoscibili
> attribuendole a persone inesistenti e magari con licenze inesistenti
Tesio, se vuole risposte di merito da me, provi a formulare le sue
osservazioni in modo educato, magari si faccia aiutare da un SALAME :-)
G.
On Sun, 8 Sept 2024 at 15:35, Giacomo Tesio <giacomo(a)tesio.it> wrote:
> Salve Guido,
>
> On Sun, 8 Sep 2024 12:31:14 +0200 Guido Vetere wrote:
>
> > L'analogia tra i LLM e i dati (immagini, testi) compressi con o senza
> > perdita è totalmente fuorviante, perché nei miliardi di parametri di
> > una rete neurale non si può ricavare all'inverso il dataset di
> > training, né se ne può leggere in chiaro alcun frammento.
>
> credo che potresti trarre giovamento da un ripasso sugli algoritmi di
> compressione lossy, perché sembra sfuggirti che anche da un jpeg
> fortemente compresso non puoi ricavare l'immagine originale:
>
> Qui trovi un esempio:
>
> https://upload.wikimedia.org/wikipedia/commons/3/3c/TulipanoJPEG10.jpg
>
> Non c'è alcun modo di ricostruire la sequenza di byte che costituiva
> l'immagine originale.
>
>
> E' vero, non si tratta di una semplice analogia: stiamo letteralmente
> parlando di sistemi di compressione lossy (seppur eseguibili).
>
> > Quando un LLM 'rigurgita' un frammento (ma questo è un evento
> > eccezionale) lo fa comunque in un processo generativo non
> > deterministico in cui quel frammento diviene temporaneamente
> > "attrattore" in forza delle "tracce mnestiche" che ha prodotto nei
> > parametri, cioè qualche cifra decimale nelle gigantesche matrici del
> > modello.
>
> Ma scappelate a destra o a sinistra? :-)
>
> Suvvia, non servono supercazzole su Nexa: ci sono migliaia di esempi di
> LLM che restituiscono frammenti più o meno vasti di opere riconoscibili
> attribuendole a persone inesistenti e magari con licenze inesistenti.
>
> La mia preferita è questa
> https://peertube.opencloud.lu/w/eW497u3UYXmQwcQu9LYEDR
>
> Ma Microsoft stessa non ne faceva mistero nel paper pubblicato
> all'indomani del lancio di GitHub CopyALot, cercando disperatamente
> di antropomorfizzare il software per giustificare le palesi violazioni
>
> https://github.blog/ai-and-ml/github-copilot/github-copilot-research-recita…
>
>
> Quanto si tratti di "eventi eccezionali" è ben noto: esistono
> diversi studi che dimostrano la facilità con cui è possibile tirar
> fuori record presenti nei dataset di "training" (il primo che mi torna
> in mente: https://arxiv.org/abs/2012.07805 ).
>
>
> In qualsiasi caso, sarai d'accordo con me che, per essere tirati fuori,
> quei record devono essere presenti dentro il LLM, seppur codificati in
> forma non leggibile.
>
>
> Quindi che piaccia o meno ad editori e a chi li sviluppa, gli LLM
> rimangono rappresentazioni compresse dei dataset utilizzati durante il
> "training", compressione lossy ed eseguibile, ma pur sempre di
> compressione / compilazione dei dataset sorgenti si tratta.
>
>
>
> Giacomo
>
Sept. 8, 2024
Re: [nexa] AI Training is Copyright Infringement - Axel Voss
by Guido Vetere
>
> potremmo accusarlo a ragione di aver violato il copyright (diritto
morale dell'autore compreso) oppure potrebbe discolparsi dicendo che le
riproduzioni sono (un raro) esito di un processo generativo non
deterministico?
in ogni caso lo studente non avrebbe presentato un elaborato originale: per
me conterebbe questo, non la mancata remunerazione dei diritti d'autore.
il problema vero è che, proprio per la loro abilità ricombinatoria, i
SALAMI mettono in crisi i sistemi antiplagiarismo che funzionavano così
bene fino a qualche anno fa
bisognerà rassegnarsi all'idea di far appassionare gli studenti alla
ricerca e alla cultura :-)
G.
On Sun, 8 Sept 2024 at 13:47, Maria Chiara Pievatolo <
mariachiara.pievatolo(a)unipi.it> wrote:
> On 08/09/24 12:31, Guido Vetere wrote:
>
> > Quando un LLM 'rigurgita' un frammento (ma questo è un evento
> eccezionale)
> > lo fa comunque in un processo generativo non deterministico in cui quel
> > frammento diviene temporaneamente "attrattore" in forza delle "tracce
> > mnestiche" che ha prodotto nei parametri, cioè qualche cifra decimale
> nelle
> > gigantesche matrici del modello.
>
> Non ho tempo di continuare una discussione su un articolo che non
> condivido. Propongo però due domande come esercizio per il lettore:
>
> 1. se uno studente componesse una tesi di laurea con i SALAMI che la sua
> università ha acquistato da qualche oligopolista dell'editoria
> scientifica commerciale e che gli sono stati raccomandati
> dall'università stessa e dal venditore come strumento per migliorare il
> suo lavoro creativo.
>
> se nella sua tesi (pubblicata dopo la discussione nell'archivio del suo
> ateneo) ci fossero *riproduzioni letterali* di pezzi di articoli usciti
> in riviste di detto oligopolista e usati come dati di addestramento
>
> potremmo accusarlo a ragione di aver violato il copyright (diritto
> morale dell'autore compreso) oppure potrebbe discolparsi dicendo che le
> riproduzioni sono (un raro) esito di un processo generativo non
> deterministico?
>
> 2. se la risposta alla domanda fosse "sì", e lo studente ne subisse la
> conseguenze, questi avrebbe titolo a rivalersi su chi gli ha offerto i
> SALAMI presentandoli come strumenti per migliorare il suo lavoro creativo?
>
> A presto,
> MCP
>
> (*) Per non influenzare chi avesse tempo di rispondere non dico come
> tratterei un laureando che scoprissi a fare le cose di cui in (1),
> soprattutto se questi sostenesse che i SALAMI da lui usati stanno in una
> bolla giuridica rispetto alla normativa vigente a partire dai
> regolamenti di ateneo.
>
>
>
>
>
Sept. 8, 2024
Re: [nexa] AI Training is Copyright Infringement
by Giacomo Tesio
Ciao Maria Chiara,
riporto il subject al valore iniziale perché non ho molto da aggiungere
sugli interessi rappresentati da Axel Voss: le norme su copyright,
brevetti e segreti industriali sono intrinsecamente oscurantiste,
e rallentano il progresso culturale e tecnologico dell'umanità vietando
alla maggioranza delle persone di conoscere e/o ragionare liberamente
sulle informazioni che i dati cui vengono applicate rappresentano.
Detto questo, l'eccitazione di Axel Voss dipende dalla stessa ignoranza
informatica di coloro che si strappano le vesti di fronte ad uno studio
che afferma una semplice ovvietà tecnica: le "AI generative" sono opere
derivate meccanicamente delle opere utilizzate per programmarle
statisticamente e di cui, come spiegavo in una mail precedente
costituiscono l'eseguibile compilato per una determinata architettura.
On Sun, 8 Sep 2024 10:33:05 +0200 Maria Chiara Pievatolo wrote:
> Dove i SALAMI rimescolano, bisognerebbe cambiare il copyright
> estendendo a tutte le espressioni delle idee (recensioni, riassunti
> umani e no etc.) la stessa disciplina che si applica, secondo me
> incoerentemente (slide 22: https://zenodo.org/records/11163103)
> alle traduzioni.
Non serve: il copyright com'è protegge già gli eseguibili compilati a
partire da testi chiamati "codice sorgente", senza bisogno di alcuna
modifica alla normativa o alcuna estensione alla sua interpretazione.
Anche il processo di compilazione di un comune software scritto in C è
un processo di compressione particolarmente evidente laddove non vi
siano molte dipendenze esterne. Ad esempio, il kernel di linux versione
5.10 è un testo da quasi un gigabyte. Compresso in tar.xz [1] occupa
circa 115 Mega (un fattore di compressione senza perdita di
informazione di 8 a 1, circa) mentre una volta compilato occupa circa 7
megabyte (un fattore di compressione CON perdita di informazione di
oltre 100 volte).
L'eseguibile che i fautori delle "AI generative" chiamano impropriamente
"modello" subisce una compressione concettualmente analoga attraverso
il processo di compilazione dei dataset sorgenti.
Non è dunque necessario modificare il diritto d'autore per riconoscere
i "modelli AI" (le matrici eseguibili da quelle macchine virtuali) come
opere derivate dai testi sorgenti.
Anche se poi le aziende forniscono accesso a quelle opere derivate "a
pezzetti", le opere sono state integralmente incluse nel processo di
programmazione statistica (il "training" della "AI").
In altri termini, il "modello" deriva dalla totalità di ciascun opera
usata per la sua programmazione, nonché dalla totalità di TUTTE le
opere utilizzate (pubblicamente note, o meno).
Ciò rende inapplicabili ai modelli le eccezioni che permettono di citare
piccoli frammenti di un opera in un'altra.
Dunque, indipendentemente dall'articolo e dalle ragioni di chi l'ha
scritto, affermare che "AI Training is Copyright Infringement" significa
semplicemente prendere atto di come funziona il processo in questione e
ciò che produce (il "modello").
Microsoft stessa non nega la natura di opera derivata dei LLM (pur
tentando disperatamente di giustificarla). Ad esempio in "Elephant
never forget..." [2] i suoi ricercatori scrivono: "This investigation
reveals that LLMs have memorized many popular tabular datasets
verbatim".
Dunque nessun bisogno di estendere o rafforzare il diritto d'autore:
basta applicare le norme vigenti anche a chi approfitta dell'ignoranza
altrui per sottrarvisi attraverso software che pochi comprendono
(anzitutto fra coloro che ne parlano)
Giacomo
[1]
https://cdn.kernel.org/pub/linux/kernel/v5.x/linux-5.10.225.tar.x
[2] https://arxiv.org/abs/2404.06209
Sept. 8, 2024
dum Romae consulitur Saguntum expugnatur?
by maurizio lana
"Valditara: sperimentazione AI a scuola. Sperimentazione partirà in 15
classi"
https://www.rainews.it/articoli/ultimora/valditara-sperimentazione-ai-a-scu…
> "Siamo uno dei primi Paesi ad avere avviato quest'anno scolastico una
> sperimentazione nell'utilizzo dell'intelligenza artificiale per la
> personalizzazione della didattica. Parte in 15 classi in alcune
> Regioni: Calabria, Lazio, Toscana, Lombardia". Lo ha detto il ministro
> dell'Istruzione e del Merito Giuseppe Valditara a Cernobbio.
cioè: noi discutiamo, giustamente, ma lì la introducono. la introducono
proprio in quel luogo che noi così fortemente vediamo deputato a
costruire capacità critica e non adesione supina.
quanto al come e su che cosa, Repubblica scrive:
>
>
> L’IA per gli insegnanti
>
> In una lettera
> <https://www.repubblica.it/commenti/2023/01/17/news/valditara_intelligenza_a…>che
> il ministro inviò lo scorso anno a /Repubblica/ Valditara ha spiegato
> il ruolo dell’IA
> <https://www.repubblica.it/scuola/2023/01/20/news/chatbot_il_software_chi_ti…>
> a scuola: “Può essere impiegata per aiutare gli insegnanti a
> personalizzare l'apprendimento, ad adattare i contenuti in base alle
> attitudini individuali degli studenti, a monitorare i loro progressi e
> a fornire informazioni su come migliorare il loro rendimento” si legge
> nella lettera. E sottolinea il ruolo del docente. “L'intelligenza
> artificiale non può dunque soppiantare l'insegnante né marginalizzarne
> il ruolo, che è decisivo in tutti i gradi di scuola, in particolare
> nella primaria”.
>
>
> L’IA per gli studenti
>
> Lato studenti, l’uso dell’IA, si legge sempre nella lettera, “può
> consentire agli studenti di ottenere un riscontro rapido e
> personalizzato sul lavoro svolto, in modo da aiutarli a concentrarsi
> sui loro punti di forza e a raggiungere i propri obiettivi educativi.
> Inoltre, gli studenti possono usare apparecchiature tecnologicamente
> avanzate, come i robot educativi, per aumentare l'interattività della
> loro esperienza scolastica”.
>
Maurizio
------------------------------------------------------------------------
quella volta in due siamo rimasti appesi ad un friend. e ha tenuto.
quella volta in due siamo rimasti appesi ad un amico. e ha tenuto.
matteo della bordella
------------------------------------------------------------------------
Maurizio Lana
Università del Piemonte Orientale
Dipartimento di Studi Umanistici
Piazza Roma 36 - 13100 Vercelli
Sept. 8, 2024
Re: [nexa] AI Training is Copyright Infringement - Axel Voss
by Giacomo Tesio
Salve Guido,
On Sun, 8 Sep 2024 12:31:14 +0200 Guido Vetere wrote:
> L'analogia tra i LLM e i dati (immagini, testi) compressi con o senza
> perdita è totalmente fuorviante, perché nei miliardi di parametri di
> una rete neurale non si può ricavare all'inverso il dataset di
> training, né se ne può leggere in chiaro alcun frammento.
credo che potresti trarre giovamento da un ripasso sugli algoritmi di
compressione lossy, perché sembra sfuggirti che anche da un jpeg
fortemente compresso non puoi ricavare l'immagine originale:
Qui trovi un esempio:
https://upload.wikimedia.org/wikipedia/commons/3/3c/TulipanoJPEG10.jpg
Non c'è alcun modo di ricostruire la sequenza di byte che costituiva
l'immagine originale.
E' vero, non si tratta di una semplice analogia: stiamo letteralmente
parlando di sistemi di compressione lossy (seppur eseguibili).
> Quando un LLM 'rigurgita' un frammento (ma questo è un evento
> eccezionale) lo fa comunque in un processo generativo non
> deterministico in cui quel frammento diviene temporaneamente
> "attrattore" in forza delle "tracce mnestiche" che ha prodotto nei
> parametri, cioè qualche cifra decimale nelle gigantesche matrici del
> modello.
Ma scappelate a destra o a sinistra? :-)
Suvvia, non servono supercazzole su Nexa: ci sono migliaia di esempi di
LLM che restituiscono frammenti più o meno vasti di opere riconoscibili
attribuendole a persone inesistenti e magari con licenze inesistenti.
La mia preferita è questa
https://peertube.opencloud.lu/w/eW497u3UYXmQwcQu9LYEDR
Ma Microsoft stessa non ne faceva mistero nel paper pubblicato
all'indomani del lancio di GitHub CopyALot, cercando disperatamente
di antropomorfizzare il software per giustificare le palesi violazioni
https://github.blog/ai-and-ml/github-copilot/github-copilot-research-recita…
Quanto si tratti di "eventi eccezionali" è ben noto: esistono
diversi studi che dimostrano la facilità con cui è possibile tirar
fuori record presenti nei dataset di "training" (il primo che mi torna
in mente: https://arxiv.org/abs/2012.07805 ).
In qualsiasi caso, sarai d'accordo con me che, per essere tirati fuori,
quei record devono essere presenti dentro il LLM, seppur codificati in
forma non leggibile.
Quindi che piaccia o meno ad editori e a chi li sviluppa, gli LLM
rimangono rappresentazioni compresse dei dataset utilizzati durante il
"training", compressione lossy ed eseguibile, ma pur sempre di
compressione / compilazione dei dataset sorgenti si tratta.
Giacomo
Sept. 8, 2024
Re: [nexa] AI Training is Copyright Infringement
by GC F
La τέχνη specifica è irrilevante. Il principio generale di cui si discute
(dicotomia idea/espressione) fa riferimento all'estrazione di conoscenza
non proteggibile, in qualsiasi forma, da espressioni proteggibili in base
ai requisiti di proteggibilità del diritto d'autore. Che sia propriamente
text-and-and-data mining o processo connesso, simile ma diverso, o
alternativo è di rilevanza tangenziale. I principi di diritto sono
strutturati per adattarsi all'evoluzione tecnologica. Dottrina e
giurisprudenza svolgono questo ruolo, quando non intervenga una riforma
legislativa, applicando principi e precedenti giurisprudenziali a nuova
casistica per analogia. L'intera storia del diritto d'autore è un esempio
di questo processo.
Giancarlo
On Fri, Sep 6, 2024 at 10:51 AM Giacomo Tesio <giacomo(a)tesio.it> wrote:
> Grazie Giancarlo,
>
> molto interessante, ma di nuovo non capisco cosa centri il data mining
>
> On Fri, 6 Sep 2024 01:45:14 +0100 GC F <gcfrosio(a)gmail.com> wrote:
>
> > in diritto EU abbiamo introdotto eccezioni e limitazioni specifiche
> > per il text-and-data-mining.
>
> Il data-mining è un processo di estrazione e rappresentazione di
> pattern, andamenti e correlazioni presenti in grandi quantità di dati
> in modo che siano comprensibili: parliamo di tecniche come la cluster
> analysis, il rilevamento delle anomalie, le regole di associazione
> etc... può anche includere l'uso di reti neurali artificiali, ma sempre
> al fine acquisire informazioni intellegibili sui dati analizzati e sui
> fenomeni che quei dati rappresentano.
>
> I software di cui parla l'articolo condiviso da Daniela non hanno NULLA
> a che fare con il data mining, anche secondo la definizione del
>
>
> Già nel 2001, Han e Kamber sottolineavano in "Data mining: concepts and
> techniques" (ISBN 978-1-55860-489-6) che la locuzione è fuorviante
> e che "data mining should have been more appropriately named as
> 'knowledge mining' which emphasis on the mining knowledge from large
> amount of data" chiarendo che "The overall goal of the data mining
> process is to extract knowledge from an existing data set and transform
> it into a human-understandable structure for further use."
>
> La stessa definizione di ‘text and data mining’ prevista dall'articolo
> 2 della direttiva (EU) 2019/790, riporta lo scopo che caratterizza
> queste tecniche, ovvero la produzione di informazione sui dati:
>
> ‘text and data mining’ means any automated analytical technique aimed
> at analysing text and data in digital form in order to generate
> information which includes but is not limited to patterns, trends and
> correlations;
>
>
> https://eur-lex.europa.eu/legal-content/EN/TXT/HTML/?uri=CELEX:32019L0790#d…
>
>
> Il processo di programmazione statistica di un LLM o di qualsiasi altra
> "IA generativa" non comporta in alcun modo l'estrazione di conoscenza
> "human-understandable" sui testi e più in generale sui dati usati come
> sorgente.
>
>
> Ad esempio, i pesi che costituiscono GPT-4, non sono interpretabili
> dall'uomo e non rivelano alcunché su alcuna qualità dei testi
> utilizzati per programmarlo.
>
>
> Dunque di nuovo non mi è chiaro cosa centrino le limitazioni previste
> agli articoli 3 e 4 della direttiva suddetta, visto che le IA
> generative NON sono riconducibili in alcun modo al data mining.
>
>
> > Sostenendo che la dicotomia/idea espressione sia la grundnorm del
> > diritto d'autore, sostengo anche che qualsiasi conclusione che porti
> > a identificare una violazione in processi di utilizzo di espressioni
> > proteggibili per estrarre elementi improteggibili sia incompatibile
> > con i principi generali e strutturali del diritto d'autore.
>
> Beh, è piuttosto tautologico che, se gli elementi estratti da un opera
> sono "improteggibili", non possono essere protetti.
>
>
> Tuttavia NON è ciò che avviene durante la programmazione statistica di
> un "AI generativa" che è semplicemente un'opera derivata dei dati
> sorgente non troppo dissimile da un jpeg o da uno zip danneggiato ma
> ancora utilizzabile.
>
>
> Giacomo
>
Sept. 8, 2024
Re: [nexa] AI Training is Copyright Infringement - Axel Voss
by Maria Chiara Pievatolo
On 08/09/24 12:31, Guido Vetere wrote:
> Quando un LLM 'rigurgita' un frammento (ma questo è un evento eccezionale)
> lo fa comunque in un processo generativo non deterministico in cui quel
> frammento diviene temporaneamente "attrattore" in forza delle "tracce
> mnestiche" che ha prodotto nei parametri, cioè qualche cifra decimale nelle
> gigantesche matrici del modello.
Non ho tempo di continuare una discussione su un articolo che non
condivido. Propongo però due domande come esercizio per il lettore:
1. se uno studente componesse una tesi di laurea con i SALAMI che la sua
università ha acquistato da qualche oligopolista dell'editoria
scientifica commerciale e che gli sono stati raccomandati
dall'università stessa e dal venditore come strumento per migliorare il
suo lavoro creativo.
se nella sua tesi (pubblicata dopo la discussione nell'archivio del suo
ateneo) ci fossero *riproduzioni letterali* di pezzi di articoli usciti
in riviste di detto oligopolista e usati come dati di addestramento
potremmo accusarlo a ragione di aver violato il copyright (diritto
morale dell'autore compreso) oppure potrebbe discolparsi dicendo che le
riproduzioni sono (un raro) esito di un processo generativo non
deterministico?
2. se la risposta alla domanda fosse "sì", e lo studente ne subisse la
conseguenze, questi avrebbe titolo a rivalersi su chi gli ha offerto i
SALAMI presentandoli come strumenti per migliorare il suo lavoro creativo?
A presto,
MCP
(*) Per non influenzare chi avesse tempo di rispondere non dico come
tratterei un laureando che scoprissi a fare le cose di cui in (1),
soprattutto se questi sostenesse che i SALAMI da lui usati stanno in una
bolla giuridica rispetto alla normativa vigente a partire dai
regolamenti di ateneo.
Sept. 8, 2024
Re: [nexa] AI Training is Copyright Infringement - Axel Voss
by Guido Vetere
Tutto questo parlare di SALAMI mi ha fatto venire in mente un motto di
spirito che si ascolta talvolta ai tavoli di progettazione: "fare il maiale
dalla salsiccia", cioè ricostruire il modello originale dai dati di cui si
dispone. Si tratta ovviamente di un paradosso, perché certi processi di
trasformazione sono irreversibili.
L'analogia tra i LLM e i dati (immagini, testi) compressi con o senza
perdita è totalmente fuorviante, perché nei miliardi di parametri di una
rete neurale non si può ricavare all'inverso il dataset di training, né se
ne può leggere in chiaro alcun frammento. La costruzione di un LLM sembra
appunto un processo di trasformazione irreversibile.
Quando un LLM 'rigurgita' un frammento (ma questo è un evento eccezionale)
lo fa comunque in un processo generativo non deterministico in cui quel
frammento diviene temporaneamente "attrattore" in forza delle "tracce
mnestiche" che ha prodotto nei parametri, cioè qualche cifra decimale nelle
gigantesche matrici del modello. Ecco in omaggio, a tal proposito, un
articoletto
<https://ilmanifesto.it/e-se-chatgpt-fosse-un-autore-del-new-york-times/r/6s…>
che scrissi a suo tempo per Il Manifesto.
La causa NYT vs OpenAI sta andando avanti, e credo che al momento vi siano
grandi team di informatici e legali che stanno analizzando a fondo la
questione. A riguardo, possiamo esprimere le nostre opinioni e le nostre
fantasie, ma credo che sarebbe ragionevole attendere e nel frattempo
studiare.
Una cosa però è certa: plagio o non plagio, i LLM estraggono (e rivendono)
valore da ciò che ingeriscono, sia al momento del training, sia
dinamicamente con tecniche di *retrieval augmented generation*. Tuttavia,
la situazione non è del tutto nuova: Google è già dovuta venire a patti per
il suo Google News Showcase. Il problema politico resta sempre quello della
giusta remunerazione del lavoro creativo, che le leggi sul copyright, anche
se rese più stringenti, non credo risolverebbero.
G.
On Sun, 8 Sept 2024 at 10:33, Maria Chiara Pievatolo <
mariachiara.pievatolo(a)unipi.it> wrote:
> On 05/09/24 23:02, Daniela Tafani wrote:
>
> > Axel Voss, MEP and host of today's event in the European Parliament,
> expressly thanks the scientists Dornis and Stober and is pleased that
> >
> > “the study not only proves that the training of Generative AI models is
> not covered by text and data mining, but that it also provides further
> important indications and suggestions for a better balance between the
> protection of human creativity and the promotion of AI innovation.”
> > “This study is explosive because it proves that we are dealing with
> large-scale theft of intellectual property. The ball is now in the
> politicians' court to draw the necessary conclusions and finally put an end
> to this theft at the expense of journalists and other authors,”
> > commented Hanna Möllers, legal advisor to the DJV and representative of
> the European Federation of Journalists (EFJ).
>
> Axel Voss (https://en.wikipedia.org/wiki/Axel_Voss) citato qui sopra è
> uno dei più accaniti sostenitori della direttiva copyright del 2019,
> censorship machine
> (
> https://en.wikipedia.org/wiki/Directive_on_Copyright_in_the_Digital_Single_…)
>
> compresa. Cito la citazione che riporta wikipedia:
>
> "this directive is an important step towards correcting a situation
> which has allowed a few companies to earn huge sums of money without
> properly remunerating the thousands of creatives and journalists whose
> work they depend on"
>
> Axel Voss non è un nemico dei monopoli intellettuali e dei loro
> banchetti. Semplicemente desidera inasprire il copyright perché i
> monopolisti tradizionali - che sono gli editori i quali si fanno cedere
> il copyright dagli autori - ne ricevano qualche briciola.
>
> *Dove i SAlAMI copiano alla lettera*, basta il copyright così com'è.
>
> Dove i SALAMI rimescolano, bisognerebbe cambiare il copyright estendendo
> a tutte le espressioni delle idee (recensioni, riassunti umani e no
> etc.) la stessa disciplina che si applica, secondo me incoerentemente
> (slide 22: https://zenodo.org/records/11163103) alle traduzioni. Con
> il risultato che i detentori del copyright (cioè per lo più gli editori)
> potrebbero sequestrare buona parte del dibattito pubblico sulle "loro"
> opere, come avviene con le traduzioni. Ed è poco rilevante che
> Qui potete leggere di un paio di sequestri famosi, e catastrofici per
> l'uso pubblico della ragione. In uno dei due la posta in gioco era
> informare il pubblico statunitense delle idee di Hitler
> https://btfp.sp.unipi.it/dida/kant_7/index.xhtml#idm181
>
> L'idea di curare i monopoli, de iure o de facto, inasprendoli ed
> estendendoli può apparire plausibile solo a chi già, come Axel Voss, li
> apprezza. Le critiche di Doctorow
> (
> https://pluralistic.net/2024/03/13/hey-look-over-there/#lets-you-and-he-fig…)
>
> mi sembrano ben fondate.
>
> Oltre tutto, un copyright così inasprito ed esteso non impedirebbe
> affatto agli editori di offrire i "propri" testi, a pagamento, per il
> confezionamento di SALAMI. Soprattutto per gli editori scientifici
> commerciali, che ricevono i loro testi gratis, sarebbe - ed è già - un
> affarone.
>
> "Bullies want you to think they're on your side".
>
> A presto,
> MCP
>
>
>
>
>
>
>
>
>
>
>
Sept. 8, 2024