nexa
By thread
nexa@server-nexa.polito.it
By month
Messages by month
- ----- 2026 -----
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2025 -----
- December
- November
- October
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2024 -----
- December
- November
- October
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2023 -----
- December
- November
- October
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2022 -----
- December
- November
- October
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2021 -----
- December
- November
- October
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2020 -----
- December
- November
- October
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2019 -----
- December
- November
- October
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2018 -----
- December
- November
- October
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2017 -----
- December
- November
- October
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2016 -----
- December
- November
- October
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2015 -----
- December
- November
- October
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2014 -----
- December
- November
- October
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2013 -----
- December
- November
- October
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2012 -----
- December
- November
- October
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2011 -----
- December
- November
- October
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2010 -----
- December
- November
- October
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2009 -----
- December
- November
- October
- September
- August
- July
- June
- May
- 40 participants
- 30618 messages
Re: [nexa] AI Training is Copyright Infringement
by Maria Chiara Pievatolo
On 08/09/24 15:48, Giacomo Tesio wrote:
>
> L'eseguibile che i fautori delle "AI generative" chiamano impropriamente
> "modello" subisce una compressione concettualmente analoga attraverso
> il processo di compilazione dei dataset sorgenti.
Ti segnalo uno studio sulla possibilità di mantenere la pubblicità delle
licenze Share Alike/Copyleft, presente nel materiale usato come training
data,in "developing AI models, deploying AI systems, and using AI output":
https://openfuture.eu/wp-content/uploads/2024/06/Share-Alike-and-ML-Report-…
L'articolo è scritto da autori assai più simpatetici ai valori della
cultura libera di quelli che rispondono ai non disinteressati
committenti (https://urheber.info/about-us) dello studio elogiato da
Voss. Cito da pagina 15:
...this broad approach in the EU raises the question of whether
electronic changes to a computer file containing a work that result in
adaptation or conversion of the file to a desirable format could
similarly involve an act of reproduction, which would be different and
separate from the mere act of copying data. While CJEU jurisprudence
points in this direction, the Canadian Supreme Court has reached a
different conclusion for such acts. Hence, the issue has not been
settled yet. If the issue is brought before the CJEU, the Court may
refrain from extending the Canvas approach to file conversions for TDM
purposes.
Whether copyright-relevant acts of reproduction take place during stage
five is not as straightforward to ascertain. Although the applicable
copyright principles are easy to explain, the model exists as a separate
artefact: normally operating independently from its training pipeline.41
It does not seem to retrieve the contents of the training dataset when
generating outputs during the exploitation phase. Hence, it can be
argued that the artefact exists and operates independently from the
copyright-protected data that have been used as training resources in
the preceding steps one to four – data that could include ‘licensed
material’ triggering CLSA obligations. Following this line of argument,
***the artefact can be described as a giant collection of data points
and vectors that have been derived from the training material***. It can
also be assumed that the artefact is unlikely to contain
copyright-protected traces of works that were used for training.42 The
adoption of this perspective leads to the conclusion that the creation
of the trained model at stage five breaks the link with CLSA licensing
obligations that may rest on training resources. If the artefact as such
does not contain copyright-protected traces of CLSA works used for
training purposes, copyright law does not offer tools for enforcing CLSA
conditions: relevant acts of reproduction are sought in vain.
Si tratta di una dottrina diffusa (come mostrano i riferimenti in nota,
che meritano di essere letti). Se vai avanti nella lettura vedrai che
gli autori riconoscono eccezioni solo quando l'artefact (così chiamano
il modello) contiene in effetti frammenti letterali.
Collezionare non testi e immagine copiate, ma "data points and vectors
that have been derived from training materials" viola il diritto d'autore?
Certo, se uso l'analogia delle traduzioni e applico il diritto d'autore
di Kant (che nega alla traduzione il carattere di opera derivata), una
traduzione, anche a calco, è un'espressione diversa che va attribuito
interamente al traduttore, sebbene "derivi" da un'opera altrui. Quando
traduco, anche meccanicamente, un testo, magari scrivendo la mia
versione in una qualche forma compressa, violo il diritto d'autore -
almeno se applico in modo coerente, come secondo me non fa il copyright
vigente, la distinzione fra idea ed espressione?
Ho una risposta, ma ci devo pensare.
Per il momento preferisco un approccio pragmatico (e kantiano) che
riguarda solo gli atti di comunicazione al pubblico: uno studente che si
fa fare la tesi dai SALAMI viola il diritto d'autore (oltre che le
norme, dai regolamenti di ateneo in su, che gli richiederebbero di
produrre farina del suo sacco) se il testo che ha fatto proprio contiene
frammenti letterali non correttamente attribuiti? E se viene scoperto e
sanzionato, può denunciare per truffa chi ha gli offerto i SALAMI come
strumenti di lavoro creativo?
Buonanotte,
NCP
Sept. 8, 2024
Re: [nexa] AI Training is Copyright Infringement
by GC F
Si, ma l'uso del materiale per creare il software che poi genera a sua
volta è a fini trasformativi! Il materiale non è usato per il suo valore
espressivo, quindi la creazione del software/modello non ha effetti sul
valore di mercato dell'opera originale utilizzata - non la sostituisce. Si
potrebbe discutere se quegli effetti sostitutivi ci siano nel contesto
della produzione degli output di quel modello, ma è altra questione - e io
direi di no in base alla mia interpretazione di nozioni quali ad esempio
"effect of the use on the potential market for the work" nella clausola
fair use o nozioni come "conflicting with normal exploitation of the work"
e "prejudice legitimate interests" nel three-step-test di Berna. Questa è
la mia argomentazione. Ve ne sono altre plausibili. Legga *Google Books* e
quel che viene prima.
Lei è estenuante. Non è necessario rispondere a tutto, ripetutamente,
discutendo affermazioni che lei assume appartengano al suo interlocutore
senza che questo sia il caso, sviluppando argomentazioni che sono per la
maggior parte irrilevanti rispetto a quel che il suo interlocutore dice e
costantemente lasciar intendere che il suo interlocutore non comprende la
tecnologia che lei invece ben comprende, anche se poi quella comprensione
profonda è irrilevante ai fini della discussione.
Il mio riferimento precedente alla τέχνη era un'allusione a un dibattito
millenario. Non si può ridurre tutto alla τέχνη; bisognerebbe saper
astrarre...
Giancarlo
On Sun, Sep 8, 2024 at 6:05 PM Giacomo Tesio <giacomo(a)tesio.it> wrote:
> In realtà Giancarlo ho ben chiaro il dibattito in corso, gli interessi in
> gioco,
> le "strane alleanze" e i fiumi di soldi che stanno inquinando questo
> dibattito.
>
> E sono rassegnato al divorzio dalla realtà che tutto ciò comporta.
>
> Tuttavia, da informatico più interessato allo stato di diritto che ai
> soldi in questione
> non posso che descrivere i software cui il dibattito fa riferimento.
>
> Il 8 Settembre 2024 15:34:15 UTC, GC F ha scritto:
> > Quel che conta è che...
>
> Bene, finalmente concordiamo che ogni riferimento al data mining è
> infondato e fuorviante.
>
> > si utilizzino espressioni proteggibili per
> > creare/addestrare uno strumento
>
> Ecco quando su parla di "AI training" si parla del processo di
> programmazione statistica
> attraverso cui si ottiene un software.
>
> Questo software è un opera derivata dai dataset sorgenti (e da pochi altri
> dati decisi
> dai "data scientist").
>
> Ancor prima che questo software venga eseguito e produca output che
> riproduca in
> tutto o in parte un'opera usata per programmarlo, la sua realizzazione
> deve rispettare
> i diritti degli autori di tutte le opere che costituiscono il dataset
> sorgente.
>
> Questi autori possono aver ceduto il diritto di creare quel software come
> opera derivata
> dalle proprie opere (come fanno i giornalisti o i romanzieri che lavorano
> come "chatbot helper")
> e in tal caso siamo tutti contenti.
>
> Tuttavia, per creare un'opera derivata dalle loro (come il software in
> questione) tale
> cessione è necessaria nei termini del diritto d'autore.
>
> > Anche se il processo di training AI si basa su
> > riproduzioni meccaniche di opere nella loro interezza, questo non implica
> > di per sé la violazione del diritto d'autore, se tale riproduzione è
> votata
> > alla creazione di uno strumento che poi utilizzi quelle riproduzioni
> > meccaniche a fini trasformativi.
>
> Temo che questo passaggio evidenzi un malinteso di fondo: non stiamo
> discutendo della
> legittimità di creare un dataset contenente copie di testi coperti dal
> diritto d'autore, ne della
> loro copia in memoria durante il processo impropriamente chiamato
> "training".
>
> Stiamo parlando del processo di creazione di un'opera derivata (il
> "modello").
>
> > certe sue affermazioni sono forse "ingenue" [...] (eg "Anche se poi le
> aziende
> > forniscono accesso a quelle opere derivate "a pezzetti", le opere sono
> > state integralmente incluse nel processo di programmazione statistica (il
> > "training" della "AI")").
>
> Beh, più che ingenuo, direi che distinguere fra software e output del
> software è ovvio.
>
> Mi pare invece incredibile che li si possa confondere e mi chiedo come sia
> possibile
> nel 2024 una confusione tanto evidente.
>
> In questo però potrei essere "ingenuo", in effetti.
>
>
> > La questione dell'applicazione della "dicotomia
> > idea/espressione" al TDM è proprio relativa al fatto che per estrarre
> dati,
> > non proteggibili, si debbano effettuare copie meccaniche integrali
> > dell'espressione proteggibile in cui quei dati sono contenuti.
>
> Sennonché non stiamo parlando di dette copie, ma del software che ne viene
> compilato.
>
>
> Sia chiaro: se il processo di compilazione / compressione lossy cancella
> il diritto
> degli autori a me va benissimo!
>
> L'importante è che valga anche per i binari x86_64 di Microsoft, per gli
> mp4 ottenuti dai film Disney,
> etc...
>
>
>
> Giacomo
>
Sept. 8, 2024
Re: [nexa] dum Romae consulitur Saguntum expugnatur?
by Stefano Borroni Barale
Buonasera a tutte/i,
se devo dire la cosa che mi colpisce di più è la schizofrenia del ministro, che salta come un puntina di un mangiadischi portatile dalla tecnofobia delle sue regole auree per il digitale a scuola a questa 'sperimentazione' tecnoentusiasta improvvisata in 15 scuole. Va bene che dopo aver visto la "riforma della filiera" dei tecnici e professionali fatta in piena estate non dovrei più stupirmi di nulla.
Purtroppo per me non ci riesco: un piccolo colpo al cuore ad ogni ulteriore crollo verso l'abominio non riesco a evitarlo.
Nel frattempo il disco, a furia di saltare la puntina, s'è rigato.
Stefano
Inviato con l'email sicura [Proton Mail](https://proton.me/).
domenica 8 settembre 2024 15:32, maurizio lana <maurizio.lana(a)uniupo.it> ha scritto:
> "Valditara: sperimentazione AI a scuola. Sperimentazione partirà in 15 classi"
> https://www.rainews.it/articoli/ultimora/valditara-sperimentazione-ai-a-scu…
>
>> "Siamo uno dei primi Paesi ad avere avviato quest'anno scolastico una sperimentazione nell'utilizzo dell'intelligenza artificiale per la personalizzazione della didattica. Parte in 15 classi in alcune Regioni: Calabria, Lazio, Toscana, Lombardia". Lo ha detto il ministro dell'Istruzione e del Merito Giuseppe Valditara a Cernobbio.
>
> cioè: noi discutiamo, giustamente, ma lì la introducono. la introducono proprio in quel luogo che noi così fortemente vediamo deputato a costruire capacità critica e non adesione supina.
> quanto al come e su che cosa, Repubblica scrive:
>
>> L’IA per gli insegnanti
>>
>> In [una lettera](https://www.repubblica.it/commenti/2023/01/17/news/valditara_intelligenza_artificiale_scuola-383867327/)che il ministro inviò lo scorso anno a Repubblica Valditara ha spiegato il ruolo [dell’IA](https://www.repubblica.it/scuola/2023/01/20/news/chatbot_il_software_chi_ti_fa_i_compiti-384400644/) a scuola: “Può essere impiegata per aiutare gli insegnanti a personalizzare l'apprendimento, ad adattare i contenuti in base alle attitudini individuali degli studenti, a monitorare i loro progressi e a fornire informazioni su come migliorare il loro rendimento” si legge nella lettera. E sottolinea il ruolo del docente. “L'intelligenza artificiale non può dunque soppiantare l'insegnante né marginalizzarne il ruolo, che è decisivo in tutti i gradi di scuola, in particolare nella primaria”.
>>
>> L’IA per gli studenti
>>
>> Lato studenti, l’uso dell’IA, si legge sempre nella lettera, “può consentire agli studenti di ottenere un riscontro rapido e personalizzato sul lavoro svolto, in modo da aiutarli a concentrarsi sui loro punti di forza e a raggiungere i propri obiettivi educativi. Inoltre, gli studenti possono usare apparecchiature tecnologicamente avanzate, come i robot educativi, per aumentare l'interattività della loro esperienza scolastica”.
>
> Maurizio
>
> ---------------------------------------------------------------
>
> quella volta in due siamo rimasti appesi ad un friend. e ha tenuto.
> quella volta in due siamo rimasti appesi ad un amico. e ha tenuto.
> matteo della bordella
>
> ---------------------------------------------------------------
> Maurizio Lana
> Università del Piemonte Orientale
> Dipartimento di Studi Umanistici
> Piazza Roma 36 - 13100 Vercelli
Sept. 8, 2024
Re: [nexa] AI Training is Copyright Infringement
by Giacomo Tesio
In realtà Giancarlo ho ben chiaro il dibattito in corso, gli interessi in gioco,
le "strane alleanze" e i fiumi di soldi che stanno inquinando questo dibattito.
E sono rassegnato al divorzio dalla realtà che tutto ciò comporta.
Tuttavia, da informatico più interessato allo stato di diritto che ai soldi in questione
non posso che descrivere i software cui il dibattito fa riferimento.
Il 8 Settembre 2024 15:34:15 UTC, GC F ha scritto:
> Quel che conta è che...
Bene, finalmente concordiamo che ogni riferimento al data mining è infondato e fuorviante.
> si utilizzino espressioni proteggibili per
> creare/addestrare uno strumento
Ecco quando su parla di "AI training" si parla del processo di programmazione statistica
attraverso cui si ottiene un software.
Questo software è un opera derivata dai dataset sorgenti (e da pochi altri dati decisi
dai "data scientist").
Ancor prima che questo software venga eseguito e produca output che riproduca in
tutto o in parte un'opera usata per programmarlo, la sua realizzazione deve rispettare
i diritti degli autori di tutte le opere che costituiscono il dataset sorgente.
Questi autori possono aver ceduto il diritto di creare quel software come opera derivata
dalle proprie opere (come fanno i giornalisti o i romanzieri che lavorano come "chatbot helper")
e in tal caso siamo tutti contenti.
Tuttavia, per creare un'opera derivata dalle loro (come il software in questione) tale
cessione è necessaria nei termini del diritto d'autore.
> Anche se il processo di training AI si basa su
> riproduzioni meccaniche di opere nella loro interezza, questo non implica
> di per sé la violazione del diritto d'autore, se tale riproduzione è votata
> alla creazione di uno strumento che poi utilizzi quelle riproduzioni
> meccaniche a fini trasformativi.
Temo che questo passaggio evidenzi un malinteso di fondo: non stiamo discutendo della
legittimità di creare un dataset contenente copie di testi coperti dal diritto d'autore, ne della
loro copia in memoria durante il processo impropriamente chiamato "training".
Stiamo parlando del processo di creazione di un'opera derivata (il "modello").
> certe sue affermazioni sono forse "ingenue" [...] (eg "Anche se poi le aziende
> forniscono accesso a quelle opere derivate "a pezzetti", le opere sono
> state integralmente incluse nel processo di programmazione statistica (il
> "training" della "AI")").
Beh, più che ingenuo, direi che distinguere fra software e output del software è ovvio.
Mi pare invece incredibile che li si possa confondere e mi chiedo come sia possibile
nel 2024 una confusione tanto evidente.
In questo però potrei essere "ingenuo", in effetti.
> La questione dell'applicazione della "dicotomia
> idea/espressione" al TDM è proprio relativa al fatto che per estrarre dati,
> non proteggibili, si debbano effettuare copie meccaniche integrali
> dell'espressione proteggibile in cui quei dati sono contenuti.
Sennonché non stiamo parlando di dette copie, ma del software che ne viene compilato.
Sia chiaro: se il processo di compilazione / compressione lossy cancella il diritto
degli autori a me va benissimo!
L'importante è che valga anche per i binari x86_64 di Microsoft, per gli mp4 ottenuti dai film Disney,
etc...
Giacomo
Sept. 8, 2024
Re: [nexa] AI Training is Copyright Infringement
by Antonio
> Confesso che trovo la tua idea che un LLM sia un 'compilato' dei dataset di
> training molto interessante, però non mi convince per due motivi:
A me invece convince :)
Prendo a prestito llama.cpp (già citato in passato).
Per "produrre" una chat, una delle linee di comando possibile è questa:
./llama-cli -m ggml-model-q4_0.gguf -c 512 -b 1024 -n 256 --keep 48 -r "User:" -f prompt.txt
llama-cli è la "virtual machine" suggerita da Giacomo, può essere benissimo open source e infatti nella maggior parte dei casi lo è. Si occupa dell'inference, in soldoni, effettua i calcoli matriciali e poco altro.
I numeretti che seguono -c, -b, -n, ecc. sono i parametri del model, poco da dire.
I "pesi" sono tutti dentro il file ggml-model-q4_0.gguf.
Questo file è il "compilato". E di questo file non si conosce pressoché nulla sul suo processo di creazione.
Deriva dai dati di training e (spesso) dal lavoro umano di taggatura, ma nel dettaglio nessuno (tranne gli autori) sa come sia stato realizzato.
A.
Sept. 8, 2024
Re: [nexa] AI Training is Copyright Infringement
by Franco Marra
Scusate la domanda *molto* ingenua: non si potrebbe discutere di quanto
associato all'output di un LLM partendo dal concetto di '"opera derivata"
nel senso dei Creative Commons? https://it.wikipedia.org/wiki/Opera_derivata
Il giorno dom 8 set 2024 alle ore 17:34 GC F <gcfrosio(a)gmail.com> ha
scritto:
> Quel che conta è che si utilizzino espressioni proteggibili per
> creare/addestrare uno strumento che genera espressioni diverse e
> trasformative rispetto a quelle proteggibili utilizzate come input per
> l’addestramento. Anche se il processo di training AI si basa su
> riproduzioni meccaniche di opere nella loro interezza, questo non implica
> di per sé la violazione del diritto d'autore, se tale riproduzione è votata
> alla creazione di uno strumento che poi utilizzi quelle riproduzioni
> meccaniche a fini trasformativi. Ovviamente, come ho cercato di spiegare in
> precedenza, le posizioni in materia sono molteplici e divergenti, anche in
> base al sistema giuridico di riferimento. Se conoscesse un poco il
> dibattito si renderebbe conto che certe sue affermazioni sono forse
> "ingenue", come già è stato notato mi pare (eg "Anche se poi le aziende
> forniscono accesso a quelle opere derivate "a pezzetti", le opere sono
> state integralmente incluse nel processo di programmazione statistica (il
> "training" della "AI")"). La questione dell'applicazione della "dicotomia
> idea/espressione" al TDM è proprio relativa al fatto che per estrarre dati,
> non proteggibili, si debbano effettuare copie meccaniche integrali
> dell'espressione proteggibile in cui quei dati sono contenuti.
>
> Giancarlo
>
> On Sun, Sep 8, 2024 at 3:25 PM Giacomo Tesio <giacomo(a)tesio.it> wrote:
>
>> Caro Giancarlo,
>>
>> On Sun, 8 Sep 2024 13:46:50 +0100 GC F <gcfrosio(a)gmail.com> wrote:
>>
>> > La τέχνη specifica è irrilevante.
>>
>> Non parliamo infatti di tecniche ma di finalità.
>>
>> Il data mining è definito dalla finalità di estrarre informazioni
>> intellegibili da grandi volumi di dati, NON dal generare in output
>> testi o immagini che appaiano plausibili ai profani della materia.
>>
>>
>> Dunque le eccezioni specifiche per il data-mining non sono applicabili
>> alle "AI generative", anche nei casi in cui alcune tecniche usate per
>> la programmazione di questi software siano utilizzabili anche per il
>> data mining.
>>
>>
>> Attenzione però a non affermare che le AI generative siano "un processo
>> connesso, simile ma diverso o alternativo" rispetto al data mining.
>> Sarebbe grossolanamente sbagliato, evidenza di una assoluta ignoranza
>> rispetto alla materia oggetto del discorso.
>>
>> Significherebbe affermare che non giò la τέχνη, ma la realtà stessa
>> sia irrilevante.
>>
>> A quel punto non sarebbero gli LLM ad "allucinare", ma i giuristi. ;-)
>>
>>
>> Cui prodest?
>>
>>
>> > Che sia propriamente text-and-and-data mining o processo
>> > connesso, simile ma diverso, o alternativo è di rilevanza
>> > tangenziale. I principi di diritto sono strutturati per adattarsi
>> > all'evoluzione tecnologica. Dottrina e giurisprudenza svolgono questo
>> > ruolo, quando non intervenga una riforma legislativa, applicando
>> > principi e precedenti giurisprudenziali a nuova casistica per
>> > analogia.
>>
>> Tangenziale?
>>
>> Solo chi non ha mai fatto né data mining né "training" di una "IA
>> generativa" può immaginare l'esistenza di analogie fra le due attività.
>>
>> Non ce ne sono, anche quando si utilizzano gli stessi strumenti.
>>
>> Un po' come non ci sono analogie fra le norme applicabili ad un omicida
>> e ad un fabbro che abbiano entrambi utilizzato un martello.
>>
>>
>> Giacomo
>>
>
Sept. 8, 2024
Re: [nexa] AI Training is Copyright Infringement
by GC F
Quel che conta è che si utilizzino espressioni proteggibili per
creare/addestrare uno strumento che genera espressioni diverse e
trasformative rispetto a quelle proteggibili utilizzate come input per
l’addestramento. Anche se il processo di training AI si basa su
riproduzioni meccaniche di opere nella loro interezza, questo non implica
di per sé la violazione del diritto d'autore, se tale riproduzione è votata
alla creazione di uno strumento che poi utilizzi quelle riproduzioni
meccaniche a fini trasformativi. Ovviamente, come ho cercato di spiegare in
precedenza, le posizioni in materia sono molteplici e divergenti, anche in
base al sistema giuridico di riferimento. Se conoscesse un poco il
dibattito si renderebbe conto che certe sue affermazioni sono forse
"ingenue", come già è stato notato mi pare (eg "Anche se poi le aziende
forniscono accesso a quelle opere derivate "a pezzetti", le opere sono
state integralmente incluse nel processo di programmazione statistica (il
"training" della "AI")"). La questione dell'applicazione della "dicotomia
idea/espressione" al TDM è proprio relativa al fatto che per estrarre dati,
non proteggibili, si debbano effettuare copie meccaniche integrali
dell'espressione proteggibile in cui quei dati sono contenuti.
Giancarlo
On Sun, Sep 8, 2024 at 3:25 PM Giacomo Tesio <giacomo(a)tesio.it> wrote:
> Caro Giancarlo,
>
> On Sun, 8 Sep 2024 13:46:50 +0100 GC F <gcfrosio(a)gmail.com> wrote:
>
> > La τέχνη specifica è irrilevante.
>
> Non parliamo infatti di tecniche ma di finalità.
>
> Il data mining è definito dalla finalità di estrarre informazioni
> intellegibili da grandi volumi di dati, NON dal generare in output
> testi o immagini che appaiano plausibili ai profani della materia.
>
>
> Dunque le eccezioni specifiche per il data-mining non sono applicabili
> alle "AI generative", anche nei casi in cui alcune tecniche usate per
> la programmazione di questi software siano utilizzabili anche per il
> data mining.
>
>
> Attenzione però a non affermare che le AI generative siano "un processo
> connesso, simile ma diverso o alternativo" rispetto al data mining.
> Sarebbe grossolanamente sbagliato, evidenza di una assoluta ignoranza
> rispetto alla materia oggetto del discorso.
>
> Significherebbe affermare che non giò la τέχνη, ma la realtà stessa
> sia irrilevante.
>
> A quel punto non sarebbero gli LLM ad "allucinare", ma i giuristi. ;-)
>
>
> Cui prodest?
>
>
> > Che sia propriamente text-and-and-data mining o processo
> > connesso, simile ma diverso, o alternativo è di rilevanza
> > tangenziale. I principi di diritto sono strutturati per adattarsi
> > all'evoluzione tecnologica. Dottrina e giurisprudenza svolgono questo
> > ruolo, quando non intervenga una riforma legislativa, applicando
> > principi e precedenti giurisprudenziali a nuova casistica per
> > analogia.
>
> Tangenziale?
>
> Solo chi non ha mai fatto né data mining né "training" di una "IA
> generativa" può immaginare l'esistenza di analogie fra le due attività.
>
> Non ce ne sono, anche quando si utilizzano gli stessi strumenti.
>
> Un po' come non ci sono analogie fra le norme applicabili ad un omicida
> e ad un fabbro che abbiano entrambi utilizzato un martello.
>
>
> Giacomo
>
Sept. 8, 2024
Re: [nexa] AI Training is Copyright Infringement
by Guido Vetere
Caro Tesio, apprezzo il tono e dunque rispondo.
Sembra un caso degenere perché immagini un'intelligenza artificiale che
> impara.
Fin dai tempi del povero Rosenblatt (morì giovane in un incidente) e dal
suo percettrone, l'umanità intera ha immaginato una 'intelligenza
artificiale che impara' (machine learning). Su cosa cosa significhi
'imparare' per gli umani e per le macchine si sono versati fiumi di
inchiostro, non credo sia il caso di dilungarsi qui. Comunque, chiarisco
che sono tra quelli che negano decisamente qualsiasi analogia tra
l'apprendistato linguistico umano e i SALAMI. Chomsky aveva ragione contro
il distribuzionalismo negli anni '50, e continua ad avere ragione oggi sui
LLM (su tante altre cose aveva torto, ma tralasciamo).
Nonappena comprendi che si tratta semplicemente di un software programmato
> statisticamente
Confesso che trovo la tua idea che un LLM sia un 'compilato' dei dataset di
training molto interessante, però non mi convince per due motivi:
1) Come la mettiamo col lavoro umano di supervisione e rinforzo (cfr.
l'articolo del Guardian riportato oggi qui) che ha un'importanza cruciale
per il comportamento a run-time? Tra l'altro, è proprio qui che si trova il
grande vantaggio competitivo dei monopolisti.
2) Come la mettiamo con la generazione aumentata dal retrieval (RAG)?
Supponi che un grande produttore abbia generato un foundation model con
dataset acquisiti legalmente (bastano le briciole di quello che hanno in
tasca) e lo abbia poi istruito col lavoro di dipendenti regolari. Quel
modello, anche di dimensioni ridotte (es. 70B) sarebbe in grado di fare
cose molto utili, ad esempio question answering, interpolando dati che non
sono nel training set, ma in database esterni sui quali viene a run-time
operata una ricerca.
Suggerisco di stare molto attenti alle false analogie, perché ci danno
l'illusione di riportare l'ignoto al noto (la produzione di software in
questo caso) ma talvolta offuscano la comprensione delle cose.
Regards,
G.
On Sun, 8 Sept 2024 at 16:45, Giacomo Tesio <giacomo(a)tesio.it> wrote:
> Vedi Guido,
>
> Il 8 Settembre 2024 14:24:00 UTC, Guido Vetereha scritto:
> >
> > Research has also shown that memorization occurs if
> > an LLM sees a text repeatedly during training (Carlini et al., 2022b;
> > Biderman et al., 2023).
> > Because of this, *memorization can be seen as an extreme case of training
> > data contamination*
> > where a dataset is not only seen during training but repeated within the
> > training set so often
> > that the LLM becomes able to consistently generate it.
> >
> > La memorizzazione, insomma, è un caso degenere.
>
> Sembra un caso degenere perché immagini un'intelligenza artificiale che
> impara.
>
> Nonappena comprendi che si tratta semplicemente di un software
> programmato statisticamente, ti appare del tutto ovvio e normale che i
> dati più frequenti
> subiscano una perdita minore durante il processo di compressione.
>
> > Infatti, si applicano
> > usualmente tecniche di filtering per deduplicare i passaggi che occorrono
> > molte volte nei dataset di training
>
> E nonostante ciò gli LLM continuano a sputarli fuori.
>
> La differenza non sta nella loro "memorizzazione" da parte del LLM, ma
> nella nostra capacità
> di riconoscerli nell'output nonostante gli errori di decompressione.
>
> Un po' come avvenne per i sorgenti GPL di Quake III sparati in output da
> GitHub Copilot:
> li abbiamo riconosciuti perché sono famosi, non perché Microsoft si è
> dimenticata
> di deduplicare i fork di Quake su GitHub!
>
>
> Giacomo
>
Sept. 8, 2024
Re: [nexa] AI Training is Copyright Infringement
by Giacomo Tesio
Vedi Guido,
Il 8 Settembre 2024 14:24:00 UTC, Guido Vetereha scritto:
>
> Research has also shown that memorization occurs if
> an LLM sees a text repeatedly during training (Carlini et al., 2022b;
> Biderman et al., 2023).
> Because of this, *memorization can be seen as an extreme case of training
> data contamination*
> where a dataset is not only seen during training but repeated within the
> training set so often
> that the LLM becomes able to consistently generate it.
>
> La memorizzazione, insomma, è un caso degenere.
Sembra un caso degenere perché immagini un'intelligenza artificiale che impara.
Nonappena comprendi che si tratta semplicemente di un software
programmato statisticamente, ti appare del tutto ovvio e normale che i dati più frequenti
subiscano una perdita minore durante il processo di compressione.
> Infatti, si applicano
> usualmente tecniche di filtering per deduplicare i passaggi che occorrono
> molte volte nei dataset di training
E nonostante ciò gli LLM continuano a sputarli fuori.
La differenza non sta nella loro "memorizzazione" da parte del LLM, ma nella nostra capacità
di riconoscerli nell'output nonostante gli errori di decompressione.
Un po' come avvenne per i sorgenti GPL di Quake III sparati in output da GitHub Copilot:
li abbiamo riconosciuti perché sono famosi, non perché Microsoft si è dimenticata
di deduplicare i fork di Quake su GitHub!
Giacomo
Sept. 8, 2024
Re: [nexa] AI Training is Copyright Infringement
by Guido Vetere
>
> Microsoft stessa non nega la natura di opera derivata dei LLM (pur
> tentando disperatamente di giustificarla). Ad esempio in "Elephant
> never forget..." [2] i suoi ricercatori scrivono: "This investigation
> reveals that LLMs have memorized many popular tabular datasets
verbatim".
per completezza, riporto un passaggio seguente del suddetto articolo:
Research has also shown that memorization occurs if
an LLM sees a text repeatedly during training (Carlini et al., 2022b;
Biderman et al., 2023).
Because of this, *memorization can be seen as an extreme case of training
data contamination*
where a dataset is not only seen during training but repeated within the
training set so often
that the LLM becomes able to consistently generate it.
La memorizzazione, insomma, è un caso degenere. Infatti, si applicano
usualmente tecniche di filtering per deduplicare i passaggi che occorrono
molte volte nei dataset di training, magari proprio perché gli umani li
hanno plagiarizzati molte volte :-)
Cheers,
G.
On Sun, 8 Sept 2024 at 15:48, Giacomo Tesio <giacomo(a)tesio.it> wrote:
> Ciao Maria Chiara,
>
> riporto il subject al valore iniziale perché non ho molto da aggiungere
> sugli interessi rappresentati da Axel Voss: le norme su copyright,
> brevetti e segreti industriali sono intrinsecamente oscurantiste,
> e rallentano il progresso culturale e tecnologico dell'umanità vietando
> alla maggioranza delle persone di conoscere e/o ragionare liberamente
> sulle informazioni che i dati cui vengono applicate rappresentano.
>
> Detto questo, l'eccitazione di Axel Voss dipende dalla stessa ignoranza
> informatica di coloro che si strappano le vesti di fronte ad uno studio
> che afferma una semplice ovvietà tecnica: le "AI generative" sono opere
> derivate meccanicamente delle opere utilizzate per programmarle
> statisticamente e di cui, come spiegavo in una mail precedente
> costituiscono l'eseguibile compilato per una determinata architettura.
>
> On Sun, 8 Sep 2024 10:33:05 +0200 Maria Chiara Pievatolo wrote:
>
> > Dove i SALAMI rimescolano, bisognerebbe cambiare il copyright
> > estendendo a tutte le espressioni delle idee (recensioni, riassunti
> > umani e no etc.) la stessa disciplina che si applica, secondo me
> > incoerentemente (slide 22: https://zenodo.org/records/11163103)
> > alle traduzioni.
>
> Non serve: il copyright com'è protegge già gli eseguibili compilati a
> partire da testi chiamati "codice sorgente", senza bisogno di alcuna
> modifica alla normativa o alcuna estensione alla sua interpretazione.
>
> Anche il processo di compilazione di un comune software scritto in C è
> un processo di compressione particolarmente evidente laddove non vi
> siano molte dipendenze esterne. Ad esempio, il kernel di linux versione
> 5.10 è un testo da quasi un gigabyte. Compresso in tar.xz [1] occupa
> circa 115 Mega (un fattore di compressione senza perdita di
> informazione di 8 a 1, circa) mentre una volta compilato occupa circa 7
> megabyte (un fattore di compressione CON perdita di informazione di
> oltre 100 volte).
>
>
> L'eseguibile che i fautori delle "AI generative" chiamano impropriamente
> "modello" subisce una compressione concettualmente analoga attraverso
> il processo di compilazione dei dataset sorgenti.
>
>
> Non è dunque necessario modificare il diritto d'autore per riconoscere
> i "modelli AI" (le matrici eseguibili da quelle macchine virtuali) come
> opere derivate dai testi sorgenti.
>
> Anche se poi le aziende forniscono accesso a quelle opere derivate "a
> pezzetti", le opere sono state integralmente incluse nel processo di
> programmazione statistica (il "training" della "AI").
> In altri termini, il "modello" deriva dalla totalità di ciascun opera
> usata per la sua programmazione, nonché dalla totalità di TUTTE le
> opere utilizzate (pubblicamente note, o meno).
> Ciò rende inapplicabili ai modelli le eccezioni che permettono di citare
> piccoli frammenti di un opera in un'altra.
>
>
> Dunque, indipendentemente dall'articolo e dalle ragioni di chi l'ha
> scritto, affermare che "AI Training is Copyright Infringement" significa
> semplicemente prendere atto di come funziona il processo in questione e
> ciò che produce (il "modello").
>
> Microsoft stessa non nega la natura di opera derivata dei LLM (pur
> tentando disperatamente di giustificarla). Ad esempio in "Elephant
> never forget..." [2] i suoi ricercatori scrivono: "This investigation
> reveals that LLMs have memorized many popular tabular datasets
> verbatim".
>
>
> Dunque nessun bisogno di estendere o rafforzare il diritto d'autore:
> basta applicare le norme vigenti anche a chi approfitta dell'ignoranza
> altrui per sottrarvisi attraverso software che pochi comprendono
> (anzitutto fra coloro che ne parlano)
>
>
>
> Giacomo
>
>
> [1]
> https://cdn.kernel.org/pub/linux/kernel/v5.x/linux-5.10.225.tar.x
>
> [2] https://arxiv.org/abs/2404.06209
>
Sept. 8, 2024