nexa
By thread
nexa@server-nexa.polito.it
By month
Messages by month
- ----- 2026 -----
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2025 -----
- December
- November
- October
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2024 -----
- December
- November
- October
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2023 -----
- December
- November
- October
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2022 -----
- December
- November
- October
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2021 -----
- December
- November
- October
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2020 -----
- December
- November
- October
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2019 -----
- December
- November
- October
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2018 -----
- December
- November
- October
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2017 -----
- December
- November
- October
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2016 -----
- December
- November
- October
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2015 -----
- December
- November
- October
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2014 -----
- December
- November
- October
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2013 -----
- December
- November
- October
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2012 -----
- December
- November
- October
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2011 -----
- December
- November
- October
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2010 -----
- December
- November
- October
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2009 -----
- December
- November
- October
- September
- August
- July
- June
- May
September 2024
- 45 participants
- 214 messages
Re: [nexa] AI Training is Copyright Infringement
by Giacomo Tesio
Caro Giancarlo,
Mi spiace averti stancato, per cui non ti tedierò con le ovvie differenze fra un LLM
(che è una compressione lossy eseguibile dei testi sorgente) e Google Books (che è una
semplice interfaccia web su _estratti_
di quei testi).
Tuttavia credo sia importante chiarire un aspetto che le tue considerazioni riportano alla mente
Il 8 Settembre 2024 18:13:43 UTC, GC F ha scritto:
> Il materiale non è usato per il suo valore espressivo,
se così fosse Microsoft & friends non starebbero pagando scrittori e giornalisti per
scrivere testi che nessuno leggerà mai!
Lo fanno proprio perché sanno benissimo che il loro software non contiene idee ma espressioni.
SOLO espressioni.
Se l'uso delle espressioni originali negli LLM fosse "trasformativo", la presenza di espressioni
prodotte in output da altri LLM nei dataset sorgente non sarebbe un problema.
Invece il problema del "model collapse" deriva proprio dal fatto che l'output di un LLM
non ha alcun "valore espressivo", contrariamente alle opere originali.
> quindi la creazione del software/modello non ha effetti sul
> valore di mercato dell'opera originale utilizzata - non la sostituisce.
Non stiamo parlando del valore di mercato di un'opera, ma del valore di mercato dei
diritti di sfruttamento ad essa connessi.
In particolare del valore di mercato del diritto a creare opere derivate (l'LLM).
Questo diritto può essere ceduto per un corrispettvo che chi programma LLM non
sta pagando.
Se lo pagasse, il valore di mercato di quel diritto di sfruttamento economico dell'opera
aumenterebbe notevolmente, perché le varie aziende che producono LLM
si contenderebbero il diritto di creare LLM derivati dalle opere migliori.
Lo vedi bene nell'articolo citato da Antonio in un altro thread, dove i diritti su articoli che
nessuno leggerà mai e che dunque non avrebbero alcun valore di mercato,
acquisiscono un valore comparabile a quello corrisposto da un giornale che li pubblica.
> Si potrebbe discutere se quegli effetti sostitutivi ci siano nel contesto
> della produzione degli output di quel modello, ma è altra questione
Vero, è un'altra questione: i modelli delle "AI generative" sono archivi compressi
(con perdita di informazioni).
Non sostituiscono una singola opera.
Sono surrogati di tutte le opere usate per programmarli e di ciascuna di esse.
Surrogati di qualità variabile, ma pur sempre surrogati.
Come una jpeg compressa di una serie di dipinti affiancati sarebbe un surrogato di
tutti i dipinti inclusi e di ciascuno.
I loro output però sono evidenti surrogati per le opere da cui derivano.
Se così non fosse, non ci sarebbero decine
di pubblicazioni scientifiche che li riportano,
citando articoli mai scritti che gli autori non hanno nemmeno provato ad acquistare
(con buona pace della favola delle peer review).
E ricorderai anche tu il caso dell'avvocato che presentò al giudice un documento pieno
di riferimenti giurisprudenziali inesistenti perché prodotto con un LLM.
Riferimenti giurisprudenziali a testi che lui non aveva nemmeno provato a comprare,
accontentandosi del surrogato fornito dal LLM.
D'altronde chi usa le "AI generative" per "generare" contenuti non può proprio acquistare
le opere originali da cui quei contenuti sono tratti, neənche volendo.
Non solo perché a volte si tratta di chat o mail private, testi inediti etc... ma perché
gli LLM non sono in grado di fornire i riferimenti corretti (anche quando ne forniscono
di esistenti) proprio per come funzionano.
> Il mio riferimento precedente alla τέχνη era un'allusione a un dibattito
> millenario. Non si può ridurre tutto alla τέχνη;
Perché, la Giurisprudenza non è essa stessa un'arte?
Giacomo
PS: non sentirti in alcun modo obbligato a rispondere se non ti va...
e se preferisci possiamo continuare in privato.
Sept. 8, 2024
Re: [nexa] AI Training is Copyright Infringement
by Maria Chiara Pievatolo
On 08/09/24 15:48, Giacomo Tesio wrote:
>
> L'eseguibile che i fautori delle "AI generative" chiamano impropriamente
> "modello" subisce una compressione concettualmente analoga attraverso
> il processo di compilazione dei dataset sorgenti.
Ti segnalo uno studio sulla possibilità di mantenere la pubblicità delle
licenze Share Alike/Copyleft, presente nel materiale usato come training
data,in "developing AI models, deploying AI systems, and using AI output":
https://openfuture.eu/wp-content/uploads/2024/06/Share-Alike-and-ML-Report-…
L'articolo è scritto da autori assai più simpatetici ai valori della
cultura libera di quelli che rispondono ai non disinteressati
committenti (https://urheber.info/about-us) dello studio elogiato da
Voss. Cito da pagina 15:
...this broad approach in the EU raises the question of whether
electronic changes to a computer file containing a work that result in
adaptation or conversion of the file to a desirable format could
similarly involve an act of reproduction, which would be different and
separate from the mere act of copying data. While CJEU jurisprudence
points in this direction, the Canadian Supreme Court has reached a
different conclusion for such acts. Hence, the issue has not been
settled yet. If the issue is brought before the CJEU, the Court may
refrain from extending the Canvas approach to file conversions for TDM
purposes.
Whether copyright-relevant acts of reproduction take place during stage
five is not as straightforward to ascertain. Although the applicable
copyright principles are easy to explain, the model exists as a separate
artefact: normally operating independently from its training pipeline.41
It does not seem to retrieve the contents of the training dataset when
generating outputs during the exploitation phase. Hence, it can be
argued that the artefact exists and operates independently from the
copyright-protected data that have been used as training resources in
the preceding steps one to four – data that could include ‘licensed
material’ triggering CLSA obligations. Following this line of argument,
***the artefact can be described as a giant collection of data points
and vectors that have been derived from the training material***. It can
also be assumed that the artefact is unlikely to contain
copyright-protected traces of works that were used for training.42 The
adoption of this perspective leads to the conclusion that the creation
of the trained model at stage five breaks the link with CLSA licensing
obligations that may rest on training resources. If the artefact as such
does not contain copyright-protected traces of CLSA works used for
training purposes, copyright law does not offer tools for enforcing CLSA
conditions: relevant acts of reproduction are sought in vain.
Si tratta di una dottrina diffusa (come mostrano i riferimenti in nota,
che meritano di essere letti). Se vai avanti nella lettura vedrai che
gli autori riconoscono eccezioni solo quando l'artefact (così chiamano
il modello) contiene in effetti frammenti letterali.
Collezionare non testi e immagine copiate, ma "data points and vectors
that have been derived from training materials" viola il diritto d'autore?
Certo, se uso l'analogia delle traduzioni e applico il diritto d'autore
di Kant (che nega alla traduzione il carattere di opera derivata), una
traduzione, anche a calco, è un'espressione diversa che va attribuito
interamente al traduttore, sebbene "derivi" da un'opera altrui. Quando
traduco, anche meccanicamente, un testo, magari scrivendo la mia
versione in una qualche forma compressa, violo il diritto d'autore -
almeno se applico in modo coerente, come secondo me non fa il copyright
vigente, la distinzione fra idea ed espressione?
Ho una risposta, ma ci devo pensare.
Per il momento preferisco un approccio pragmatico (e kantiano) che
riguarda solo gli atti di comunicazione al pubblico: uno studente che si
fa fare la tesi dai SALAMI viola il diritto d'autore (oltre che le
norme, dai regolamenti di ateneo in su, che gli richiederebbero di
produrre farina del suo sacco) se il testo che ha fatto proprio contiene
frammenti letterali non correttamente attribuiti? E se viene scoperto e
sanzionato, può denunciare per truffa chi ha gli offerto i SALAMI come
strumenti di lavoro creativo?
Buonanotte,
NCP
Sept. 8, 2024
Re: [nexa] AI Training is Copyright Infringement
by GC F
Si, ma l'uso del materiale per creare il software che poi genera a sua
volta è a fini trasformativi! Il materiale non è usato per il suo valore
espressivo, quindi la creazione del software/modello non ha effetti sul
valore di mercato dell'opera originale utilizzata - non la sostituisce. Si
potrebbe discutere se quegli effetti sostitutivi ci siano nel contesto
della produzione degli output di quel modello, ma è altra questione - e io
direi di no in base alla mia interpretazione di nozioni quali ad esempio
"effect of the use on the potential market for the work" nella clausola
fair use o nozioni come "conflicting with normal exploitation of the work"
e "prejudice legitimate interests" nel three-step-test di Berna. Questa è
la mia argomentazione. Ve ne sono altre plausibili. Legga *Google Books* e
quel che viene prima.
Lei è estenuante. Non è necessario rispondere a tutto, ripetutamente,
discutendo affermazioni che lei assume appartengano al suo interlocutore
senza che questo sia il caso, sviluppando argomentazioni che sono per la
maggior parte irrilevanti rispetto a quel che il suo interlocutore dice e
costantemente lasciar intendere che il suo interlocutore non comprende la
tecnologia che lei invece ben comprende, anche se poi quella comprensione
profonda è irrilevante ai fini della discussione.
Il mio riferimento precedente alla τέχνη era un'allusione a un dibattito
millenario. Non si può ridurre tutto alla τέχνη; bisognerebbe saper
astrarre...
Giancarlo
On Sun, Sep 8, 2024 at 6:05 PM Giacomo Tesio <giacomo(a)tesio.it> wrote:
> In realtà Giancarlo ho ben chiaro il dibattito in corso, gli interessi in
> gioco,
> le "strane alleanze" e i fiumi di soldi che stanno inquinando questo
> dibattito.
>
> E sono rassegnato al divorzio dalla realtà che tutto ciò comporta.
>
> Tuttavia, da informatico più interessato allo stato di diritto che ai
> soldi in questione
> non posso che descrivere i software cui il dibattito fa riferimento.
>
> Il 8 Settembre 2024 15:34:15 UTC, GC F ha scritto:
> > Quel che conta è che...
>
> Bene, finalmente concordiamo che ogni riferimento al data mining è
> infondato e fuorviante.
>
> > si utilizzino espressioni proteggibili per
> > creare/addestrare uno strumento
>
> Ecco quando su parla di "AI training" si parla del processo di
> programmazione statistica
> attraverso cui si ottiene un software.
>
> Questo software è un opera derivata dai dataset sorgenti (e da pochi altri
> dati decisi
> dai "data scientist").
>
> Ancor prima che questo software venga eseguito e produca output che
> riproduca in
> tutto o in parte un'opera usata per programmarlo, la sua realizzazione
> deve rispettare
> i diritti degli autori di tutte le opere che costituiscono il dataset
> sorgente.
>
> Questi autori possono aver ceduto il diritto di creare quel software come
> opera derivata
> dalle proprie opere (come fanno i giornalisti o i romanzieri che lavorano
> come "chatbot helper")
> e in tal caso siamo tutti contenti.
>
> Tuttavia, per creare un'opera derivata dalle loro (come il software in
> questione) tale
> cessione è necessaria nei termini del diritto d'autore.
>
> > Anche se il processo di training AI si basa su
> > riproduzioni meccaniche di opere nella loro interezza, questo non implica
> > di per sé la violazione del diritto d'autore, se tale riproduzione è
> votata
> > alla creazione di uno strumento che poi utilizzi quelle riproduzioni
> > meccaniche a fini trasformativi.
>
> Temo che questo passaggio evidenzi un malinteso di fondo: non stiamo
> discutendo della
> legittimità di creare un dataset contenente copie di testi coperti dal
> diritto d'autore, ne della
> loro copia in memoria durante il processo impropriamente chiamato
> "training".
>
> Stiamo parlando del processo di creazione di un'opera derivata (il
> "modello").
>
> > certe sue affermazioni sono forse "ingenue" [...] (eg "Anche se poi le
> aziende
> > forniscono accesso a quelle opere derivate "a pezzetti", le opere sono
> > state integralmente incluse nel processo di programmazione statistica (il
> > "training" della "AI")").
>
> Beh, più che ingenuo, direi che distinguere fra software e output del
> software è ovvio.
>
> Mi pare invece incredibile che li si possa confondere e mi chiedo come sia
> possibile
> nel 2024 una confusione tanto evidente.
>
> In questo però potrei essere "ingenuo", in effetti.
>
>
> > La questione dell'applicazione della "dicotomia
> > idea/espressione" al TDM è proprio relativa al fatto che per estrarre
> dati,
> > non proteggibili, si debbano effettuare copie meccaniche integrali
> > dell'espressione proteggibile in cui quei dati sono contenuti.
>
> Sennonché non stiamo parlando di dette copie, ma del software che ne viene
> compilato.
>
>
> Sia chiaro: se il processo di compilazione / compressione lossy cancella
> il diritto
> degli autori a me va benissimo!
>
> L'importante è che valga anche per i binari x86_64 di Microsoft, per gli
> mp4 ottenuti dai film Disney,
> etc...
>
>
>
> Giacomo
>
Sept. 8, 2024
Re: [nexa] dum Romae consulitur Saguntum expugnatur?
by Stefano Borroni Barale
Buonasera a tutte/i,
se devo dire la cosa che mi colpisce di più è la schizofrenia del ministro, che salta come un puntina di un mangiadischi portatile dalla tecnofobia delle sue regole auree per il digitale a scuola a questa 'sperimentazione' tecnoentusiasta improvvisata in 15 scuole. Va bene che dopo aver visto la "riforma della filiera" dei tecnici e professionali fatta in piena estate non dovrei più stupirmi di nulla.
Purtroppo per me non ci riesco: un piccolo colpo al cuore ad ogni ulteriore crollo verso l'abominio non riesco a evitarlo.
Nel frattempo il disco, a furia di saltare la puntina, s'è rigato.
Stefano
Inviato con l'email sicura [Proton Mail](https://proton.me/).
domenica 8 settembre 2024 15:32, maurizio lana <maurizio.lana(a)uniupo.it> ha scritto:
> "Valditara: sperimentazione AI a scuola. Sperimentazione partirà in 15 classi"
> https://www.rainews.it/articoli/ultimora/valditara-sperimentazione-ai-a-scu…
>
>> "Siamo uno dei primi Paesi ad avere avviato quest'anno scolastico una sperimentazione nell'utilizzo dell'intelligenza artificiale per la personalizzazione della didattica. Parte in 15 classi in alcune Regioni: Calabria, Lazio, Toscana, Lombardia". Lo ha detto il ministro dell'Istruzione e del Merito Giuseppe Valditara a Cernobbio.
>
> cioè: noi discutiamo, giustamente, ma lì la introducono. la introducono proprio in quel luogo che noi così fortemente vediamo deputato a costruire capacità critica e non adesione supina.
> quanto al come e su che cosa, Repubblica scrive:
>
>> L’IA per gli insegnanti
>>
>> In [una lettera](https://www.repubblica.it/commenti/2023/01/17/news/valditara_intelligenza_artificiale_scuola-383867327/)che il ministro inviò lo scorso anno a Repubblica Valditara ha spiegato il ruolo [dell’IA](https://www.repubblica.it/scuola/2023/01/20/news/chatbot_il_software_chi_ti_fa_i_compiti-384400644/) a scuola: “Può essere impiegata per aiutare gli insegnanti a personalizzare l'apprendimento, ad adattare i contenuti in base alle attitudini individuali degli studenti, a monitorare i loro progressi e a fornire informazioni su come migliorare il loro rendimento” si legge nella lettera. E sottolinea il ruolo del docente. “L'intelligenza artificiale non può dunque soppiantare l'insegnante né marginalizzarne il ruolo, che è decisivo in tutti i gradi di scuola, in particolare nella primaria”.
>>
>> L’IA per gli studenti
>>
>> Lato studenti, l’uso dell’IA, si legge sempre nella lettera, “può consentire agli studenti di ottenere un riscontro rapido e personalizzato sul lavoro svolto, in modo da aiutarli a concentrarsi sui loro punti di forza e a raggiungere i propri obiettivi educativi. Inoltre, gli studenti possono usare apparecchiature tecnologicamente avanzate, come i robot educativi, per aumentare l'interattività della loro esperienza scolastica”.
>
> Maurizio
>
> ---------------------------------------------------------------
>
> quella volta in due siamo rimasti appesi ad un friend. e ha tenuto.
> quella volta in due siamo rimasti appesi ad un amico. e ha tenuto.
> matteo della bordella
>
> ---------------------------------------------------------------
> Maurizio Lana
> Università del Piemonte Orientale
> Dipartimento di Studi Umanistici
> Piazza Roma 36 - 13100 Vercelli
Sept. 8, 2024
Re: [nexa] AI Training is Copyright Infringement
by Giacomo Tesio
In realtà Giancarlo ho ben chiaro il dibattito in corso, gli interessi in gioco,
le "strane alleanze" e i fiumi di soldi che stanno inquinando questo dibattito.
E sono rassegnato al divorzio dalla realtà che tutto ciò comporta.
Tuttavia, da informatico più interessato allo stato di diritto che ai soldi in questione
non posso che descrivere i software cui il dibattito fa riferimento.
Il 8 Settembre 2024 15:34:15 UTC, GC F ha scritto:
> Quel che conta è che...
Bene, finalmente concordiamo che ogni riferimento al data mining è infondato e fuorviante.
> si utilizzino espressioni proteggibili per
> creare/addestrare uno strumento
Ecco quando su parla di "AI training" si parla del processo di programmazione statistica
attraverso cui si ottiene un software.
Questo software è un opera derivata dai dataset sorgenti (e da pochi altri dati decisi
dai "data scientist").
Ancor prima che questo software venga eseguito e produca output che riproduca in
tutto o in parte un'opera usata per programmarlo, la sua realizzazione deve rispettare
i diritti degli autori di tutte le opere che costituiscono il dataset sorgente.
Questi autori possono aver ceduto il diritto di creare quel software come opera derivata
dalle proprie opere (come fanno i giornalisti o i romanzieri che lavorano come "chatbot helper")
e in tal caso siamo tutti contenti.
Tuttavia, per creare un'opera derivata dalle loro (come il software in questione) tale
cessione è necessaria nei termini del diritto d'autore.
> Anche se il processo di training AI si basa su
> riproduzioni meccaniche di opere nella loro interezza, questo non implica
> di per sé la violazione del diritto d'autore, se tale riproduzione è votata
> alla creazione di uno strumento che poi utilizzi quelle riproduzioni
> meccaniche a fini trasformativi.
Temo che questo passaggio evidenzi un malinteso di fondo: non stiamo discutendo della
legittimità di creare un dataset contenente copie di testi coperti dal diritto d'autore, ne della
loro copia in memoria durante il processo impropriamente chiamato "training".
Stiamo parlando del processo di creazione di un'opera derivata (il "modello").
> certe sue affermazioni sono forse "ingenue" [...] (eg "Anche se poi le aziende
> forniscono accesso a quelle opere derivate "a pezzetti", le opere sono
> state integralmente incluse nel processo di programmazione statistica (il
> "training" della "AI")").
Beh, più che ingenuo, direi che distinguere fra software e output del software è ovvio.
Mi pare invece incredibile che li si possa confondere e mi chiedo come sia possibile
nel 2024 una confusione tanto evidente.
In questo però potrei essere "ingenuo", in effetti.
> La questione dell'applicazione della "dicotomia
> idea/espressione" al TDM è proprio relativa al fatto che per estrarre dati,
> non proteggibili, si debbano effettuare copie meccaniche integrali
> dell'espressione proteggibile in cui quei dati sono contenuti.
Sennonché non stiamo parlando di dette copie, ma del software che ne viene compilato.
Sia chiaro: se il processo di compilazione / compressione lossy cancella il diritto
degli autori a me va benissimo!
L'importante è che valga anche per i binari x86_64 di Microsoft, per gli mp4 ottenuti dai film Disney,
etc...
Giacomo
Sept. 8, 2024
Re: [nexa] AI Training is Copyright Infringement
by Antonio
> Confesso che trovo la tua idea che un LLM sia un 'compilato' dei dataset di
> training molto interessante, però non mi convince per due motivi:
A me invece convince :)
Prendo a prestito llama.cpp (già citato in passato).
Per "produrre" una chat, una delle linee di comando possibile è questa:
./llama-cli -m ggml-model-q4_0.gguf -c 512 -b 1024 -n 256 --keep 48 -r "User:" -f prompt.txt
llama-cli è la "virtual machine" suggerita da Giacomo, può essere benissimo open source e infatti nella maggior parte dei casi lo è. Si occupa dell'inference, in soldoni, effettua i calcoli matriciali e poco altro.
I numeretti che seguono -c, -b, -n, ecc. sono i parametri del model, poco da dire.
I "pesi" sono tutti dentro il file ggml-model-q4_0.gguf.
Questo file è il "compilato". E di questo file non si conosce pressoché nulla sul suo processo di creazione.
Deriva dai dati di training e (spesso) dal lavoro umano di taggatura, ma nel dettaglio nessuno (tranne gli autori) sa come sia stato realizzato.
A.
Sept. 8, 2024
Re: [nexa] AI Training is Copyright Infringement
by Franco Marra
Scusate la domanda *molto* ingenua: non si potrebbe discutere di quanto
associato all'output di un LLM partendo dal concetto di '"opera derivata"
nel senso dei Creative Commons? https://it.wikipedia.org/wiki/Opera_derivata
Il giorno dom 8 set 2024 alle ore 17:34 GC F <gcfrosio(a)gmail.com> ha
scritto:
> Quel che conta è che si utilizzino espressioni proteggibili per
> creare/addestrare uno strumento che genera espressioni diverse e
> trasformative rispetto a quelle proteggibili utilizzate come input per
> l’addestramento. Anche se il processo di training AI si basa su
> riproduzioni meccaniche di opere nella loro interezza, questo non implica
> di per sé la violazione del diritto d'autore, se tale riproduzione è votata
> alla creazione di uno strumento che poi utilizzi quelle riproduzioni
> meccaniche a fini trasformativi. Ovviamente, come ho cercato di spiegare in
> precedenza, le posizioni in materia sono molteplici e divergenti, anche in
> base al sistema giuridico di riferimento. Se conoscesse un poco il
> dibattito si renderebbe conto che certe sue affermazioni sono forse
> "ingenue", come già è stato notato mi pare (eg "Anche se poi le aziende
> forniscono accesso a quelle opere derivate "a pezzetti", le opere sono
> state integralmente incluse nel processo di programmazione statistica (il
> "training" della "AI")"). La questione dell'applicazione della "dicotomia
> idea/espressione" al TDM è proprio relativa al fatto che per estrarre dati,
> non proteggibili, si debbano effettuare copie meccaniche integrali
> dell'espressione proteggibile in cui quei dati sono contenuti.
>
> Giancarlo
>
> On Sun, Sep 8, 2024 at 3:25 PM Giacomo Tesio <giacomo(a)tesio.it> wrote:
>
>> Caro Giancarlo,
>>
>> On Sun, 8 Sep 2024 13:46:50 +0100 GC F <gcfrosio(a)gmail.com> wrote:
>>
>> > La τέχνη specifica è irrilevante.
>>
>> Non parliamo infatti di tecniche ma di finalità.
>>
>> Il data mining è definito dalla finalità di estrarre informazioni
>> intellegibili da grandi volumi di dati, NON dal generare in output
>> testi o immagini che appaiano plausibili ai profani della materia.
>>
>>
>> Dunque le eccezioni specifiche per il data-mining non sono applicabili
>> alle "AI generative", anche nei casi in cui alcune tecniche usate per
>> la programmazione di questi software siano utilizzabili anche per il
>> data mining.
>>
>>
>> Attenzione però a non affermare che le AI generative siano "un processo
>> connesso, simile ma diverso o alternativo" rispetto al data mining.
>> Sarebbe grossolanamente sbagliato, evidenza di una assoluta ignoranza
>> rispetto alla materia oggetto del discorso.
>>
>> Significherebbe affermare che non giò la τέχνη, ma la realtà stessa
>> sia irrilevante.
>>
>> A quel punto non sarebbero gli LLM ad "allucinare", ma i giuristi. ;-)
>>
>>
>> Cui prodest?
>>
>>
>> > Che sia propriamente text-and-and-data mining o processo
>> > connesso, simile ma diverso, o alternativo è di rilevanza
>> > tangenziale. I principi di diritto sono strutturati per adattarsi
>> > all'evoluzione tecnologica. Dottrina e giurisprudenza svolgono questo
>> > ruolo, quando non intervenga una riforma legislativa, applicando
>> > principi e precedenti giurisprudenziali a nuova casistica per
>> > analogia.
>>
>> Tangenziale?
>>
>> Solo chi non ha mai fatto né data mining né "training" di una "IA
>> generativa" può immaginare l'esistenza di analogie fra le due attività.
>>
>> Non ce ne sono, anche quando si utilizzano gli stessi strumenti.
>>
>> Un po' come non ci sono analogie fra le norme applicabili ad un omicida
>> e ad un fabbro che abbiano entrambi utilizzato un martello.
>>
>>
>> Giacomo
>>
>
Sept. 8, 2024
Re: [nexa] AI Training is Copyright Infringement
by GC F
Quel che conta è che si utilizzino espressioni proteggibili per
creare/addestrare uno strumento che genera espressioni diverse e
trasformative rispetto a quelle proteggibili utilizzate come input per
l’addestramento. Anche se il processo di training AI si basa su
riproduzioni meccaniche di opere nella loro interezza, questo non implica
di per sé la violazione del diritto d'autore, se tale riproduzione è votata
alla creazione di uno strumento che poi utilizzi quelle riproduzioni
meccaniche a fini trasformativi. Ovviamente, come ho cercato di spiegare in
precedenza, le posizioni in materia sono molteplici e divergenti, anche in
base al sistema giuridico di riferimento. Se conoscesse un poco il
dibattito si renderebbe conto che certe sue affermazioni sono forse
"ingenue", come già è stato notato mi pare (eg "Anche se poi le aziende
forniscono accesso a quelle opere derivate "a pezzetti", le opere sono
state integralmente incluse nel processo di programmazione statistica (il
"training" della "AI")"). La questione dell'applicazione della "dicotomia
idea/espressione" al TDM è proprio relativa al fatto che per estrarre dati,
non proteggibili, si debbano effettuare copie meccaniche integrali
dell'espressione proteggibile in cui quei dati sono contenuti.
Giancarlo
On Sun, Sep 8, 2024 at 3:25 PM Giacomo Tesio <giacomo(a)tesio.it> wrote:
> Caro Giancarlo,
>
> On Sun, 8 Sep 2024 13:46:50 +0100 GC F <gcfrosio(a)gmail.com> wrote:
>
> > La τέχνη specifica è irrilevante.
>
> Non parliamo infatti di tecniche ma di finalità.
>
> Il data mining è definito dalla finalità di estrarre informazioni
> intellegibili da grandi volumi di dati, NON dal generare in output
> testi o immagini che appaiano plausibili ai profani della materia.
>
>
> Dunque le eccezioni specifiche per il data-mining non sono applicabili
> alle "AI generative", anche nei casi in cui alcune tecniche usate per
> la programmazione di questi software siano utilizzabili anche per il
> data mining.
>
>
> Attenzione però a non affermare che le AI generative siano "un processo
> connesso, simile ma diverso o alternativo" rispetto al data mining.
> Sarebbe grossolanamente sbagliato, evidenza di una assoluta ignoranza
> rispetto alla materia oggetto del discorso.
>
> Significherebbe affermare che non giò la τέχνη, ma la realtà stessa
> sia irrilevante.
>
> A quel punto non sarebbero gli LLM ad "allucinare", ma i giuristi. ;-)
>
>
> Cui prodest?
>
>
> > Che sia propriamente text-and-and-data mining o processo
> > connesso, simile ma diverso, o alternativo è di rilevanza
> > tangenziale. I principi di diritto sono strutturati per adattarsi
> > all'evoluzione tecnologica. Dottrina e giurisprudenza svolgono questo
> > ruolo, quando non intervenga una riforma legislativa, applicando
> > principi e precedenti giurisprudenziali a nuova casistica per
> > analogia.
>
> Tangenziale?
>
> Solo chi non ha mai fatto né data mining né "training" di una "IA
> generativa" può immaginare l'esistenza di analogie fra le due attività.
>
> Non ce ne sono, anche quando si utilizzano gli stessi strumenti.
>
> Un po' come non ci sono analogie fra le norme applicabili ad un omicida
> e ad un fabbro che abbiano entrambi utilizzato un martello.
>
>
> Giacomo
>
Sept. 8, 2024
Re: [nexa] AI Training is Copyright Infringement
by Guido Vetere
Caro Tesio, apprezzo il tono e dunque rispondo.
Sembra un caso degenere perché immagini un'intelligenza artificiale che
> impara.
Fin dai tempi del povero Rosenblatt (morì giovane in un incidente) e dal
suo percettrone, l'umanità intera ha immaginato una 'intelligenza
artificiale che impara' (machine learning). Su cosa cosa significhi
'imparare' per gli umani e per le macchine si sono versati fiumi di
inchiostro, non credo sia il caso di dilungarsi qui. Comunque, chiarisco
che sono tra quelli che negano decisamente qualsiasi analogia tra
l'apprendistato linguistico umano e i SALAMI. Chomsky aveva ragione contro
il distribuzionalismo negli anni '50, e continua ad avere ragione oggi sui
LLM (su tante altre cose aveva torto, ma tralasciamo).
Nonappena comprendi che si tratta semplicemente di un software programmato
> statisticamente
Confesso che trovo la tua idea che un LLM sia un 'compilato' dei dataset di
training molto interessante, però non mi convince per due motivi:
1) Come la mettiamo col lavoro umano di supervisione e rinforzo (cfr.
l'articolo del Guardian riportato oggi qui) che ha un'importanza cruciale
per il comportamento a run-time? Tra l'altro, è proprio qui che si trova il
grande vantaggio competitivo dei monopolisti.
2) Come la mettiamo con la generazione aumentata dal retrieval (RAG)?
Supponi che un grande produttore abbia generato un foundation model con
dataset acquisiti legalmente (bastano le briciole di quello che hanno in
tasca) e lo abbia poi istruito col lavoro di dipendenti regolari. Quel
modello, anche di dimensioni ridotte (es. 70B) sarebbe in grado di fare
cose molto utili, ad esempio question answering, interpolando dati che non
sono nel training set, ma in database esterni sui quali viene a run-time
operata una ricerca.
Suggerisco di stare molto attenti alle false analogie, perché ci danno
l'illusione di riportare l'ignoto al noto (la produzione di software in
questo caso) ma talvolta offuscano la comprensione delle cose.
Regards,
G.
On Sun, 8 Sept 2024 at 16:45, Giacomo Tesio <giacomo(a)tesio.it> wrote:
> Vedi Guido,
>
> Il 8 Settembre 2024 14:24:00 UTC, Guido Vetereha scritto:
> >
> > Research has also shown that memorization occurs if
> > an LLM sees a text repeatedly during training (Carlini et al., 2022b;
> > Biderman et al., 2023).
> > Because of this, *memorization can be seen as an extreme case of training
> > data contamination*
> > where a dataset is not only seen during training but repeated within the
> > training set so often
> > that the LLM becomes able to consistently generate it.
> >
> > La memorizzazione, insomma, è un caso degenere.
>
> Sembra un caso degenere perché immagini un'intelligenza artificiale che
> impara.
>
> Nonappena comprendi che si tratta semplicemente di un software
> programmato statisticamente, ti appare del tutto ovvio e normale che i
> dati più frequenti
> subiscano una perdita minore durante il processo di compressione.
>
> > Infatti, si applicano
> > usualmente tecniche di filtering per deduplicare i passaggi che occorrono
> > molte volte nei dataset di training
>
> E nonostante ciò gli LLM continuano a sputarli fuori.
>
> La differenza non sta nella loro "memorizzazione" da parte del LLM, ma
> nella nostra capacità
> di riconoscerli nell'output nonostante gli errori di decompressione.
>
> Un po' come avvenne per i sorgenti GPL di Quake III sparati in output da
> GitHub Copilot:
> li abbiamo riconosciuti perché sono famosi, non perché Microsoft si è
> dimenticata
> di deduplicare i fork di Quake su GitHub!
>
>
> Giacomo
>
Sept. 8, 2024
Re: [nexa] AI Training is Copyright Infringement
by Giacomo Tesio
Vedi Guido,
Il 8 Settembre 2024 14:24:00 UTC, Guido Vetereha scritto:
>
> Research has also shown that memorization occurs if
> an LLM sees a text repeatedly during training (Carlini et al., 2022b;
> Biderman et al., 2023).
> Because of this, *memorization can be seen as an extreme case of training
> data contamination*
> where a dataset is not only seen during training but repeated within the
> training set so often
> that the LLM becomes able to consistently generate it.
>
> La memorizzazione, insomma, è un caso degenere.
Sembra un caso degenere perché immagini un'intelligenza artificiale che impara.
Nonappena comprendi che si tratta semplicemente di un software
programmato statisticamente, ti appare del tutto ovvio e normale che i dati più frequenti
subiscano una perdita minore durante il processo di compressione.
> Infatti, si applicano
> usualmente tecniche di filtering per deduplicare i passaggi che occorrono
> molte volte nei dataset di training
E nonostante ciò gli LLM continuano a sputarli fuori.
La differenza non sta nella loro "memorizzazione" da parte del LLM, ma nella nostra capacità
di riconoscerli nell'output nonostante gli errori di decompressione.
Un po' come avvenne per i sorgenti GPL di Quake III sparati in output da GitHub Copilot:
li abbiamo riconosciuti perché sono famosi, non perché Microsoft si è dimenticata
di deduplicare i fork di Quake su GitHub!
Giacomo
Sept. 8, 2024