nexa
By thread
nexa@server-nexa.polito.it
By month
Messages by month
- ----- 2026 -----
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2025 -----
- December
- November
- October
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2024 -----
- December
- November
- October
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2023 -----
- December
- November
- October
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2022 -----
- December
- November
- October
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2021 -----
- December
- November
- October
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2020 -----
- December
- November
- October
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2019 -----
- December
- November
- October
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2018 -----
- December
- November
- October
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2017 -----
- December
- November
- October
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2016 -----
- December
- November
- October
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2015 -----
- December
- November
- October
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2014 -----
- December
- November
- October
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2013 -----
- December
- November
- October
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2012 -----
- December
- November
- October
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2011 -----
- December
- November
- October
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2010 -----
- December
- November
- October
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2009 -----
- December
- November
- October
- September
- August
- July
- June
- May
- 39 participants
- 30614 messages
MEMENTO | 175° Mercoledì di Nexa | 11 settembre 2024, ore 17.00
by Nexa - Media
Gentilissime, gentilissimi,
Vi ricordiamo che mercoledì 11 settembre, alle ore 17.00, si terrà il 175° Mercoledì di Nexa
con un incontro dal titolo "Le emissioni segrete. L'impatto ambientale dell'universo digitale".
Ospite dell'incontro: Giovanna Sissa (Università di Genova).
L'incontro si terrà IN PRESENZA e ONLINE.
SEDE FISICA dell'incontro: Centro Nexa su Internet e Società, Politecnico di Torino, Via Boggio 65/a, Torino (1° piano).
Per accedere alla sala si raccomanda di suonare al citofono Portineria e di seguire le indicazioni segnalate lungo il percorso.
QUI<https://nexa.polito.it/contatti> maggiori informazioni su come raggiungerci.
STANZA VIRTUALE dell'incontro: https://didattica.polito.it/VClass/NexaEvent
Maggiori informazioni alla pagina: https://nexa.polito.it/mercoledi-175
Cordiali saluti,
--
Valeria Bergantino
Communication Manager
Nexa Center for Internet & Society
Politecnico di Torino - DAUIN
Via Pier Carlo Boggio, 65/A - 10138 Torino
web: https://nexa.polito.it/
mail: valeria.bergantino(a)polito.it<mailto:valeria.bergantino@polito.it>
tel: 3473443585
Sept. 9, 2024
Re: [nexa] AI Training is Copyright Infringement
by Stefano Zacchiroli
On Sun, Sep 08, 2024 at 04:24:00PM +0200, Guido Vetere wrote:
> La memorizzazione, insomma, è un caso degenere. Infatti, si applicano
> usualmente tecniche di filtering per deduplicare i passaggi che occorrono
> molte volte nei dataset di training, magari proprio perché gli umani li
> hanno plagiarizzati molte volte :-)
Esatto, questo è un punto pratico molto importante che spesso si perde
(anche su questa lista) nelle discussioni sul tema della "recitation"
(restituzione di "lunghi" passaggi presenti nel training dataset da
parte di un LLM).
La recitation è assolutamente *possibile* come caso degenere, come
sottolinea Guido. La frequenza dipende da proprietà statistiche del
training dataset, che chi mette sul mercato un LLM può controllare (ma
spesso fa, perché molto costoso). Quello che invece regolarmente fanno
attori come GitHub con Copilot è di aggiungere a valle della generazione
con gli LLM dei filtri basati su tecniche di code clone detection e
anti-plagio, che sono molto efficaci e relativamente poco costose. Se
una sequenza troppo lunga è presente sia nell'output che nel training
dataset, l'output viene buttato via e rigenerato, fino a quando non si
ottiene un output senza recitation.
Tutto questo non ci aiuta nel dibattito sul decidere se un LLM sia o
meno un opera derivata dei suoi training input. Ne tantomeno ci aiuta
nei casi più complicati nei quali in cui l'output contiene parti del
training dataset, ma non in sequenze verbatim.
Ma in termini di impatto sulla società dei *prodotti* basati su LLM, le
cose sono cambiate parecchio su questi punti dai primi studi empirici su
quanto gli LLM (commercializzati) possano ripetere verbatim i loro input
o meno. È il motivo per cui Microsoft si senza abbastanza sicura di
tutto questo da offrire garanzie legali in termini di violazione del
diritto d'autore quando si usa la suite Copilot. (Non a caso lo fa
*solo* se l'utente non ha disabilitato il filtering a valle di cui
parlavo sopra.)
A presto
--
Stefano Zacchiroli . zack(a)upsilon.cc . https://upsilon.cc/zack _. ^ ._
Full professor of Computer Science o o o \/|V|\/
Télécom Paris, Polytechnic Institute of Paris o o o </> <\>
Co-founder & CTO Software Heritage o o o o /\|^|/\
https://twitter.com/zacchiro . https://mastodon.xyz/@zacchiro '" V "'
Sept. 9, 2024
Re: [nexa] AI Training is Copyright Infringement
by Giacomo Tesio
Salve Giuseppe,
On Mon, 9 Sep 2024 09:50:41 +0200 Giuseppe Attardi wrote:
> Che significa “software programmato statisticamente”?
Un software (ovvero una sequenza di byte eseguibili da una macchina con
una architettura nota in fase di compilazione) programmato attraverso
tecniche statistiche, ovvero basate sull'elaborazione di grandi
quantitativi di dati selezionati allo scopo.
> Una rete neurale è realizzata con programmi come altri utilizzando
> algoritmi di ottimizzazione, con un processo di fit dei parametri del
> modello rispetto ai dati per minimizzare una funzione di loss.
Esatto, ottimo esempio.
Con il termine "rete neurale artificiale" si con-fondono due software
diversi programmati con tecniche diverse:
- la macchina virtuale caratterizzata dall'architettura di interesse
(la topologia della rete), tipicamente scritta in R, Python, C etc...
- il software che quella macchina virtuale esegue, espresso come
matrici numeriche, programmato appunto attraverso tecniche
statistiche e compilato per quella specifica macchina virtuale
Si tratta di software distinti, anche quando usati insieme.
Il primo software (la macchina virtuale) viene eseguito dall'hardware
(che può essere a sua volta virtuale, ovviamente), mentre il secondo
(il cosiddetto "modello" della "rete neurale artificiale") viene
eseguito dal primo.
I sorgenti del primo vengono scritti.
I sorgenti del secondo vengono selezionati.
Cambiano le tecniche di programmazione e compilazione, ma rimangono
sorgenti di software compilati per essere eseguiti dalle rispettive
architetture di interesse.
> Un modello statistico sarebbe quello costruito a partire da un
> campione statistico rappresentativo, selezionato appunto su basi
> statistiche.
Infatti!
Proprio il software programmato statisticamente a partire dai dataset
sorgente non è un modello statistico, è sbagliato chiamarlo "modello".
Altrimenti finisce che i giuristi lo confondono con il data mining.
> Ciò non vale per i LLM che usano tutti i dati disponibili,
> considerandoli la realtà stessa e non la loro rappresentazione.
Gli LLM non hanno alcuna consapevolezza dell'esistenza della realtà.
Dunque non possono "considerare" i dati come la realtà.
Gli LLM sono programmati compilando i dati SCELTI da chi li programma.
La scelta dei contenuti da includere nel dataset è l'aspetto
predominante del processo di programmazione statistica.
> Quanto a “imparare”, è discutibile usare termini antropomorfi
> riguardo alle macchine, ma per intenderci si può dire che fanno
> qualcosa che si avvicina al nostro concetto di apprendere, ossia
> saper usare quanto visto in precedenza in situazioni nuove.
No.
La calcolatrice non conosce l'aritmetica, anche se riesce a produrre in
output una configurazione di cristalli liquidi che la tua mente può
interpretare come somme che non le sono mai state sottoposte in passato.
Una calcolatrice non sa cosa sia un numero più di quanto
un LLM non sappia cosa sia un testo.
Chi l'ha programmata non le ha insegnato l'aritmetica e lei non l'ha
appresa, per nessuna definizione ragionevole di "apprendimento".
Chi l'ha programmata ha codificato la _propria_ conoscenza della
aritmetica in una serie di circuiti che ne _riproducono_ le regole
sulle rappresentazioni elettriche fornite in input.
Allo stesso modo, non c'è alcuna relazione fra il processo di
programmazione statistica di una macchina in grado di ridurre
vettori e l'apprendimento di un essere umano.
Entrambi i processi sono iterativi e producono un cambiamento nel ente
che li subisce, non hanno null'altro in comune.
Se dicessi in una conferenza che la frutta "apprende" come comportarsi
da marmellata, tutti riderebbero fragorosamente. :-D
Dire che un software "apprende" come comportarsi è altrettanto
ridicolo, ma hubris, ignoranza e soldi convincono troppe persone
a non ridere quando sentono parlare di "machine learning".
Così rimangono solo bambini e buffoni a ricordare che il re è nudo...
e i software si programmano.
¯\_(ツ)_/¯
E sì, è vero: è davvero un lavoro estenuante! ;-)
Giacomo
Sept. 9, 2024
Re: [nexa] AI Training is Copyright Infringement
by Giuseppe Attardi
> Il 8 Settembre 2024 14:24:00 UTC, Guido Vetereha scritto:
>>
>> Research has also shown that memorization occurs if
>> an LLM sees a text repeatedly during training (Carlini et al., 2022b;
>> Biderman et al., 2023).
>> Because of this, *memorization can be seen as an extreme case of training
>> data contamination*
>> where a dataset is not only seen during training but repeated within the
>> training set so often
>> that the LLM becomes able to consistently generate it.
>>
>> La memorizzazione, insomma, è un caso degenere.
>
> Sembra un caso degenere perché immagini un'intelligenza artificiale che impara.
>
> Non appena comprendi che si tratta semplicemente di un software
> programmato statisticamente
Che significa “software programmato statisticamente”? Una rete neurale è realizzata con programmi come altri utilizzando algoritmi di ottimizzazione, con un processo di fit dei parametri del modello rispetto ai dati per minimizzare una funzione di loss.
Un modello statistico sarebbe quello costruito a partire da un campione statistico rappresentativo, selezionato appunto su basi statistiche. Ciò non vale per i LLM che usano tutti i dati disponibili, considerandoli la realtà stessa e non la loro rappresentazione.
Quanto a “imparare”, è discutibile usare termini antropomorfi riguardo alle macchine, ma per intenderci si può dire che fanno qualcosa che si avvicina al nostro concetto di apprendere, ossia saper usare quanto visto in precedenza in situazioni nuove.
—
Sept. 9, 2024
Re: [nexa] AI Training is Copyright Infringement
by Giacomo Tesio
On Sun, 8 Sep 2024 17:12:23 +0200 Guido Vetere wrote:
> Su cosa cosa significhi 'imparare' per gli umani e per le macchine si
> sono versati fiumi di inchiostro, non credo sia il caso di dilungarsi
> qui.
Direi piuttosto che fiumi di inchiostro sono stati versati per
giustificare la ridefinizione di termini come "imparare" e "apprendere"
affinché possano essere applicati alle macchine.
Più interessante sarebbe riflettere sugli obbiettivi di queste
ridefinizioni: se si sia trattato di nobilitare le macchine o di
alienare le persone.
Le "sperimentazioni" sulle "AI" a scuola avvalorano la seconda ipotesi.
> > Nonappena comprendi che si tratta semplicemente di un software
> > programmato statisticamente
>
> Confesso che trovo la tua idea che un LLM sia un 'compilato' dei
> dataset di training molto interessante
Non lo è, in realtà: è ovvia.
Con la sua semplicità, ridicolizza la favola delle "intelligenze artificiali" al rasoio di Occam.
Per chi ha creduto in quella favola però può essere una interessante doccia fredda.
> però non mi convince per due motivi:
> 1) Come la mettiamo col lavoro umano di supervisione e
> rinforzo (cfr. l'articolo del Guardian riportato oggi qui) che ha
> un'importanza cruciale per il comportamento a run-time? Tra l'altro,
> è proprio qui che si trova il grande vantaggio competitivo dei
> monopolisti.
Quel lavoro è parte del processo di programmazione statistica che non
coincide con la sola compilazione del dataset iniziale, ma include la scelta
degli hyper parameter, la scelta del dataset iniziale, la scelta della
dimensione del vocabolario, la scelta del processo di programmazione,
la scelta dei valori iniziali, la supervisione etc...
La taggatura, i testi utilizzati per eventuali fine-tuning etc... aumentano il dataset
sorgente, come file aggiunti a uno zip dopo la sua creazione.
Rimane il fatto che alla fine del processo di compilazione ottieni
matrici che costituiscono una compressione lossy eseguibile del dataset.
> 2) Come la mettiamo con la generazione aumentata dal
> retrieval (RAG)? Supponi che un grande produttore abbia generato un
> foundation model con dataset acquisiti legalmente (bastano le
> briciole di quello che hanno in tasca) e lo abbia poi istruito col
> lavoro di dipendenti regolari. Quel modello, anche di dimensioni
> ridotte (es. 70B) sarebbe in grado di fare cose molto utili, ad
> esempio question answering, interpolando dati che non sono nel
> training set, ma in database esterni sui quali viene a run-time
> operata una ricerca.
Non vi vedo alcuna differenza con un altro software proprietario che si colleghi
ad un database esterno.
L'output di questo ipotetico LLM conterrebbe frammenti dei testi usati per programmarlo
combinati con pezzi dei dati presenti sul db.
Se chi ha realizzato LLM aveva comprato dagli autori il diritto di progrannare l'LLM a
partire dalle loro opere e chi usa l'LLM dispone dei diritti necessari ad accedere
al database, dal punto di vista del copyright non ci sono problemi.
Se poi parliamo di sicurezza informatica o della qualità degli output è tutta un'altra questione.
> Suggerisco di stare molto attenti alle false analogie, perché ci danno
> l'illusione di riportare l'ignoto al noto ma talvolta offuscano la comprensione delle cose.
Bravo!
Sono anni che lo dico!
False analogie con le reti neurali, l'intelligenza o l'apprendimento servono solo a buttare
fumo negli occhi a chi non comprende il funzionamento questi software.
Se non fosse tragico, sarebbe ridicolo.
È decisamente ora di ritornare con i piedi per terra.
Perché Guido, qui stiamo parlando di software.
Niente di più e niente di meno.
E il software si programma, non si "allena".
Giacomo
Sept. 8, 2024
Re: [nexa] AI Training is Copyright Infringement
by Giacomo Tesio
Caro Giancarlo,
Mi spiace averti stancato, per cui non ti tedierò con le ovvie differenze fra un LLM
(che è una compressione lossy eseguibile dei testi sorgente) e Google Books (che è una
semplice interfaccia web su _estratti_
di quei testi).
Tuttavia credo sia importante chiarire un aspetto che le tue considerazioni riportano alla mente
Il 8 Settembre 2024 18:13:43 UTC, GC F ha scritto:
> Il materiale non è usato per il suo valore espressivo,
se così fosse Microsoft & friends non starebbero pagando scrittori e giornalisti per
scrivere testi che nessuno leggerà mai!
Lo fanno proprio perché sanno benissimo che il loro software non contiene idee ma espressioni.
SOLO espressioni.
Se l'uso delle espressioni originali negli LLM fosse "trasformativo", la presenza di espressioni
prodotte in output da altri LLM nei dataset sorgente non sarebbe un problema.
Invece il problema del "model collapse" deriva proprio dal fatto che l'output di un LLM
non ha alcun "valore espressivo", contrariamente alle opere originali.
> quindi la creazione del software/modello non ha effetti sul
> valore di mercato dell'opera originale utilizzata - non la sostituisce.
Non stiamo parlando del valore di mercato di un'opera, ma del valore di mercato dei
diritti di sfruttamento ad essa connessi.
In particolare del valore di mercato del diritto a creare opere derivate (l'LLM).
Questo diritto può essere ceduto per un corrispettvo che chi programma LLM non
sta pagando.
Se lo pagasse, il valore di mercato di quel diritto di sfruttamento economico dell'opera
aumenterebbe notevolmente, perché le varie aziende che producono LLM
si contenderebbero il diritto di creare LLM derivati dalle opere migliori.
Lo vedi bene nell'articolo citato da Antonio in un altro thread, dove i diritti su articoli che
nessuno leggerà mai e che dunque non avrebbero alcun valore di mercato,
acquisiscono un valore comparabile a quello corrisposto da un giornale che li pubblica.
> Si potrebbe discutere se quegli effetti sostitutivi ci siano nel contesto
> della produzione degli output di quel modello, ma è altra questione
Vero, è un'altra questione: i modelli delle "AI generative" sono archivi compressi
(con perdita di informazioni).
Non sostituiscono una singola opera.
Sono surrogati di tutte le opere usate per programmarli e di ciascuna di esse.
Surrogati di qualità variabile, ma pur sempre surrogati.
Come una jpeg compressa di una serie di dipinti affiancati sarebbe un surrogato di
tutti i dipinti inclusi e di ciascuno.
I loro output però sono evidenti surrogati per le opere da cui derivano.
Se così non fosse, non ci sarebbero decine
di pubblicazioni scientifiche che li riportano,
citando articoli mai scritti che gli autori non hanno nemmeno provato ad acquistare
(con buona pace della favola delle peer review).
E ricorderai anche tu il caso dell'avvocato che presentò al giudice un documento pieno
di riferimenti giurisprudenziali inesistenti perché prodotto con un LLM.
Riferimenti giurisprudenziali a testi che lui non aveva nemmeno provato a comprare,
accontentandosi del surrogato fornito dal LLM.
D'altronde chi usa le "AI generative" per "generare" contenuti non può proprio acquistare
le opere originali da cui quei contenuti sono tratti, neənche volendo.
Non solo perché a volte si tratta di chat o mail private, testi inediti etc... ma perché
gli LLM non sono in grado di fornire i riferimenti corretti (anche quando ne forniscono
di esistenti) proprio per come funzionano.
> Il mio riferimento precedente alla τέχνη era un'allusione a un dibattito
> millenario. Non si può ridurre tutto alla τέχνη;
Perché, la Giurisprudenza non è essa stessa un'arte?
Giacomo
PS: non sentirti in alcun modo obbligato a rispondere se non ti va...
e se preferisci possiamo continuare in privato.
Sept. 8, 2024
Re: [nexa] AI Training is Copyright Infringement
by Maria Chiara Pievatolo
On 08/09/24 15:48, Giacomo Tesio wrote:
>
> L'eseguibile che i fautori delle "AI generative" chiamano impropriamente
> "modello" subisce una compressione concettualmente analoga attraverso
> il processo di compilazione dei dataset sorgenti.
Ti segnalo uno studio sulla possibilità di mantenere la pubblicità delle
licenze Share Alike/Copyleft, presente nel materiale usato come training
data,in "developing AI models, deploying AI systems, and using AI output":
https://openfuture.eu/wp-content/uploads/2024/06/Share-Alike-and-ML-Report-…
L'articolo è scritto da autori assai più simpatetici ai valori della
cultura libera di quelli che rispondono ai non disinteressati
committenti (https://urheber.info/about-us) dello studio elogiato da
Voss. Cito da pagina 15:
...this broad approach in the EU raises the question of whether
electronic changes to a computer file containing a work that result in
adaptation or conversion of the file to a desirable format could
similarly involve an act of reproduction, which would be different and
separate from the mere act of copying data. While CJEU jurisprudence
points in this direction, the Canadian Supreme Court has reached a
different conclusion for such acts. Hence, the issue has not been
settled yet. If the issue is brought before the CJEU, the Court may
refrain from extending the Canvas approach to file conversions for TDM
purposes.
Whether copyright-relevant acts of reproduction take place during stage
five is not as straightforward to ascertain. Although the applicable
copyright principles are easy to explain, the model exists as a separate
artefact: normally operating independently from its training pipeline.41
It does not seem to retrieve the contents of the training dataset when
generating outputs during the exploitation phase. Hence, it can be
argued that the artefact exists and operates independently from the
copyright-protected data that have been used as training resources in
the preceding steps one to four – data that could include ‘licensed
material’ triggering CLSA obligations. Following this line of argument,
***the artefact can be described as a giant collection of data points
and vectors that have been derived from the training material***. It can
also be assumed that the artefact is unlikely to contain
copyright-protected traces of works that were used for training.42 The
adoption of this perspective leads to the conclusion that the creation
of the trained model at stage five breaks the link with CLSA licensing
obligations that may rest on training resources. If the artefact as such
does not contain copyright-protected traces of CLSA works used for
training purposes, copyright law does not offer tools for enforcing CLSA
conditions: relevant acts of reproduction are sought in vain.
Si tratta di una dottrina diffusa (come mostrano i riferimenti in nota,
che meritano di essere letti). Se vai avanti nella lettura vedrai che
gli autori riconoscono eccezioni solo quando l'artefact (così chiamano
il modello) contiene in effetti frammenti letterali.
Collezionare non testi e immagine copiate, ma "data points and vectors
that have been derived from training materials" viola il diritto d'autore?
Certo, se uso l'analogia delle traduzioni e applico il diritto d'autore
di Kant (che nega alla traduzione il carattere di opera derivata), una
traduzione, anche a calco, è un'espressione diversa che va attribuito
interamente al traduttore, sebbene "derivi" da un'opera altrui. Quando
traduco, anche meccanicamente, un testo, magari scrivendo la mia
versione in una qualche forma compressa, violo il diritto d'autore -
almeno se applico in modo coerente, come secondo me non fa il copyright
vigente, la distinzione fra idea ed espressione?
Ho una risposta, ma ci devo pensare.
Per il momento preferisco un approccio pragmatico (e kantiano) che
riguarda solo gli atti di comunicazione al pubblico: uno studente che si
fa fare la tesi dai SALAMI viola il diritto d'autore (oltre che le
norme, dai regolamenti di ateneo in su, che gli richiederebbero di
produrre farina del suo sacco) se il testo che ha fatto proprio contiene
frammenti letterali non correttamente attribuiti? E se viene scoperto e
sanzionato, può denunciare per truffa chi ha gli offerto i SALAMI come
strumenti di lavoro creativo?
Buonanotte,
NCP
Sept. 8, 2024
Re: [nexa] AI Training is Copyright Infringement
by GC F
Si, ma l'uso del materiale per creare il software che poi genera a sua
volta è a fini trasformativi! Il materiale non è usato per il suo valore
espressivo, quindi la creazione del software/modello non ha effetti sul
valore di mercato dell'opera originale utilizzata - non la sostituisce. Si
potrebbe discutere se quegli effetti sostitutivi ci siano nel contesto
della produzione degli output di quel modello, ma è altra questione - e io
direi di no in base alla mia interpretazione di nozioni quali ad esempio
"effect of the use on the potential market for the work" nella clausola
fair use o nozioni come "conflicting with normal exploitation of the work"
e "prejudice legitimate interests" nel three-step-test di Berna. Questa è
la mia argomentazione. Ve ne sono altre plausibili. Legga *Google Books* e
quel che viene prima.
Lei è estenuante. Non è necessario rispondere a tutto, ripetutamente,
discutendo affermazioni che lei assume appartengano al suo interlocutore
senza che questo sia il caso, sviluppando argomentazioni che sono per la
maggior parte irrilevanti rispetto a quel che il suo interlocutore dice e
costantemente lasciar intendere che il suo interlocutore non comprende la
tecnologia che lei invece ben comprende, anche se poi quella comprensione
profonda è irrilevante ai fini della discussione.
Il mio riferimento precedente alla τέχνη era un'allusione a un dibattito
millenario. Non si può ridurre tutto alla τέχνη; bisognerebbe saper
astrarre...
Giancarlo
On Sun, Sep 8, 2024 at 6:05 PM Giacomo Tesio <giacomo(a)tesio.it> wrote:
> In realtà Giancarlo ho ben chiaro il dibattito in corso, gli interessi in
> gioco,
> le "strane alleanze" e i fiumi di soldi che stanno inquinando questo
> dibattito.
>
> E sono rassegnato al divorzio dalla realtà che tutto ciò comporta.
>
> Tuttavia, da informatico più interessato allo stato di diritto che ai
> soldi in questione
> non posso che descrivere i software cui il dibattito fa riferimento.
>
> Il 8 Settembre 2024 15:34:15 UTC, GC F ha scritto:
> > Quel che conta è che...
>
> Bene, finalmente concordiamo che ogni riferimento al data mining è
> infondato e fuorviante.
>
> > si utilizzino espressioni proteggibili per
> > creare/addestrare uno strumento
>
> Ecco quando su parla di "AI training" si parla del processo di
> programmazione statistica
> attraverso cui si ottiene un software.
>
> Questo software è un opera derivata dai dataset sorgenti (e da pochi altri
> dati decisi
> dai "data scientist").
>
> Ancor prima che questo software venga eseguito e produca output che
> riproduca in
> tutto o in parte un'opera usata per programmarlo, la sua realizzazione
> deve rispettare
> i diritti degli autori di tutte le opere che costituiscono il dataset
> sorgente.
>
> Questi autori possono aver ceduto il diritto di creare quel software come
> opera derivata
> dalle proprie opere (come fanno i giornalisti o i romanzieri che lavorano
> come "chatbot helper")
> e in tal caso siamo tutti contenti.
>
> Tuttavia, per creare un'opera derivata dalle loro (come il software in
> questione) tale
> cessione è necessaria nei termini del diritto d'autore.
>
> > Anche se il processo di training AI si basa su
> > riproduzioni meccaniche di opere nella loro interezza, questo non implica
> > di per sé la violazione del diritto d'autore, se tale riproduzione è
> votata
> > alla creazione di uno strumento che poi utilizzi quelle riproduzioni
> > meccaniche a fini trasformativi.
>
> Temo che questo passaggio evidenzi un malinteso di fondo: non stiamo
> discutendo della
> legittimità di creare un dataset contenente copie di testi coperti dal
> diritto d'autore, ne della
> loro copia in memoria durante il processo impropriamente chiamato
> "training".
>
> Stiamo parlando del processo di creazione di un'opera derivata (il
> "modello").
>
> > certe sue affermazioni sono forse "ingenue" [...] (eg "Anche se poi le
> aziende
> > forniscono accesso a quelle opere derivate "a pezzetti", le opere sono
> > state integralmente incluse nel processo di programmazione statistica (il
> > "training" della "AI")").
>
> Beh, più che ingenuo, direi che distinguere fra software e output del
> software è ovvio.
>
> Mi pare invece incredibile che li si possa confondere e mi chiedo come sia
> possibile
> nel 2024 una confusione tanto evidente.
>
> In questo però potrei essere "ingenuo", in effetti.
>
>
> > La questione dell'applicazione della "dicotomia
> > idea/espressione" al TDM è proprio relativa al fatto che per estrarre
> dati,
> > non proteggibili, si debbano effettuare copie meccaniche integrali
> > dell'espressione proteggibile in cui quei dati sono contenuti.
>
> Sennonché non stiamo parlando di dette copie, ma del software che ne viene
> compilato.
>
>
> Sia chiaro: se il processo di compilazione / compressione lossy cancella
> il diritto
> degli autori a me va benissimo!
>
> L'importante è che valga anche per i binari x86_64 di Microsoft, per gli
> mp4 ottenuti dai film Disney,
> etc...
>
>
>
> Giacomo
>
Sept. 8, 2024
Re: [nexa] dum Romae consulitur Saguntum expugnatur?
by Stefano Borroni Barale
Buonasera a tutte/i,
se devo dire la cosa che mi colpisce di più è la schizofrenia del ministro, che salta come un puntina di un mangiadischi portatile dalla tecnofobia delle sue regole auree per il digitale a scuola a questa 'sperimentazione' tecnoentusiasta improvvisata in 15 scuole. Va bene che dopo aver visto la "riforma della filiera" dei tecnici e professionali fatta in piena estate non dovrei più stupirmi di nulla.
Purtroppo per me non ci riesco: un piccolo colpo al cuore ad ogni ulteriore crollo verso l'abominio non riesco a evitarlo.
Nel frattempo il disco, a furia di saltare la puntina, s'è rigato.
Stefano
Inviato con l'email sicura [Proton Mail](https://proton.me/).
domenica 8 settembre 2024 15:32, maurizio lana <maurizio.lana(a)uniupo.it> ha scritto:
> "Valditara: sperimentazione AI a scuola. Sperimentazione partirà in 15 classi"
> https://www.rainews.it/articoli/ultimora/valditara-sperimentazione-ai-a-scu…
>
>> "Siamo uno dei primi Paesi ad avere avviato quest'anno scolastico una sperimentazione nell'utilizzo dell'intelligenza artificiale per la personalizzazione della didattica. Parte in 15 classi in alcune Regioni: Calabria, Lazio, Toscana, Lombardia". Lo ha detto il ministro dell'Istruzione e del Merito Giuseppe Valditara a Cernobbio.
>
> cioè: noi discutiamo, giustamente, ma lì la introducono. la introducono proprio in quel luogo che noi così fortemente vediamo deputato a costruire capacità critica e non adesione supina.
> quanto al come e su che cosa, Repubblica scrive:
>
>> L’IA per gli insegnanti
>>
>> In [una lettera](https://www.repubblica.it/commenti/2023/01/17/news/valditara_intelligenza_artificiale_scuola-383867327/)che il ministro inviò lo scorso anno a Repubblica Valditara ha spiegato il ruolo [dell’IA](https://www.repubblica.it/scuola/2023/01/20/news/chatbot_il_software_chi_ti_fa_i_compiti-384400644/) a scuola: “Può essere impiegata per aiutare gli insegnanti a personalizzare l'apprendimento, ad adattare i contenuti in base alle attitudini individuali degli studenti, a monitorare i loro progressi e a fornire informazioni su come migliorare il loro rendimento” si legge nella lettera. E sottolinea il ruolo del docente. “L'intelligenza artificiale non può dunque soppiantare l'insegnante né marginalizzarne il ruolo, che è decisivo in tutti i gradi di scuola, in particolare nella primaria”.
>>
>> L’IA per gli studenti
>>
>> Lato studenti, l’uso dell’IA, si legge sempre nella lettera, “può consentire agli studenti di ottenere un riscontro rapido e personalizzato sul lavoro svolto, in modo da aiutarli a concentrarsi sui loro punti di forza e a raggiungere i propri obiettivi educativi. Inoltre, gli studenti possono usare apparecchiature tecnologicamente avanzate, come i robot educativi, per aumentare l'interattività della loro esperienza scolastica”.
>
> Maurizio
>
> ---------------------------------------------------------------
>
> quella volta in due siamo rimasti appesi ad un friend. e ha tenuto.
> quella volta in due siamo rimasti appesi ad un amico. e ha tenuto.
> matteo della bordella
>
> ---------------------------------------------------------------
> Maurizio Lana
> Università del Piemonte Orientale
> Dipartimento di Studi Umanistici
> Piazza Roma 36 - 13100 Vercelli
Sept. 8, 2024
Re: [nexa] AI Training is Copyright Infringement
by Giacomo Tesio
In realtà Giancarlo ho ben chiaro il dibattito in corso, gli interessi in gioco,
le "strane alleanze" e i fiumi di soldi che stanno inquinando questo dibattito.
E sono rassegnato al divorzio dalla realtà che tutto ciò comporta.
Tuttavia, da informatico più interessato allo stato di diritto che ai soldi in questione
non posso che descrivere i software cui il dibattito fa riferimento.
Il 8 Settembre 2024 15:34:15 UTC, GC F ha scritto:
> Quel che conta è che...
Bene, finalmente concordiamo che ogni riferimento al data mining è infondato e fuorviante.
> si utilizzino espressioni proteggibili per
> creare/addestrare uno strumento
Ecco quando su parla di "AI training" si parla del processo di programmazione statistica
attraverso cui si ottiene un software.
Questo software è un opera derivata dai dataset sorgenti (e da pochi altri dati decisi
dai "data scientist").
Ancor prima che questo software venga eseguito e produca output che riproduca in
tutto o in parte un'opera usata per programmarlo, la sua realizzazione deve rispettare
i diritti degli autori di tutte le opere che costituiscono il dataset sorgente.
Questi autori possono aver ceduto il diritto di creare quel software come opera derivata
dalle proprie opere (come fanno i giornalisti o i romanzieri che lavorano come "chatbot helper")
e in tal caso siamo tutti contenti.
Tuttavia, per creare un'opera derivata dalle loro (come il software in questione) tale
cessione è necessaria nei termini del diritto d'autore.
> Anche se il processo di training AI si basa su
> riproduzioni meccaniche di opere nella loro interezza, questo non implica
> di per sé la violazione del diritto d'autore, se tale riproduzione è votata
> alla creazione di uno strumento che poi utilizzi quelle riproduzioni
> meccaniche a fini trasformativi.
Temo che questo passaggio evidenzi un malinteso di fondo: non stiamo discutendo della
legittimità di creare un dataset contenente copie di testi coperti dal diritto d'autore, ne della
loro copia in memoria durante il processo impropriamente chiamato "training".
Stiamo parlando del processo di creazione di un'opera derivata (il "modello").
> certe sue affermazioni sono forse "ingenue" [...] (eg "Anche se poi le aziende
> forniscono accesso a quelle opere derivate "a pezzetti", le opere sono
> state integralmente incluse nel processo di programmazione statistica (il
> "training" della "AI")").
Beh, più che ingenuo, direi che distinguere fra software e output del software è ovvio.
Mi pare invece incredibile che li si possa confondere e mi chiedo come sia possibile
nel 2024 una confusione tanto evidente.
In questo però potrei essere "ingenuo", in effetti.
> La questione dell'applicazione della "dicotomia
> idea/espressione" al TDM è proprio relativa al fatto che per estrarre dati,
> non proteggibili, si debbano effettuare copie meccaniche integrali
> dell'espressione proteggibile in cui quei dati sono contenuti.
Sennonché non stiamo parlando di dette copie, ma del software che ne viene compilato.
Sia chiaro: se il processo di compilazione / compressione lossy cancella il diritto
degli autori a me va benissimo!
L'importante è che valga anche per i binari x86_64 di Microsoft, per gli mp4 ottenuti dai film Disney,
etc...
Giacomo
Sept. 8, 2024