nexa
By thread
nexa@server-nexa.polito.it
By month
Messages by month
- ----- 2026 -----
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2025 -----
- December
- November
- October
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2024 -----
- December
- November
- October
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2023 -----
- December
- November
- October
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2022 -----
- December
- November
- October
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2021 -----
- December
- November
- October
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2020 -----
- December
- November
- October
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2019 -----
- December
- November
- October
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2018 -----
- December
- November
- October
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2017 -----
- December
- November
- October
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2016 -----
- December
- November
- October
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2015 -----
- December
- November
- October
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2014 -----
- December
- November
- October
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2013 -----
- December
- November
- October
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2012 -----
- December
- November
- October
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2011 -----
- December
- November
- October
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2010 -----
- December
- November
- October
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2009 -----
- December
- November
- October
- September
- August
- July
- June
- May
- 39 participants
- 30614 messages
Re: [nexa] AI Training is Copyright Infringement
by Giacomo Tesio
Salve Fabio,
On Mon, 9 Sep 2024 12:45:09 +0200 Fabio Alemagna wrote:
> Quando un essere umano studia da un libro [...]
>
> La domanda conseguente dunque è: un essere umano viola il copyright
> apprendendo dai testi da cui studia?
Anzitutto, un essere umano è soggetto di diritti, un software no.
Dunque, in un ragionamento giuridico, paragonarlo ad un software
è "not even wrong", oltre che alienante ed offensivo.
In qualunque caso GPT-4 non ha appreso nulla dai testi usati per la sua
programmazione. Questi testi includono migliaia di teoremi matematici,
di manuali scolastici di matematica etc... che GPT-4 può produrre
facilmente in output, ma che non comprende e non sa applicare:
```
We find that ChatGPT can be used most successfully [...] as a
mathematical search engine and knowledge base interface.
GPT-4 can additionally be used for undergraduate-level mathematics but
fails on graduate-level difficulty.
Contrary to many positive reports in the media about GPT-4 and
ChatGPT's exam-solving abilities (a potential case of selection bias),
their overall mathematical performance is well below the level of a
graduate student. Hence, if your goal is to use ChatGPT to pass a
graduate-level math exam, you would be better off copying from your
average peer!
```
https://arxiv.org/abs/2301.13867
Funziona un po' meglio come motore di ricerca perché è un archivio
compresso (anche) dei testi matematici compilati al suo interno, ma non
ha una mente che possa comprendere quei testi e dunque non è in grado
di applicare le informazioni che vi sono espresse.
> 1) Non solo gli umani apprendono, bensì tutti gli esseri viventi.
Cosa che un software non è.
> 2) Esistono definizioni di "apprendimento" [...]
Non ne dubito!
Ridefinire termini di uso comune è fondamentale per generare il genere
di profonda confusione che spinge qualcuno a credere di parlare con
"intelligenze artificiali".
> A tal proposito, questo è quel che ne pensa Creative Commons:
Indignor quandoque bonus dormitat Homerus!
Nunquam non miror: https://creativecommons.org/support-cc/
Giacomo
Sept. 9, 2024
Re: [nexa] AI Training is Copyright Infringement
by Giacomo Tesio
> La domanda era proprio cosa significa programmare con tecniche
> statistiche.
Significa utilizzare tecniche statistiche (raccolta dati,
regressioni lineari, medie, analisi delle frequenze, analisi dei
cluster, riduzioni della dimensionalità, etc...) per produrre
un software eseguibile da una specifica macchina.
La programmazione classica consiste nell'esprimere un algoritmo
in una forma eseguibile dalla macchina.
Un tempo si foravano le schede, oggi si esprime l'algoritmo in un
linguaggio sufficientemente rigoroso da poter essere tradotto
meccanicamente nella forma eseguibile dalla macchina.
La sostanza non cambia.
La programmazione statistica funziona diversamente.
Ad esempio, per programmare una Vector Reducing Machine (quella che
tu chiami "rete neurale artificiale") la cui topologia permette di
mappare una matrice N-dimensionale verso una M-dimensionale
- si raccoglie il dataset sorgente
- ne si codifica gli elementi come vettori numerici attraverso
una analisi statistica
- si riduce la dimensionalità del dataset sorgente (selezionando e/o
sintetizzando le feature da utilizzare attraverso tecniche
statistiche) fino ad ottenere le N dimensioni da utilizzare in input
(e le M dimensioni con cui confrontare l'output)
- si carica nella VRM un programma che può essere
- casuale quando si inizializzano le matrici per la prima volta
- noto, se si decide di partire da un eseguibile "pre-trained"
E' utile notare che a questo punto la VRM è già in grado di eseguire il
programma (quello che tu chiami impropriamente "modello"), mappando i
record N-dimensionali del dataset in record M-dimensionali.
Tipicamente però questi record output sono inutili o poco utili per cui
inizia una fase di compilazione del dataset: si utilizzano
iterativamente le righe del dataset per alterare i valori nelle matrici
riducendo pian piano l'errore statistico fra il risultato M dimensionale
ottenuto dando in input alla VRM ogni record e quello desiderato,
attraverso un processo di ottimizzazione statistica chiamato
backpropagation.
Alla fine del processo la VRM mappa i vettori N dimensionali di ingresso
nei vettori M dimensionali di interesse entro un errore accettato.
A quel punto si salva l'eseguibile codificato dalle matrici della VRM
così da poterlo successivamente rieseguire con qualsiasi VRM che
implementi la stessa topologia.
Le matrici che tu chiami "modello" codificano un'eseguibile che tutte
(e solo) le VRM con quella determinata topologia possono eseguire e
nessuno può interpretare.
Tale eseguibile è una codifica compressa con perdita di informazione del
dataset sorgente che è stato compilato per produrlo, esattamente come i
l'eseguibile di un kernel è una codifica compressa con perdita di
informazione dei testi sorgente che sono stati compilati per produrlo.
> I parametri del modello (i contrnuti delle matrici), vengono
> calcolati attraverso l’ottimizzazione della loss function sui
> dati di apprendimento (sempre dati sono).
La distinzione fra software e dato non ha fondamento informatico.
Ogni dato è software eseguibile da almeno una macchina programmabile.
Puoi infatti facilmente costruire una macchina programmabile che avanza
il proprio program counter se riceve in input il byte corrente del
proprio programma e si ferma altrimenti.
Caricando su questa macchina i byte di un qualsiasi eseguibile x86,
questa inizierà ad eseguirlo e fintanto che gli fornirai in input
esattamente quegli stessi byte, in ordine, uno alla volta, mentre si
fermerà altrimenti.
Ma se gli carichi i byte di una foto, sostituendo il suo programma,
e poi provi a passargli in input i byte dell'eseguibile x86 usato in
precedenza, quella si fermerà, perché è cambiato il suo programma.
Se invece gli passi in input i byte della foto, in ordine e uno alla
volta, lei continuerà a lavorare come da programma.
Caricagli sopra un film o un testo, e farà la stessa cosa con i
rispettivi byte.
La foto, il film e il testo diventano infatti software eseguibili
per questa ipotetica macchina.
E non credo di doverti dimostrare che per qualsiasi dato esistono
infinite macchine programmabili in grado di eseguire tale dato.
Dunque, dimostrato che ogni dato è codifica un eseguibile per infinite
macchine virtuali, non dovrebbe sorprenderti che quella che tu chiami
"rete neurale artificiale" altro non sia che una macchina in grado di
eseguire determinati programmi, codificati sotto forma di matrici
numeriche di dimensionalità compatibile.
> La rete neurale implementa il modello direttamente, non in due fasi.
Il problema è che ciò che tu chiami "rete neurale artificiale" in
realtà è la composizione di due software che vengono implementati e
distribuiti separatamente.
Il primo software, la macchina virtuale in grado di eseguire qualsiasi
insieme di matrici che rispettino le dimensionalità previste dalla
topologia scelta, viene programmata esplicitamente, in un linguaggio di
programmazione come C, Python, R etc... ed eseguita da un hardware noto
(che a sua volta può essere virtuale, come la JVM, o virtualizzato come
avviene con QEMU, per intenderci).
Il secondo software, è codificato dalle matrici programmate
statisticamente con il processo che ho grossolanamente descritto
sopra e viene eseguito dal primo software (la macchina virtuale).
Il fatto che siano software diversi, oltre che ovvio, è evidente dal
fatto che possono essere versionati e distribuiti separatamente nonché
sviluppati da gruppi distinti ed indipendenti.
Le Vector Reducing Machines sono macchine programmabili estremamente
flessibili, in grado di mappare approssimativamente spazi vettoriali
qualsiasi indipendentemente dal loro significato, dall'esistenza di
una relazione reale etc...
Ma il discorso vale per qualsiasi software programmato statisticamente,
come ha già mostrato Antonio in questo thread con llama.cpp
https://server-nexa.polito.it/pipermail/nexa/2024-September/053196.html
Finché continueremo a con-fonderli (conflating) saremo costretti a
descrizioni fantasiose e antropomorfe come "intelligenza artificiale"
e crederemo che "apprendano" (subendo una inquietante alienazione),
mentre le stiamo semplicemente programmando tramite tanti esempi.
> Certo, intendevo chi li allena non usa tecniche statistiche perché
> non fa assunzioni statistiche sulla struttura dei dati da cui poter
> estrarre un campione rappresentativo: utilizza tutti i dati
> disponibili indistintamente. [...]
>
> Non proprio, non viene fatta una scelta basata su criteri statistici.
Questo non è vero in generale per le Vector Reducing Machines (già la
semplice scelta delle dimensioni rilevanti esprime assunzioni
statistiche) ed è veramente ingenuo crederlo per le AI generative
commerciali.
Prendi banalmente GitHub CopyALot: pensi davvero che misure statistiche
come il conteggio delle issue o il conteggio dei fork non abbiano avuto
rilevanza del processo di programmazione statistica?
Che il kernel di Linux abbia lo stesso peso del codice C scritto
da migliaia di studenti alle prime armi?
> Per i LARGE LM si usano quanti più dati possibile, al massimo si fa
> una deduplicazione.
Che è una analisi statistica, così come lo è l'analisi utilizzata per
determinare i token da usare nel vocabolario, etc...
> Infatti una calcolatrice non impara: non saprebbe fare altre
> operazioni oltre a quelle per cui è stata programmata.
Neanche una Vector Reducing Machine sa fare altre operazioni oltre alla
mappatura fra spazi vettoriali codificata nelle matrici risultanti dal
processo di programmazione statistica.
Nelle intenzioni di chi la programma, quella mappatura dovrebbe
approssima una funzione esistente fra dominio e codominio.
Ma il fatto che riesca a fornirci un output a fronte di input non
presenti nel dataset sorgente, non significa che abbia "imparato"
a fare altre operazioni: semplicemente esegue meccanicamente
l'eseguibile che gli viene caricato su qualsiasi input,
indipendentemente dal suo significato.
Infatti, se gli carichi un eseguibile costituito da matrici casuali,
continuerà comunque a produrre un output.
> > Se dicessi in una conferenza che la frutta "apprende" come
> > comportarsi da marmellata, tutti riderebbero fragorosamente. :-D
>
> Quale sarebbe l’analogia umana di un tale forma di apprendimento?
Ero ironico.
Se possiamo dire che una VRM impara mentre la programmi, allora
possiamo dire anche che la frutta impara mentre la mescoli.
Le due affermazioni hanno la stessa validità scientifica.
Giacomo
Sept. 9, 2024
Re: [nexa] AI Training is Copyright Infringement
by Guido Vetere
>
> uno studente che si
> fa fare la tesi dai SALAMI viola il diritto d'autore (oltre che le
> norme, dai regolamenti di ateneo in su, che gli richiederebbero di
> produrre farina del suo sacco) se il testo che ha fatto proprio contiene
> frammenti letterali non correttamente attribuiti? E se viene scoperto e
> sanzionato, può denunciare per truffa chi ha gli offerto i SALAMI come
strumenti di lavoro creativo?
per le ragioni che si sono qui illustrate, è ben difficile che un salame
rigurgiti (oddio che immagine) un frammento verbatim così lungo da violare
il copyright.
dunque se lo si vuole denunciare per violazione del copyright lo si deve
fare 'a prescindere' come direbbe Totò.
è quello che ha fatto NYT con OpenAI, will see, ma vogliamo scommettere su
come andrà a finire?
quanto allo studente, è altresì difficile che si riesca a dimostrare che la
sua tesi è una salamata, a meno che non sia così stupido da lasciare
intatto il testo generato
ma tutti hanno imparato a copiare le versioni al liceo, no? almeno quello ..
verosimilmente, lo studente userà il salame, volta per volta, su specifici
argomenti della sua tesi
sintesi, sinossi, indicazioni bibliografiche, ecc
se è uno studente scrupoloso, andrà a verificare, confronterà i risultati
con la bibliografia del corso, farà altre ricerche, ci metterà del suo, ecc.
si potrà comunque valutare la qualità del lavoro, e in seduta, se ci sono
magagne concettuali, verranno fuori
non so tu, ma io in genere riesco a capire chi ha fatto un buon lavoro di
ricerca, salame o non salame
cheers,
G.
On Sun, 8 Sept 2024 at 22:59, Maria Chiara Pievatolo <
mariachiara.pievatolo(a)unipi.it> wrote:
> On 08/09/24 15:48, Giacomo Tesio wrote:
>
> >
> > L'eseguibile che i fautori delle "AI generative" chiamano impropriamente
> > "modello" subisce una compressione concettualmente analoga attraverso
> > il processo di compilazione dei dataset sorgenti.
>
> Ti segnalo uno studio sulla possibilità di mantenere la pubblicità delle
> licenze Share Alike/Copyleft, presente nel materiale usato come training
> data,in "developing AI models, deploying AI systems, and using AI output":
>
>
> https://openfuture.eu/wp-content/uploads/2024/06/Share-Alike-and-ML-Report-…
>
>
> L'articolo è scritto da autori assai più simpatetici ai valori della
> cultura libera di quelli che rispondono ai non disinteressati
> committenti (https://urheber.info/about-us) dello studio elogiato da
> Voss. Cito da pagina 15:
>
> ...this broad approach in the EU raises the question of whether
> electronic changes to a computer file containing a work that result in
> adaptation or conversion of the file to a desirable format could
> similarly involve an act of reproduction, which would be different and
> separate from the mere act of copying data. While CJEU jurisprudence
> points in this direction, the Canadian Supreme Court has reached a
> different conclusion for such acts. Hence, the issue has not been
> settled yet. If the issue is brought before the CJEU, the Court may
> refrain from extending the Canvas approach to file conversions for TDM
> purposes.
>
> Whether copyright-relevant acts of reproduction take place during stage
> five is not as straightforward to ascertain. Although the applicable
> copyright principles are easy to explain, the model exists as a separate
> artefact: normally operating independently from its training pipeline.41
> It does not seem to retrieve the contents of the training dataset when
> generating outputs during the exploitation phase. Hence, it can be
> argued that the artefact exists and operates independently from the
> copyright-protected data that have been used as training resources in
> the preceding steps one to four – data that could include ‘licensed
> material’ triggering CLSA obligations. Following this line of argument,
> ***the artefact can be described as a giant collection of data points
> and vectors that have been derived from the training material***. It can
> also be assumed that the artefact is unlikely to contain
> copyright-protected traces of works that were used for training.42 The
> adoption of this perspective leads to the conclusion that the creation
> of the trained model at stage five breaks the link with CLSA licensing
> obligations that may rest on training resources. If the artefact as such
> does not contain copyright-protected traces of CLSA works used for
> training purposes, copyright law does not offer tools for enforcing CLSA
> conditions: relevant acts of reproduction are sought in vain.
>
> Si tratta di una dottrina diffusa (come mostrano i riferimenti in nota,
> che meritano di essere letti). Se vai avanti nella lettura vedrai che
> gli autori riconoscono eccezioni solo quando l'artefact (così chiamano
> il modello) contiene in effetti frammenti letterali.
>
> Collezionare non testi e immagine copiate, ma "data points and vectors
> that have been derived from training materials" viola il diritto d'autore?
>
> Certo, se uso l'analogia delle traduzioni e applico il diritto d'autore
> di Kant (che nega alla traduzione il carattere di opera derivata), una
> traduzione, anche a calco, è un'espressione diversa che va attribuito
> interamente al traduttore, sebbene "derivi" da un'opera altrui. Quando
> traduco, anche meccanicamente, un testo, magari scrivendo la mia
> versione in una qualche forma compressa, violo il diritto d'autore -
> almeno se applico in modo coerente, come secondo me non fa il copyright
> vigente, la distinzione fra idea ed espressione?
>
> Ho una risposta, ma ci devo pensare.
>
> Per il momento preferisco un approccio pragmatico (e kantiano) che
> riguarda solo gli atti di comunicazione al pubblico: uno studente che si
> fa fare la tesi dai SALAMI viola il diritto d'autore (oltre che le
> norme, dai regolamenti di ateneo in su, che gli richiederebbero di
> produrre farina del suo sacco) se il testo che ha fatto proprio contiene
> frammenti letterali non correttamente attribuiti? E se viene scoperto e
> sanzionato, può denunciare per truffa chi ha gli offerto i SALAMI come
> strumenti di lavoro creativo?
>
> Buonanotte,
> NCP
>
>
>
Sept. 9, 2024
Re: [nexa] AI Training is Copyright Infringement
by Giuseppe Attardi
Dissento.
> On 9 Sep 2024, at 11:10, nexa-request(a)server-nexa.polito.it wrote:
>
> From: Giacomo Tesio <giacomo(a)tesio.it>
> ..l
>
>> On Mon, 9 Sep 2024 09:50:41 +0200 Giuseppe Attardi wrote:
>>
>> Che significa “software programmato statisticamente”?
>
> Un software (ovvero una sequenza di byte eseguibili da una macchina con
> una architettura nota in fase di compilazione) programmato attraverso
> tecniche statistiche, ovvero basate sull'elaborazione di grandi
> quantitativi di dati selezionati allo scopo.
>
>
>> Una rete neurale è realizzata con programmi come altri utilizzando
>> algoritmi di ottimizzazione, con un processo di fit dei parametri del
>> modello rispetto ai dati per minimizzare una funzione di loss.
>
> Esatto, ottimo esempio.
>
> Con il termine "rete neurale artificiale" si con-fondono due software
> diversi programmati con tecniche diverse:
>
> - la macchina virtuale caratterizzata dall'architettura di interesse
> (la topologia della rete), tipicamente scritta in R, Python, C etc...
> - il software che quella macchina virtuale esegue, espresso come
> matrici numeriche, programmato appunto attraverso tecniche
> statistiche e compilato per quella specifica macchina virtuale
>
La domanda era proprio cosa significa programmare con tecniche statistiche. Posso capire implementare formule statistiche, ma il codice è pur sempre scritto in un linguaggio di programmazione.
Quanto ai due software, proprio non li vedo, c’è solo un software ed è la rete neurale, scritta in un linguaggio di programmaziine a scelta che gira, direttamente o compilato, su una macchina, virtuale o reale.
Le matrici sono dati, non software, e non vengono eseguite. Il programma di ottimizzazione (backpropagation) li modifica, ma non sono loro ad eseguire calcoli.
> Si tratta di software distinti, anche quando usati insieme.
>
> Il primo software (la macchina virtuale) viene eseguito dall'hardware
> (che può essere a sua volta virtuale, ovviamente), mentre il secondo
> (il cosiddetto "modello" della "rete neurale artificiale") viene
> eseguito dal primo.
>
La rete neurale implementa il modello direttamente, non in due fasi.
> I sorgenti del primo vengono scritti.
> I sorgenti del secondo vengono selezionati.
>
I sorgenti del secondo non esistono. I parametri del modello (i contrnuti delle matrici), vengono calcolati attraverso l’ottimizzazione della loss function sui dati di apprendimento (sempre dati sono).
> Cambiano le tecniche di programmazione e compilazione, ma rimangono
> sorgenti di software compilati per essere eseguiti dalle rispettive
> architetture di interesse.
>
>
>> Un modello statistico sarebbe quello costruito a partire da un
>> campione statistico rappresentativo, selezionato appunto su basi
>> statistiche.
>
> Infatti!
>
> Proprio il software programmato statisticamente a partire dai dataset
> sorgente non è un modello statistico, è sbagliato chiamarlo "modello".
>
> Altrimenti finisce che i giuristi lo confondono con il data mining.
>
>
>> Ciò non vale per i LLM che usano tutti i dati disponibili,
>> considerandoli la realtà stessa e non la loro rappresentazione.
>
> Gli LLM non hanno alcuna consapevolezza dell'esistenza della realtà.
> Dunque non possono "considerare" i dati come la realtà.
Certo, intendevo chi li allena non usa tecniche statistiche perché non fa assunzioni statistiche sulla struttura dei dati da cui poter estrarre un campione rappresentativo: utilizza tutti i dati disponibili indistintamente.
>
> Gli LLM sono programmati compilando i dati SCELTI da chi li programma.
> La scelta dei contenuti da includere nel dataset è l'aspetto
> predominante del processo di programmazione statistica.
>
Non proprio, non viene fatta una scelta basata su criteri statistici. Per i LARGE LM si usano quanti più dati possibile, al massimo si fa una deduplicazione.
>
>> Quanto a “imparare”, è discutibile usare termini antropomorfi
>> riguardo alle macchine, ma per intenderci si può dire che fanno
>> qualcosa che si avvicina al nostro concetto di apprendere, ossia
>> saper usare quanto visto in precedenza in situazioni nuove.
>
> No.
>
> La calcolatrice non conosce l'aritmetica, anche se riesce a produrre in
> output una configurazione di cristalli liquidi che la tua mente può
> interpretare come somme che non le sono mai state sottoposte in passato.
>
> Una calcolatrice non sa cosa sia un numero più di quanto
> un LLM non sappia cosa sia un testo.
Infatti una calcolatrice non impara: non saprebbe fare altre operazioni oltre a quelle per cui è stata programmata.
>
> Chi l'ha programmata non le ha insegnato l'aritmetica e lei non l'ha
> appresa, per nessuna definizione ragionevole di "apprendimento".
> Chi l'ha programmata ha codificato la _propria_ conoscenza della
> aritmetica in una serie di circuiti che ne _riproducono_ le regole
> sulle rappresentazioni elettriche fornite in input.
>
>
> Allo stesso modo, non c'è alcuna relazione fra il processo di
> programmazione statistica di una macchina in grado di ridurre
> vettori e l'apprendimento di un essere umano.
A parte il fatto che ancora non ho capito cosa sia la “programmazione statistica”, una relazione si trova sempre.
>
> Entrambi i processi sono iterativi e producono un cambiamento nel ente
> che li subisce, non hanno null'altro in comune.
>
>
> Se dicessi in una conferenza che la frutta "apprende" come comportarsi
> da marmellata, tutti riderebbero fragorosamente. :-D
>
Quale sarebbe l’analogia umana di un tale forma di apprendimento?
>
> Dire che un software "apprende" come comportarsi è altrettanto
> ridicolo, ma hubris, ignoranza e soldi convincono troppe persone
> a non ridere quando sentono parlare di "machine learning".
>
> Così rimangono solo bambini e buffoni a ricordare che il re è nudo...
> e i software si programmano.
Sept. 9, 2024
Re: [nexa] dum Romae consulitur Saguntum expugnatur?
by Enrico Nardelli
A questo proposito segnalo quanto sotto.
Ciao, Enrico
https://hechingerreport.org/kids-chatgpt-worse-on-tests/
Researchers at the University of Pennsylvania found that Turkish high
school students who had access to ChatGPT while doing practice math
problems did worse on a math test compared with students who didn’t have
access to ChatGPT. Those with ChatGPT solved 48 percent more of the
practice problems correctly, but they ultimately scored 17 percent worse
on a test of the topic that the students were learning.
Il 08/09/2024 19:12, Stefano Borroni Barale ha scritto:
> Buonasera a tutte/i,
> se devo dire la cosa che mi colpisce di più è la schizofrenia del
> ministro, che salta come un puntina di un mangiadischi portatile dalla
> tecnofobia delle sue regole auree per il digitale a scuola a questa
> 'sperimentazione' tecnoentusiasta improvvisata in 15 scuole. Va bene
> che dopo aver visto la "riforma della filiera" dei tecnici e
> professionali fatta in piena estate non dovrei più stupirmi di nulla.
> Purtroppo per me non ci riesco: un piccolo colpo al cuore ad ogni
> ulteriore crollo verso l'abominio non riesco a evitarlo.
> Nel frattempo il disco, a furia di saltare la puntina, s'è rigato.
> Stefano
>
> Inviato con l'email sicura Proton Mail <https://proton.me/>.
>
> domenica 8 settembre 2024 15:32, maurizio lana
> <maurizio.lana(a)uniupo.it> ha scritto:
>> "Valditara: sperimentazione AI a scuola. Sperimentazione partirà in
>> 15 classi"
>> https://www.rainews.it/articoli/ultimora/valditara-sperimentazione-ai-a-scu…
>>> "Siamo uno dei primi Paesi ad avere avviato quest'anno scolastico
>>> una sperimentazione nell'utilizzo dell'intelligenza artificiale per
>>> la personalizzazione della didattica. Parte in 15 classi in alcune
>>> Regioni: Calabria, Lazio, Toscana, Lombardia". Lo ha detto il
>>> ministro dell'Istruzione e del Merito Giuseppe Valditara a Cernobbio.
>> cioè: noi discutiamo, giustamente, ma lì la introducono. la
>> introducono proprio in quel luogo che noi così fortemente vediamo
>> deputato a costruire capacità critica e non adesione supina.
>> quanto al come e su che cosa, Repubblica scrive:
>>>
>>>
>>> L’IA per gli insegnanti
>>>
>>> In una lettera
>>> <https://www.repubblica.it/commenti/2023/01/17/news/valditara_intelligenza_a…>che
>>> il ministro inviò lo scorso anno a /Repubblica/ Valditara ha
>>> spiegato il ruolo dell’IA
>>> <https://www.repubblica.it/scuola/2023/01/20/news/chatbot_il_software_chi_ti…>
>>> a scuola: “Può essere impiegata per aiutare gli insegnanti a
>>> personalizzare l'apprendimento, ad adattare i contenuti in base alle
>>> attitudini individuali degli studenti, a monitorare i loro progressi
>>> e a fornire informazioni su come migliorare il loro rendimento” si
>>> legge nella lettera. E sottolinea il ruolo del docente.
>>> “L'intelligenza artificiale non può dunque soppiantare l'insegnante
>>> né marginalizzarne il ruolo, che è decisivo in tutti i gradi di
>>> scuola, in particolare nella primaria”.
>>>
>>>
>>> L’IA per gli studenti
>>>
>>> Lato studenti, l’uso dell’IA, si legge sempre nella lettera, “può
>>> consentire agli studenti di ottenere un riscontro rapido e
>>> personalizzato sul lavoro svolto, in modo da aiutarli a concentrarsi
>>> sui loro punti di forza e a raggiungere i propri obiettivi
>>> educativi. Inoltre, gli studenti possono usare apparecchiature
>>> tecnologicamente avanzate, come i robot educativi, per aumentare
>>> l'interattività della loro esperienza scolastica”.
>>>
>> Maurizio
>>
>> ------------------------------------------------------------------------
>> quella volta in due siamo rimasti appesi ad un friend. e ha tenuto.
>> quella volta in due siamo rimasti appesi ad un amico. e ha tenuto.
>> matteo della bordella
>> ------------------------------------------------------------------------
>> Maurizio Lana
>> Università del Piemonte Orientale
>> Dipartimento di Studi Umanistici
>> Piazza Roma 36 - 13100 Vercelli
>
--
-- EN
https://www.hoepli.it/libro/la-rivoluzione-informatica/9788896069516.html
======================================================
Prof. Enrico Nardelli
Past President di "Informatics Europe"
Direttore del Laboratorio Nazionale "Informatica e Scuola" del CINI
Dipartimento di Matematica - Università di Roma "Tor Vergata"
Via della Ricerca Scientifica snc - 00133 Roma
home page: https://www.mat.uniroma2.it/~nardelli
blog: https://link-and-think.blogspot.it/
tel: +39 06 7259.4204 fax: +39 06 7259.4699
mobile: +39 335 590.2331 e-mail: nardelli(a)mat.uniroma2.it
online meeting: https://blue.meet.garr.it/b/enr-y7f-t0q-ont
======================================================
--
Sept. 9, 2024
Re: [nexa] AI Training is Copyright Infringement
by Giacomo Tesio
Caro Stefano,
On Mon, 9 Sep 2024 11:33:44 +0200 Stefano Maffulli wrote:
> A me personalmente piacerebbe capire *perché*, prima di pensare a
> *se*, un LLM dovrebbe essere un'opera derivata dal dataset di
> addestramento.
La realtà può non piacerci, ma rimane pur sempre reale.
Un LLM è un'opera derivata dai dataset utilizzati durante la sua
programmazione.
Una volta compreso questo (piuttosto ovvio) concetto, possiamo
ragionare se le normative vigenti vadano modificate a vantaggio
delle grandi aziende che vogliono sfruttare gratuitamente tali
opere per produrre software opachi che ne riproducono gli interessi
ovunque vengono eseguiti, o meno.
> Ovvero, avendo come obiettivo la diffusione della
> conoscenza, è collettivamente positivo per la società pensare che
> opere di creatività debbano essere coperte da diritti esclusivi nuovi
> (o estensione di quelli vecchi --diritto d'autore, marchi, ecc)
> prima di poter essere trasformate in token e passati in pasto
> all'addestramento automatico?
Non sono certo di comprendere cosa tu intenda con questa frase.
Esimere dal rispetto della Legge chi usa proxy software per violare
i diritti altrui è deleterio sia per le vittime che per la società.
D'altro canto, nessuno vuole impedire, ad esempio, la creazione di
software come GitHub CopyALot: l'importante è che tali software e i
software che includono i loro output rispettino i diritti degli autori
che hanno contribuito alla loro creazione e le licenze che li veicolano.
Ad esempio, Microsoft potrebbe riprogrammare un servizio come GitHub
Copilot utilizzando esclusivamente i sorgenti di cui detiene il
copyright (e quelli in pubblico dominio). In questo modo nessuno
(eccetto Microsoft) avrebbe diritto di lamentarsi per l'inclusione
di tali sorgenti in altri software, proprietari o meno.
Microsoft invece vuole violare liberamente il copyright altrui,
ma si guarda bene dall'automatizzare la violazione del proprio!
Cui prodest?
(questa volta rispondere è proprio facile... ;-)
In qualunque caso non serve né estendere ne comprimere il diritto
d'autore, basta applicarlo come viene applicato a qualsiasi altro
software compilato a partire da testi.
Giacomo
Sept. 9, 2024
Re: [nexa] AI Training is Copyright Infringement
by Fabio Alemagna
Quando un essere umano studia da un libro, più libri, apprende non solo il
senso dei contenuti, e non solo è in grado di fare connessioni tra ciò che
ha appreso dai singoli libri, ma il più delle volte può anche recitare
interi passaggi di quei libri, sia essendone consapevole - quando voglia
effettuare una citazione - sia a volte in modo involontario, semplicemente
perché è ciò che gli viene naturale fare nel ricordare ciò che ha appreso.
Dal punto di vista semantico, non vi è alcuna differenza sostanziale con
ciò che fa un LLM, e onestamente trovo che non ci sia alcuna
antropomorfizzazione nell'usare termini come "apprendere" per riferirsi ad
un algoritmo, per due ordini di motivi:
1) Non solo gli umani apprendono, bensì tutti gli esseri viventi.
2) Esistono definizioni di "apprendimento" che sono basate puramente sui
concetti derivati dalla teoria dell'informazione (o, equivalentemente,
dalla termodinamica statistica) e non richiedono affatto che ad apprendere
sia un essere vivente, men che meno senziente, men che meno umano.
La domanda conseguente dunque è: un essere umano viola il copyright
apprendendo dai testi da cui studia?
La risposta è "no", ergo non vi è ragione alcuna di sostenere che
qualunque altro soggetto che effettui un apprendimento stia violando il
copyright, a meno di non voler espandere il concetto di copyright fino a
coprire ambiti che fino ad ora gli erano preclusi.
A tal proposito, questo è quel che ne pensa Creative Commons:
«this method of using image-text combinations to train the AI model has an
inherently transformative purpose from the original images and should
support a finding of fair use. While these images were originally created
for their aesthetic value, their purpose for the AI model is only as data.
For the AI, these image-text pairs are only representations of how text and
images relate. What the images are does not matter for the model — they are
only data to teach the model about statistical relationships between
elements of the images and not pieces of art.»
«This is similar to how Google used digital copies of print books to create
Google Books, a practice that was challenged in Author’s Guild v. Google
(Google Books). In this case, the Second Circuit Court of Appeals found
that Google’s act of digitizing and storing copies of thousands of print
books to create a text searchable database was fair use. The court wrote
that Google’s purpose was different from the purpose of the original
authors because Google was not using the books for their content. Indeed,
the content did not really matter to Google; rather the books were like
pieces of data that were necessary to build Google’s book database.»
« it is also similar to how search engine operator Arriba Soft used copies
of images in its search engine, which was litigated in Kelly v. Arriba
Soft. In this case, a photographer, Leslie Kelly, sued the operator of a
search engine, Arriba Soft, for copying and displaying copies of her
photographs as thumbnails to users. The court, however, disagreed that this
constituted copyright infringement. Instead, the court held that this use
served a different and transformative purpose from the original purpose
because Arriba Soft only copied Kelly’s photographs to enable its search
engine to function and not because of their aesthetic value.»
https://creativecommons.org/2023/02/17/fair-use-training-generative-ai/
Fabio
Sept. 9, 2024
Re: [nexa] AI Training is Copyright Infringement
by Giacomo Tesio
Salve Stefano,
On Mon, 9 Sep 2024 10:56:06 +0200 Stefano Zacchiroli wrote:
> La recitation è assolutamente *possibile* [...]
> La frequenza dipende da proprietà statistiche del training dataset
> [...]
> Quello che invece regolarmente fanno attori come GitHub con Copilot è
> di aggiungere a valle della generazione con gli LLM dei filtri basati
> su tecniche di code clone detection e anti-plagio [...]
> Microsoft si sente abbastanza sicura di tutto questo da offrire
> garanzie legali in termini di violazione del diritto d'autore quando
> si usa la suite Copilot. (Non a caso lo fa *solo* se l'utente non ha
> disabilitato il filtering a valle di cui parlavo sopra.)
>
> [...]
>
> Tutto questo non ci aiuta nel dibattito sul decidere se un LLM sia o
> meno un opera derivata dei suoi training input.
Non mi è chiaro il passaggio logico.
Sappiamo tutti che gli output degli LLM includono stralci delle opere
utilizzati per programmarli.
Sappiamo tutti che la frequenza di questi stralci dipende dalle
proprietà statistiche del dataset costituito da tali opere.
Sappiamo addirittura che Microsoft & friends post-processano gli output
degli LLM per escludere tali testi con tecniche anti plagio.
Come altro potremmo interpretare questi fatti se non riconoscendo che
il LLM è un opera derivata (un eseguibili prodotto attraverso un
processo di compressione con perdita) dei testi utilizzati per
programmarlo?
Perché adottare filtri anti-plagio se le opere non fossero codificate
(pur in formato compresso con perdita) nelle matrici che costituiscono
l'LLM e di conseguenza nell'output che questi producono?
Direi al contrario che i fatti elencati *dimostrino* come le
"AI generative" siano opere derivate delle opere utilizzate
per programmarle.
La necessità di filtri anti-plagio dimostra gli innumerevoli plagi
avvenuti a monte, durante la realizzazione del "modello".
O forse intendi che tutto questo non ci aiuta nel dibattito perché
risponde alla questione al di la di ogni ragionevole dubbio?
O ancora che non aiuta chi vuole che il dibattito continui per evitare
(o rimandare) gli obblighi connessi alle licenze copyleft?
O ancora che non aiuta chi vuole che il dibattito continui per evitare
di rispettare la normativa vigente pagando agli autori delle opere il
diritto di creare opere derivate?
Giacomo
Sept. 9, 2024
Re: [nexa] AI Training is Copyright Infringement
by Stefano Maffulli
On Mon, Sep 9, 2024 at 11:15 AM Stefano Zacchiroli <zack(a)upsilon.cc> wrote:
> Tutto questo non ci aiuta nel dibattito sul decidere se un LLM sia o
> meno un opera derivata dei suoi training input.
A me personalmente piacerebbe capire *perché*, prima di pensare a *se*, un
LLM dovrebbe essere un'opera derivata dal dataset di addestramento. Ovvero,
avendo come obiettivo la diffusione della conoscenza, è collettivamente
positivo per la società pensare che opere di creatività debbano essere
coperte da diritti esclusivi nuovi (o estensione di quelli vecchi --diritto
d'autore, marchi, ecc) prima di poter essere trasformate in token e passati
in pasto all'addestramento automatico?
Sept. 9, 2024