nexa
By thread
nexa@server-nexa.polito.it
By month
Messages by month
- ----- 2026 -----
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2025 -----
- December
- November
- October
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2024 -----
- December
- November
- October
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2023 -----
- December
- November
- October
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2022 -----
- December
- November
- October
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2021 -----
- December
- November
- October
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2020 -----
- December
- November
- October
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2019 -----
- December
- November
- October
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2018 -----
- December
- November
- October
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2017 -----
- December
- November
- October
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2016 -----
- December
- November
- October
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2015 -----
- December
- November
- October
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2014 -----
- December
- November
- October
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2013 -----
- December
- November
- October
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2012 -----
- December
- November
- October
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2011 -----
- December
- November
- October
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2010 -----
- December
- November
- October
- September
- August
- July
- June
- May
- April
- March
- February
- January
- ----- 2009 -----
- December
- November
- October
- September
- August
- July
- June
- May
October 2023
- 51 participants
- 263 messages
Re: [nexa] IA, lavoro, immaginari
by 380°
Buongiorno Guido,
Guido Vetere <vetere.guido(a)gmail.com> writes:
[...]
> Ad esempio: sono convinto (su basi empiriche) che un Llama2 70B, ben
> fine-tunato (perdonatemi!), sia già adatto a tante cose come summarization,
> ner, topic analysis, ecc, (NB: compiti analitici, non 'stricto sensu'
> generativi)
Sì è ampiamente ragionevole aspettarsi che quando sarà passato il terzo
"AI Winter" le applicazioni che rimarranno da tutto questo ribollire
saranno _verticalizzate_ per i compiti che citi (diciamo piuttosto:
computer aided summarization, ecc.); tra l'altro non è detto che non si
riesa a trovare trumenti semplici e minimalisti /separati/ per ciascun
compito, usando corpora testuali specifici.
> i quali potrebbero essere utilissimi per gestire meglio i sistemi
> informativi ad es. della PA.
Uh, ci sono così tante cose che potrebbero essere utilissime mer gestire
meglio i sistemi informativi della PA, che /empiricamente/ direi che
possiamo anche iniziare _ieri_ senza aspettare che siano disponibili
quegli strumenti... che a regime potrebbero pure rivelarsi inutili.
Ho già accennato altre volte a cosa potrebbe essere il corpora
legislativo, dal livello Costituzione fino alle ordinanze dei sindaci,
se le informazioni fossero descritte in una forma sintattica comoda di
RDF, immagazzinate in uno store adeguato e interrogate via
SPARQL... ovviamente un "summarizer" o on "topic analist" automatici
farebbero comodo ma il contesto sarebbe un'altro mondo.
Per non parlare di cosa si potrebbe fare se i codici fossero davvero
trattati come... programmi (SORGENTI) B-)
> Per mettere in esercizio e adattare un modello del genere 4M bastano e
> avanzano, senza neanche scomodare Leonardo e Cineca. Si potrà fare? Cioè:
> gli executive di MS, Google e Meta che finanziano le fondazioni dei
> politici che nominano i vertici della PA saranno d'accordo?
Mumble...
[...]
saluti, 380°
--
380° (Giovanni Biscuolo public alter ego)
«Noi, incompetenti come siamo,
non abbiamo alcun titolo per suggerire alcunché»
Disinformation flourishes because many people care deeply about injustice
but very few check the facts. Ask me about <https://stallmansupport.org>.
Oct. 16, 2023
Re: [nexa] IA, lavoro, immaginari
by Giuseppe Attardi
> On 16 Oct 2023, at 10:09, Guido Vetere <vetere.guido(a)gmail.com> wrote:
>
>
> A parte la questione delle 'emergent abilities' che è alquanto controversa e a me fa venire la pelle d'oca (cosa potrebbe emergere? come facciamo a saperlo?) credo che la (vera) 'democratizzazione' (so to say) dei LLM sia un processo già in atto, e che per trarne benefici non serva tanto denaro, ma tanta volontà politica.
>
> Ad esempio: sono convinto (su basi empiriche) che un Llama2 70B, ben fine-tunato (perdonatemi!), sia già adatto a tante cose come summarization, ner, topic analysis, ecc, (NB: compiti analitici, non 'stricto sensu' generativi), i quali potrebbero essere utilissimi per gestire meglio i sistemi informativi ad es. della PA.
Per fare queste cose semplici, bastano i word embeddings (vedi l’articolo di Collobert che ho citato).
È per fare tutto il resto che servono i LLM (dove Large sta, per definizione, oltre i 10^10 parametri).
>
> Per mettere in esercizio e adattare un modello del genere 4M bastano e avanzano, senza neanche scomodare Leonardo e Cineca. Si potrà fare? Cioè: gli executive di MS, Google e Meta che finanziano le fondazioni dei politici che nominano i vertici della PA saranno d'accordo?
>
Per fare il fine tuning di Llama 2 70B, servono almeno 4 GPU Nvidia, solo per caricare il modello in memoria: poi si può usare LoRA per le modifiche.
Occorrono 4 giorni di elaborazione.
E un server con 4 GPU Nvidia costa intorno ai 40.000 €.
Del resto, delle due l’una: o i LLM sono insufficienti e criticati per i loro limiti, o persino quelli più piccoli sono meravigliosi.
— Beppe
> Scusate lo sfogo aggressivo-passivo :-)
>
> G.
>
>
>
>
>
>
>
> On Mon, 16 Oct 2023 at 05:00, Giuseppe Attardi <attardi(a)di.unipi.it <mailto:attardi@di.unipi.it>> wrote:
>>
>>
>>> On 15 Oct 2023, at 12:00, nexa-request(a)server-nexa.polito.it <mailto:nexa-request@server-nexa.polito.it> wrote:
>>>
>>> Tutto questo per dirvi cosa?
>>> Che alla fine, per un informatico, il "chissà che altro" che rimanda a qualcosa di "magico", di segreto industriale, ecc. è inammissibile. E' vero, ad oggi è così, ma, come giustamente ha scritto Guido Vetere "fare un LLM di qualche decina di miliardi di parametri magari solo per l'italiano è alla portata perfino del più sgangherato dei carrozzoni pubblici italiani”.
>>
>> Ben venga lo sviluppo di LLM alternativi.
>> Secondo me ciascuno dovrebbe avere il suo personale, calibrato sui suoi interessi e le conoscenze sui suoi campi di interesse: un po’ come ci sono tanti giornali che rappresentano diversi punti di vista.
>>
>> C’è persino un progetto finanziato dalla CE che intende fare centinaia di LLM:
>> https://hplt-project.org/
>>
>> Peccato che il finanziamento totale sia di 4 milioni €, con cui ci si fa poco.
>> Mistral.AI, una startup francese, ha ottenuto 100 milioni di investimento e utilizza Leonardo di Cineca per sviluppare LLM:
>> https://mistral.ai/news/announcing-mistral-7b/
>>
>> Che sono sempre pochi rispetto a quanto spendono OpenAI, Google e Meta in risorse di calcolo.
>>
>> Perché la questione di fondo, è quella delle “emergent abilities” che i LLM cominciano ad esibire quando superano una certa dimensione:
>> https://www.jasonwei.net/blog/emergence
>> Ossia un modello diventa in grado di svolgere compiti per i quali non era stato allenato, come nei sistemi complessi.
>>
>> — Beppe
>>
>>
>> _______________________________________________
>> nexa mailing list
>> nexa(a)server-nexa.polito.it <mailto:nexa@server-nexa.polito.it>
>> https://server-nexa.polito.it/cgi-bin/mailman/listinfo/nexa
Oct. 16, 2023
108° Nexa Lunch Seminar | 25 ottobre 2023, ore 13.00
by Valeria Bergantino
Gentilissime, gentilissimi,
Vi invitiamo a partecipare al *108° Nexa Lunch Seminar *che si terrà
*mercoledì 25 ottobre*, dalle ore 13.00 alle ore 14.00,
con un incontro dal titolo: /*"Analisi e report di trasferimenti di dati
personali verso domini extra-EEA"*/.
Ospite dell'incontro: *Lorenzo Laudadio* (Politecnico di Torino).
_L'incontro si terrà IN PRESENZA e ONLINE._
_SEDE FISICA_ dell'incontro: Centro Nexa su Internet e Società,
Politecnico di Torino, Via Boggio 65/a, Torino (1° piano).
Per accedere alla sala si raccomanda di suonare al citofono *Portineria*
e di seguire le indicazioni segnalate dai cartelli lungo il percorso.
QUI <https://nexa.polito.it/contatti> maggiori informazioni su come
raggiungerci.
_STANZA VIRTUALE _dell'incontro:
https://didattica.polito.it/VClass/NexaEvent
Di seguito maggiori dettagli:
Se non visualizzi correttamente questo messaggio clicca qui
<https://nexa.polito.it/lunch-107>
NEXA
108° Nexa Lunch Seminar
Mercoledì 25 ottobre 2023, ore 13.00 - 14.00
https://nexa.polito.it/lunch-108
Analisi e report di trasferimenti di dati personali verso domini
extra-EEA
Speaker:
*LORENZO LAUDADIO* (Politecnico di Torino)
*L'INCONTRO SI TERRÀ IN PRESENZA E ONLINE*
*SEDE FISICA*: Centro Nexa su Internet e Società, Politecnico di Torino,
Via Boggio 65/a, Torino (1° piano) Suonare al citofono *Portineria* -
Seguire le indicazioni segnalate dai cartelli apposti lungo il percorso
(Per maggiori informazioni su come raggiungerci clicca QUI
<https://nexa.polito.it/contatti>)
*STANZA VIRTUALE*: https://didattica.polito.it/VClass/NexaEvent
A tre anni dalla sentenza della Corte di Giustizia dell'Unione Europea
che aveva invalidato la decisione di adeguatezza sul Privacy Shield (la
cosiddetta sentenza "Schrems II"), e alla luce della nuova decisione di
adeguatezza sul Data Privacy Framework, *la situazione legale a
proposito dei trasferimenti di dati personali verso paesi al di fuori
dell'Unione Europea resta oggetto di dibattito*.
In un mondo sempre più connesso e digitale, *i dati personali dei
cittadini meritano la giusta attenzione*. A garantire questa attenzione
dovrebbero esserci le norme del *GDPR*, le quali vengono però spesso
dimenticate o ignorate.
Questo incontro mira a presentare un nuovo strumento software in grado
di rilevare i trasferimenti di dati personali verso domini di Paesi
extra-EU ed extra-EEA, e i risultati di un'analisi di massa effettuata
sui trasferimenti di dati personali da parte della pubblica
amministrazione italiana verso tali Paesi, con un approfondimento sullo
scenario legale attuale.
BIOGRAFIA - e informazioni supplementari:
[Lunch108]
*Lorenzo LAUDADIO* è uno studente del corso di laurea magistrale in
Ingegneria Informatica, con indirizzo Cybersecurity, presso il
Politecnico di Torino. Durante il suo lavoro di tesi, dal titolo
"Development of a tool for the automated analysis and reporting of
personal data transfers to non-EEA domains" ha avuto modo di realizzare
un'analisi di massa sui trasferimenti di dati dai siti web della
pubblica amministrazione italiana a domini di Paesi terzi, studiando nel
dettaglio le regole del GDPR che stanno alla base dei trasferimenti di
dati personali.
*Letture consigliate e link utili:*
* Schrems, M. (10 luglio 2023). /European Commission gives EU-US data
transfers third round at CJEU"/, noyb | LINK
<https://noyb.eu/en/european-commission-gives-eu-us-data-transfers-third-rou…>
* European Commission. /Adequacy Decisions - How the EU determines if
a non-EU country has an adequate level of data protection/ | LINK
<https://commission.europa.eu/law/law-topic/data-protection/international-di…>
* Monella, P. (2021). /Education and GAFAM: from awareness to
responsibility/. Umanistica Digitale, 5(11), 27–45 | LINK
<http://doi.org/10.6092/issn.2532-8816/13685>
* Guamán, D.S., Rodriguez, D., Del Alamo, J.M. and Such, J. (2023).
/Automated GDPR compliance assessment for cross-border personal data
transfers in Android applications/. Computers & Security, volume 130
| LINK <https://doi.org/10.1016/j.cose.2023.103262>
Che cosa sono il Centro Nexa e i cicli di incontri “Mercoledì di Nexa” e
“Nexa Lunch Seminar”
<https://www.facebook.com/nexa.center/> <https://twitter.com/nexacenter>
<https://www.youtube.com/user/NexaCenter>
<https://www.instagram.com/nexa_center/>
<https://www.linkedin.com/company/3054864/admin/>
#nexalunchseminar
<https://twitter.com/search?q=%23nexalunchseminar&src=typd> #PoliTO
<https://twitter.com/PoliTOnews>
Il Centro Nexa su Internet & Società del Politecnico di Torino
(Dipartimento di Automatica e Informatica), fondato nel 2006, è un
centro di ricerca interdisciplinare che, in collaborazione con
l’Università di Torino (in particolare il Dipartimento di
Giurisprudenza), studia le tecnologie digitali e il loro rapporto con la
società. Maggiori informazioni all'indirizzo: http://nexa.polito.it/about.
Durante i “Mercoledì di Nexa”, che si tengono *ogni 2° mercoledì del
mese alle ore 17 in punto*, il Centro Nexa su Internet e Società apre le
sue porte non solo agli esperti e a tutti coloro i quali lavorano con
Internet, ma anche a semplici appassionati e cittadini. Il ciclo di
incontri intende approfondire, con un linguaggio preciso ma accessibile,
i temi legati alla Rete: “intelligenza artificiale”, reti sociali,
software libero, capitalismo della sorveglianza, neutralità della rete,
libertà di espressione, privacy, condivisione di file, "big data" e
"open data", “smart cities”, e molto altro.
Al centro della maggior parte degli incontri un ospite pronto a
dialogare con i direttori del Centro Nexa, il Prof. Juan Carlos De
Martin del Politecnico di Torino, i Proff. Marco Ricolfi e Maurizio
Borghi dell'Università di Torino, lo staff, i Fellows del Centro Nexa e
tutti i presenti.
Maggiori informazioni sui Mercoledì di Nexa, incluso un elenco di tutti
i “Mercoledì” passati, sono disponibili all'indirizzo:
http://nexa.polito.it/mercoledi. Le registrazioni degli incontri sono
disponibili qui: https://nexa.polito.it/audio-video.
Si segnala inoltre che dal maggio 2012 *ogni 4° mercoledì* del mese
*dalle ore 13 alle ore 14* il Centro Nexa organizza anche i "*Nexa Lunch
Seminar*". Una lista di tutti i “Lunch Seminar” passati è disponibile
all'indirizzo: http://nexa.polito.it/lunch-seminars.
See our events calendar <http://nexa.polito.it/events> if you're curious
about future luncheons, discussions, lectures, and conferences not
listed in this email. Our events are free and open to the public, unless
otherwise noted.
Responsabile Comunicazione Centro Nexa su Internet & Società: *Valeria
Bergantino*, tel: +39 011 090 7219, valeria.bergantino(a)polito.it
<mailto:anita.botta@polito.it>.
Maggiori informazioni sui Mercoledì di Nexa e i Nexa Lunch Seminar, sono
disponibili all'indirizzo: http://nexa.polito.it/events. Weekly Events
Newsletter. Sign up <http://nexa.polito.it/mailing-lists> to receive
this newsletter if this email was forwarded to you. To manage your
subscription preferences, please click here
<https://server-nexa.polito.it/cgi-bin/mailman/listinfo/nexa>.
Connect & get involved: Jobs, internships, and more
<http://nexa.polito.it/get-involved>.
Cordiali saluti,
--
Valeria Bergantino
Communication Officer
Nexa Center for Internet & Society
Politecnico di Torino - DAUIN
Via Pier Carlo Boggio, 65/A - 10138 Torino
web: https://nexa.polito.it/ <https://nexa.polito.it/>
mail: valeria.bergantino(a)polito.it <mailto:valeria.bergantino@polito.it>
tel: 3473443585
Oct. 16, 2023
Re: [nexa] IA, lavoro, immaginari
by Guido Vetere
A parte la questione delle 'emergent abilities' che è alquanto controversa
e a me fa venire la pelle d'oca (cosa potrebbe emergere? come facciamo a
saperlo?) credo che la (vera) 'democratizzazione' (so to say) dei LLM sia
un processo già in atto, e che per trarne benefici non serva tanto denaro,
ma tanta volontà politica.
Ad esempio: sono convinto (su basi empiriche) che un Llama2 70B, ben
fine-tunato (perdonatemi!), sia già adatto a tante cose come summarization,
ner, topic analysis, ecc, (NB: compiti analitici, non 'stricto sensu'
generativi), i quali potrebbero essere utilissimi per gestire meglio i
sistemi informativi ad es. della PA.
Per mettere in esercizio e adattare un modello del genere 4M bastano e
avanzano, senza neanche scomodare Leonardo e Cineca. Si potrà fare? Cioè:
gli executive di MS, Google e Meta che finanziano le fondazioni dei
politici che nominano i vertici della PA saranno d'accordo?
Scusate lo sfogo aggressivo-passivo :-)
G.
On Mon, 16 Oct 2023 at 05:00, Giuseppe Attardi <attardi(a)di.unipi.it> wrote:
>
>
> On 15 Oct 2023, at 12:00, nexa-request(a)server-nexa.polito.it wrote:
>
> Tutto questo per dirvi cosa?
> Che alla fine, per un informatico, il "chissà che altro" che rimanda a
> qualcosa di "magico", di segreto industriale, ecc. è inammissibile. E'
> vero, ad oggi è così, ma, come giustamente ha scritto Guido Vetere "fare un
> LLM di qualche decina di miliardi di parametri magari solo per l'italiano è
> alla portata perfino del più sgangherato dei carrozzoni pubblici italiani”.
>
>
> Ben venga lo sviluppo di LLM alternativi.
> Secondo me ciascuno dovrebbe avere il suo personale, calibrato sui suoi
> interessi e le conoscenze sui suoi campi di interesse: un po’ come ci sono
> tanti giornali che rappresentano diversi punti di vista.
>
> C’è persino un progetto finanziato dalla CE che intende fare centinaia di
> LLM:
> https://hplt-project.org/
>
> Peccato che il finanziamento totale sia di 4 milioni €, con cui ci si fa
> poco.
> Mistral.AI, una startup francese, ha ottenuto 100 milioni di investimento
> e utilizza Leonardo di Cineca per sviluppare LLM:
> https://mistral.ai/news/announcing-mistral-7b/
>
> Che sono sempre pochi rispetto a quanto spendono OpenAI, Google e Meta in
> risorse di calcolo.
>
> Perché la questione di fondo, è quella delle “emergent abilities” che i
> LLM cominciano ad esibire quando superano una certa dimensione:
> https://www.jasonwei.net/blog/emergence
> Ossia un modello diventa in grado di svolgere compiti per i quali non era
> stato allenato, come nei sistemi complessi.
>
> — Beppe
>
>
> _______________________________________________
> nexa mailing list
> nexa(a)server-nexa.polito.it
> https://server-nexa.polito.it/cgi-bin/mailman/listinfo/nexa
>
Oct. 16, 2023
Re: [nexa] IA, lavoro, immaginari
by 380°
Buongiorno,
più leggo, più divento cyber-luddista [1] :-D
Giuseppe Attardi <attardi(a)di.unipi.it> writes:
> Bell’esempio che illustra perché l’Explainable AI non funziona, almeno
> non come vorrebbero i suoi sostenitori.
e invece FUNZIONICCHIA discretamente bene l'Unexplainable AI, tranne
quando non funziona, a volte drammaticamente male.
Quindi, quando l'output dell'Unexplainable AI viene "eseguito"
direttamente, senza /giudizio/, le conseguenze a volte sono
drammatiche.
> La spiegazione che viene fornita è una ricostruzione razionale della
> risposta, che è simile a quanto fanno gli esperti umani quando devono
> spiegare le loro risposte.
Che è l'unico modo per dimostrare _perché_ viene fornita quella
risposta, che a sua volta è l'unico modo per correggere progressivamente
gli errori nelle "ricostruzioni razionali" impiegate; si chiama scienza,
no? (E sì, anche la grammatica evolve, lentamente ma inesorabilmente.)
Da qualche secolo ormai più che "cosa" è importante "perché", si chiama
"discorso sul metodo".
[...]
> Poi, se pressato a spiegare il perché, cercherebbe nelle sue
> reminiscenze di grammatica della scuola media per una giustificazione.
No: qui stiamo parlando di un esperto umano in grammatica, non di
qualsiasi altro esperto che ha solo reminescenze della grammatica delle
scuole medie.
> Anche se chiedi a un medico di giustificare la sua diagnosi,
Ah, OK: quindi adesso non parliamo più di grammatica, cioè di "sintassi"
e _al massimo_ analisi logica di una frase.
> ci mette molte più parole e tempo di quanto ci ha messo per produrla,
> perché non è in quel modo che l’ha ottenuta.
Se un medico ha intenzione di agire sulla salute delle persone senza
dover produrre una giustificazione razionale delle proprie diagnosi e
soprattutto di giustificare anche le proprie prognosi, allora abbiamo un
serio problema /sistemico/.
In particolare, qualsiasi medico venisse a dirmi che la diagnosi è
quella perché glielo dice il suo sistema AI ma che tale diagnosi è
/ingiustificabile/ perché è così e non si può spiagere, lo inviterei
senza troppi complimenti quel medico a stare a guardare l'ospedale, da
fuori.
La stessa cosa vale per qualsiasi altra questione sia necessario
/giustificare/ (iustus facĕre) nei confronti delle persone.
Io e una quantità innumerevole di esseri umani ora et in sæcula
sæculorum non accetteremo MAI di essere "gestiti" attraverso automatismi
ingiustificabili. Punto.
> Il Deep Learning opera a livello di System 1, secondo la terminologia
> di Daniel Kahneman, ossia di conoscenza “compilata" per una fruizione
> diretta.
Innanzi tutto NON è "conoscenza" ma "reificazione", catturata (sampled),
filtata e compressa attraverso procedimenti assai spannometrici e molto
"lossy".
In secondo luogo, è da "Reflections on Trusting Trust" che tutti gli
informatici sanno che
«You can't trust code that you did not totally create yourself.»
Questo vale per _tutti_ i software binari (compilati): è per questo che
serve il sorgente, e il sorgente del compilatore, e il sorgente di tutte
le librerie, e un environment non inquinato...
Last but NON least: "fruizione diretta" un corno, sono le persone le
responsabili dell'applicazione dell'output dei c.d. sistemi IA
In altre parole: che gli umani stacchino il cervello per attaccare i
propri organi a una "IA" è /ingiustificabile/.
«La resistenza NON è futile» :-)
[...]
Saluti, 380°
[1] la vulgata vuole che i luddisti siano contro le macchine in
generale, propugnatori una specie di ritorno alla natura selvaggia a
incontaminata: balle! «They protested against manufacturers who used
machines in "a fraudulent and deceitful manner" to replace the skilled
labour of workers and drive down wages by producing inferior goods»
https://en.wikipedia.org/wiki/Luddite
--
380° (Giovanni Biscuolo public alter ego)
«Noi, incompetenti come siamo,
non abbiamo alcun titolo per suggerire alcunché»
Disinformation flourishes because many people care deeply about injustice
but very few check the facts. Ask me about <https://stallmansupport.org>.
Oct. 16, 2023
4M€: pochi? Tanti? dettagli, please.... [Was: <IA, lavoro, immaginar>]
by Damiano Verzulli
Il 16/10/23 04:59, Giuseppe Attardi ha scritto:
> [...]
> Peccato che il finanziamento totale sia di 4 milioni €, con cui ci si
> fa poco.
> [...]
4 milioni di €, *PUBBLICI*, sono una quantita' *ENORME* di denaro.
Mi sanguina il cuore ad osservare la "leggerezza" con la quale tale
somma di denaro viene sminuita.
Perché sono pochi? Cosa cambierebbe, rispetto al progetto HPLT, se
fossero di piu'? Ma, soprattutto, cosa "torna indietro", precisamente,
HPLT, a fronte di quei 4M€.... soprattutto in considerazione del fatto
che mi aspetto che i 4M€ sia una percentuale alta di quello che loro
stessi hanno chiesto?
Detto in altri termini: non solo i 4M€ a HPLT sono tantissimi... ma io,
terzo, voglio pure capire BENISSIMO cosa ci hanno fatto / stanno
facendo... (il sito [1], fortunatamente, aiuta)
Non sono domande "cattive"...
Se volessi essere cattivo, ed utilizzassi il suo stesso approccio quando
altri entrano pesantemente nella sua sfera di competenza.... avrei
potuto risponderle con: "Sono pochi? Allora ne aggiunga lei, altri!". Ma
qui, siamo tra adulti teste-pensanti e quindi... non lo faccio.
Per meglio esplicitare il mio punto di vista sul tema "denaro pubblico"
(e "rendicontazione"), aggiungo alcune considerazioni:
* quando Grillo --in epoca ante-parlamentare-- sbandierava alla stampa
che il "bilancio" del suo movimento era "pubblico", io rimasi
esterrefatto dal constatare che quello che lui chiamava "bilancio"
stava in mezza pagina A4, con interlinea neanche troppo stretta. Si
trattava di un movimento che, dietro, aveva 8 milioni di elettori....
Pensavo a quella mezza pagina A4 e, di fianco, avevo il PDF della
mia societa' (una micro-SRL da 10k€ di capitale sociale) che era,
nella forma "sintetica", un foglio di calcolo che stava su 3 x A4 e,
nella sua forma piu' "verbose" (la relazione annessa) di oltre 10
pagine A4;
* nel 2023, un "avviso di accertamento" che un Comune da 8K abitanti
manda ad una sua cittadina per chiedere l'IMU non pagata... è un
documento da 7 pagine A4 con, dentro, una quantita' di testo e di
numeri che è impossibile da gestire da parte di un
ultra-settantacinquenne (mia madre), e non solo. Il totale è
dell'ordine dei 1000 €;
* nel 2015, per supportare un'azienda terza a partecipare ad una gara
ICT della locale ASL (del valore di ~400k€), dovetti processare un
disciplinare (amministrativo) da 23 pagine A4 + un capitolato
(tecnico) da 18 pagina A4. La nostra "offerta" richiese un
preliminare foglio di calcolo piuttosto complesso e, soprattutto,
un "progetto" e un "allegato", rispettivamente da 38 e 32 pagine A4.
Il tutto, ripeto... per ~400K€ "pubblici" (per inciso: la gara... la
perdemmo);
* nel 2004 contribuii a TOSSAD (Towards Open Source Software
Administration and Dissemination), un progetto finanziato dalla UE
nell'ambito del 6° programma quadro per ~750K€. La DoW (Description
of Work) era un documento da 87 pagine A4 (io contribuii al solo WP3).
...e potrei continuare.
Tutto questo per dire che, quando lei parla di 4 milioni (pubblici) come
se fossero i soldi del "monopoli"... la cosa è decisamente antipatica.
Sono *TANTI* ed il loro utilizzo va *ARGOMENTATO*.
Io, dall'alto della mia ignoranza, non ho la presunzione di evidenziare
che 4M€ siano pochi o molti per il progetto HPLT. E accetto anche il
fatto che, per lei e per altri possano essere "pochi". Quello che,
pero', mi aspetto (da ambienti come questo, che non sono e non possono
essere assimilati ad un thread su Twitter), che la cosa venga
minimamente argomentata.
Senza tale argomentazione, la frase andrebbe significativamente
riformulata. Senza tale riformulazione, rischiamo di alimentare.... il
rumore di fondo.
Saluti,
DV
[1] https://hplt-project.org/about
P.S.:
> [...mistral.ai...] Che sono sempre pochi rispetto a quanto spendono
> OpenAI, Google e Meta in risorse di calcolo.
> [...]
Su questo, evito di commentare... perché non mi pare che "mistral.ai"
sia concorrente di Alphabet e Meta (e Microsoft) e quindi confrontarli
non ha alcun senso. Sull'eventuale confronto con OpenAI, sono (io)
ignorante.
--
Damiano Verzulli
e-mail:damiano@verzulli.it
---
possible?ok:while(!possible){open_mindedness++}
---
"...I realized that free software would not generate the kind of
income that was needed. Maybe in USA or Europe, you may be able
to get a well paying job as a free software developer, but not
here [in Africa]..." -- Guido Sohne - 1973-2008
http://ole.kenic.or.ke/pipermail/skunkworks/2008-April/005989.html
Oct. 16, 2023
Re: [nexa] IA, lavoro, immaginari
by Giacomo Tesio
Buon giorno Giuseppe,
Il 16 Ottobre 2023 02:59:49 UTC, Giuseppe Attardi ha scritto:
>
> Perché la questione di fondo, è quella delle “emergent abilities” che i LLM cominciano ad esibire quando superano una certa dimensione:
> https://www.jasonwei.net/blog/emergence
> Ossia un modello diventa in grado di svolgere compiti per i quali non era stato allenato,
> come nei sistemi complessi.
Anche questo va dimostrato, riproducendo esattamente il processo di programmazione
statistica (quello che tu antropomorfizzi come "allenamento") fino ad ottenere esattamente
lo stesso software ("modello" nella tua parlata).
A quel punto sapremo se si tratta davvero di abilità emergenti o di semplice ricostruzione lossy
di testi usati per la programmazione stessa.
Per parlare di "emergent abilities" in un software senza disporre di perfetta riproducibilità
della sua programmazione è necessario abbandonare ogni rigore scientifico
e ogni senso critico.
Non a caso quando Microsoft ha iniziato a propagandare la nascita del AGI in GPT4 [1]
ha dovuto fare dichiaratamente cherry-picking di output "ottimizzati" e non riproducibili.
Ma senza perfetta riproducibilità, per ragioni di costo o perché dettagli fondamentali
non vengono pubblicati, le "emergent abilities" non passano il rasoio di Occam
Giacomo
[1] https://arxiv.org/abs/2303.12712
Oct. 16, 2023
Re: [nexa] IA, lavoro, immaginari
by Giuseppe Attardi
> On 15 Oct 2023, at 22:02, Daniela Tafani <daniela.tafani(a)unipi.it> wrote:
>
> Buonasera, 380°
>
> Il 15/10/2023 20:21, 380° ha scritto:
>>
>> Allora ripeto la mia domanda: ci sono nuovi studi che dimostrino che le
>> limitazioni evidenziate nei test sulla competenza logico/linguistica di
>> BERT siano stati risolti da altri LLM?
>>
>
> Tra le pubblicazioni recenti, sul tema, segnalo
>
> Vittoria Dentella, Elliot Murphy, Gary Marcus, Evelina Leivada, Testing AI performance on less frequent aspects of language reveals insensitivity to underlying meaning, 2023
> https://arxiv.org/abs/2302.12313
>
> Abstract
> Advances in computational methods and big data availability have recently translated into breakthroughs in AI applications. With successes in bottom-up challenges partially overshadowing shortcomings, the 'human-like' performance of Large Language Models has raised the question of how linguistic performance is achieved by algorithms. Given systematic shortcomings in generalization across many AI systems, in this work we ask whether linguistic performance is indeed guided by language knowledge in Large Language Models. To this end, we prompt GPT-3 with a grammaticality judgement task and comprehension questions on less frequent constructions that are thus unlikely to form part of Large Language Models' training data. These included grammatical 'illusions', semantic anomalies, complex nested hierarchies and self-embeddings. GPT-3 failed for every prompt but one, often offering answers that show a critical lack of understanding even of high-frequency words used in these less frequent grammatical constructions. The present work sheds light on the boundaries of the alleged AI human-like linguistic competence and argues that, far from human-like, the next-word prediction abilities of LLMs may face issues of robustness, when pushed beyond training data.
>
Attenzione, si stanno confondendo le capacità dei LLM con quelle delle loro applicazioni.
Nel caso citato le prove sono effettuate con text-davinci-02, che è un chatbot basato su GPT-3, non GPT-3 direttamente.
I chatbot sono stati ottenuti facendo fine-tuning su task di question answering e poi con RLHF per svolgere conversazioni.
Se si segue questa strada, allora si dovrebbe fare il fine-tuning di un modello su un task di reasoning, prima di concludere che non sa fare reasoning.
Ad esempio con il Chain-of-Thought prompting, si possono evidenziare capacità di ragionamento matematico.
Se invece ci vogliamo limitare alle capacità linguistiche dei modelli, questo è un altro studio:
Mahowald, K., Ivanova, A. A., Blank, I. A., Kanwisher, N., Tenenbaum, J. B., & Fedorenko, E. (2023, January 23). Dissociating language and thought in large language models: a cognitive perspective. ArXiv: https://arxiv.org/abs/2301.06627
— Beppe
> Ho intravisto anche (ma non l'ho letto)
>
> Konstantine Arkoudas, GPT-4 Can’t Reason, 2023, https://arxiv.org/abs/2308.03762
>
> Buona serata,
> Daniela
Oct. 16, 2023
Re: [nexa] IA, lavoro, immaginari
by Giuseppe Attardi
> On 13 Oct 2023, at 18:13, nexa-request(a)server-nexa.polito.it wrote:
>
> From: Giacomo Tesio <giacomo(a)tesio.it <mailto:giacomo@tesio.it>>
> To: Giuseppe Attardi <attardi(a)di.unipi.it <mailto:attardi@di.unipi.it>>
> Cc: nexa(a)server-nexa.polito.it <mailto:nexa@server-nexa.polito.it>
> Subject: Re: [nexa] IA, lavoro, immaginari
> Message-ID: <17CF1CA0-AA25-438E-9BAC-323D44ABB64A(a)tesio.it <mailto:17CF1CA0-AA25-438E-9BAC-323D44ABB64A@tesio.it>>
> Content-Type: text/plain; charset=UTF-8
>
> Ciao Giuseppe,
>
> Il 12 Ottobre 2023 20:18:23 UTC, Giuseppe Attardi ha scritto:
>> I word embedding sono molto diversi dai co-occurrence counts, simili
>> a quelle dei tuoi esempi.
>
> Si trattava ovviamente di una semplificazione ad uso di chi non conosce
> (o non comprende) la programmazione statistica.
>
Ah, beh.
>
>> La dimensione dei word embeddings è un valore costante prefissato,
>> indipendente dalla lunghezza del vocabolario, come nella tua versione.
>
> Certo, per ovvi motivi: la gestione di vettori con una dimensionalità
> pari alla dimensione de vocabolario richiederebbe capacità di calcolo
> nettamente maggiori di quelle disponibili.
No. La dimensione del vocabolario sarebbe perfettamente trattabile.
Si chiama vector space model ed è quello utilizzato nei motori di ricerca.
>
> D'altro canto, tale dimensione è "prefissato" solo all'interno di una
> particolare architettura del LLM, ma nulla impedisce di provare a
> programmare statisticamente LLM diversi (con dimensioni diverse nei
> word embeddings) sullo stesso dataset sorgente e confrontarne i
> risultati per selezionare quello ottimale durante la cross validation.
>
Non è questione di scegliere la dimensione ottimale: la differenza è tra un modello sparso e uno denso.
Per ottenere quello denso, occorre fare di più di una semplice riduzione dimensionale, come dici sotto.
>
> Inoltre il mio esempio riproduceva una matrice basata su una singola
> relazione, peraltro definita in modo piuttosto approssimativo.
>
> Le relazioni che potremmo misurare sono innumerevoli, dalla distanza
> media nelle frasi, alle relazioni grammaticali etc…
Lodevole, allora sviluppa la tua teoria e pubblicala.
>
>
>> I word embedding vengono ottenuti come effetto secondario
>> dell’allenamento di un Language Model, come i vettori nascosti che
>> consentono al modello di stimare la probabilità di una parola in un
>> contesto.
>
> In altri termini, il processo di programmazione statistica che hai
> in mente combina il computo delle co-occorrenze ed una riduzione
> dimensionale che facilita l'approssimazione della funzione di
> mappatura obiettivo.
No, una riduzione dimensionale fa perdere informazioni producendo un’approssimazione.
Le rappresentazioni basate su co-occurrence counts non hanno dato i risultati che i linguisti speravano.
Farne una riduzione dimensionale peggiorerebbe le loro capacità.
Puoi vederlo in questo articolo, negli esempi in Tab. 6 e 7, che mostra come i word embedding invece funzionano:
https://www.jmlr.org/papers/volume12/collobert11a/collobert11a.pdf
Oppure sperimentarlo tu stesso qui:
https://projector.tensorflow.org/
Funzionano vuole dire che utilizzati in applicazioni di NLP, consentono di ottenere risultati efficaci più di ogni altra tecnica usata in precedenza.
È quello che Nello Cristianini chiama “La scorciatoia” (https://www.mulino.it/isbn/9788815299833)
>
>
>> Ci vorrebbero diverse lezioni per spiegare come si calcolano i word
>> embedding e perché funzionino in modo talmente efficace
>
> Beh, ma il loro principio di funzionamento è semplice da spiegare.
Vieni tu a insegnarli allora.
Potresti anche andare a Stanford, dove ci dedicano 6 ore di lezione in un corso di PhD:
https://web.stanford.edu/class/cs224n/index.html <https://web.stanford.edu/class/cs224n/index.html>
>
> È _COME SE_, a valle di un'analisi simile a quella che ho descritto
> nella mail precedente, si applicasse una riduzione dimensionale oculata
> (ma approssimativa).
>
> Per chi non lo sapesse una riduzione dimensionale consiste
> semplicemente nella proiezione di uno spazio euclideo a N dimensioni su
> un altro spazio euclideo a M dimensioni con N maggiore di M.
>
> Ad esempio, immaginando 4 o più punti in uno spazio tridimensionale
> (N=3), si tratta semplicemente di proiettare i punti su un piano (M=2)
> libero di traslare e ruotare in modo tale da minimizzare la distanza
> quadratica media delle proiezioni dai punti originali entro un limite
> accettabile (aka, "minimizzare l'errore entro un epsilon").
>
> Non dovrebbe essere difficile da immaginare: 4 o 5 punti nello spazio
> a caso ma non appartenenti ad un piano ed un piano selezionato in modo
> da passare il più vicino possibile a ciascuno di essi.
>
>
>> I word embedding sono composi di centinaia di dimensioni e non è
>> ricostruibile cosa rappresenti ciascuna
>
> Naturalmente, come in ogni riduzione dimensionale in cui lo spazio di
> destinazione non è scelto sulla base di una semantica nota, ma sulla
> base della distanza delle proiezioni sui punti noti.
Non sono una semplice riduzione di dimensione.
>
> Tornando al nostro esempio, le coordinate originali dei punti
> nello spazio tridimensionale hanno una semantica precisa per l'essere
> umano: dato il punto zero in cui potremmo collocare l'osservatore,
> l'asse x potrebbe distinguere destra (x positive) e sinistra (x
> negative), l'asse y potrebbe distinguere sopra (y positive) e sotto (y
> negative) e l'asse z potrebbe distinguere davanti (z positive) e dietro
> (z negative).
>
> Insomma, le coordinate originali hanno un significato comprensibile.
>
Non esistono coordinate originali per i word embeddings, perché non provengono da una riduzione dimensionale.
>
> Ma nel momento che cerchiamo un piano che semplicemente minimizzi la
> distanza quadratica media delle proiezioni dei punti su di esso dai
> punti stessi, accettiamo di ruotare e traslare questo piano come serve.
>
> A quel punto il sistema di coordinate delle proiezioni sul piano
> perdono di significato: lo zero si trova da qualche parte che non
> sappiamo rispetto all'osservatore, x e y sono orientate in modo del
> tutto diverso rispetto alle x e y e z dello spazio tridimensionale di
> origine, per cui non abbiamo più modo di attribuirgli un significato.
>
> TUTTAVIA, poiché i punti hanno comunque perso una dimensione, le nostre
> proiezioni non corrispondono esattamente ai punti originali. O magari
> corrispondono in alcuni fortunati casi, ma in altri sono molto lontani.
> E per contro, vi sono punti lontani sulla dimensione persa che si
> trovano ad essere sovrapposti.
>
>
> Naturalmente dichiarare che i word embeddings rappresentano in modo
> imperscrutabile il significato delle parole fa molto più figo!
>
> Ma rimangono mere proiezioni di statistiche.
No. Nel calcolarli si usano metodi di ottimizzazione, non di statistica.
In termini grossolani:
L’ottimizzazione studia tecniche per trovare modelli che rappresentano al meglio un fenomeno, e di conseguenza hanno capacità predittive.
La statistica studia la raccolta, analisi e interpretazione dei dati: non ha capacità predittive se non assumendo la stabilità dei fenomeni.
Il Machine Learning utilizza metodi statistici per definire i modelli che ottimizza rispetto ai dati.
Per approfondire le differenze:
https://towardsdatascience.com/the-actual-difference-between-statistics-and…
— Beppe
Oct. 16, 2023
Re: [nexa] IA, lavoro, immaginari
by Giuseppe Attardi
Bell’esempio che illustra perché l’Explainable AI non funziona, almeno non come vorrebbero i suoi sostenitori.
La spiegazione che viene fornita è una ricostruzione razionale della risposta, che è simile a quanto fanno gli esperti umani quando devono spiegare le loro risposte.
Infatti nessuno di noi applicherebbe pedissequamente le regole grammaticali per rispondere alla domanda: risponderebbe d’acchito.
Poi, se pressato a spiegare il perché, cercherebbe nelle sue reminiscenze di grammatica della scuola media per una giustificazione.
Anche se chiedi a un medico di giustificare la sua diagnosi, ci mette molte più parole e tempo di quanto ci ha messo per produrla, perché non è in quel modo che l’ha ottenuta.
Il Deep Learning opera a livello di System 1, secondo la terminologia di Daniel Kahneman, ossia di conoscenza “compilata" per una fruizione diretta.
— Beppe
> On 15 Oct 2023, at 20:48, Guido Vetere <vetere.guido(a)gmail.com> wrote:
>
> User
> la frase "il topo è inseguito dal gatto" è attiva o passiva?
>
> ChatGPT
> La frase "il topo è inseguito dal gatto" è in forma passiva.
>
> User
> come fai a saperlo?
>
> ChatGPT
> Posso determinare che la frase "il topo è inseguito dal gatto" è in forma passiva seguendo alcune caratteristiche grammaticali tipiche delle frasi passive in italiano:
> Struttura della frase: Nelle frasi passive, il soggetto riceve l'azione piuttosto che eseguirla. Nell'esempio fornito, il topo (soggetto) riceve l'azione di essere inseguito.
> Verbo: La frase utilizza una forma del verbo "essere" seguita dal participio passato del verbo principale. In questo caso, "è inseguito".
> Agente della passiva: Nelle frasi passive, l'entità che esegue l'azione è spesso introdotta dalla preposizione "da". In questo esempio, l'agente dell'azione è "il gatto", e viene introdotto appunto con "dal".
> Combinando queste caratteristiche, è chiaro che la frase è in forma passiva.
>
> User
> per determinare la forma di una frase, tu applichi esattamente le regole che hai appena elencato?
>
> ChatGPT
> No, non utilizzo una lista di regole in modo rigido e sequenziale come potrebbe fare un algoritmo tradizionale di elaborazione del linguaggio. Invece, il mio modello è basato su una vasta quantità di dati testuali che ho analizzato durante la mia formazione. Quando "valuto" una frase, riconosco schemi e strutture linguistiche basati su quel vasto corpus di dati.
> Tuttavia, quando ti ho fornito quelle caratteristiche grammaticali, ho voluto spiegare in modo esplicito e comprensibile come si può riconoscere una frase passiva in italiano. Era un modo per fornirti una spiegazione chiara e didattica. Nel "pensiero" interno del modello, la determinazione avviene in maniera molto più fluida e basata sul riconoscimento di schemi nei dati.
>
>
>
> Per ora è tutto, a voi la linea :-)
>
> G.
>
> On Sun, 15 Oct 2023 at 20:21, 380° <g380(a)biscuolo.net <mailto:g380@biscuolo.net>> wrote:
>> Buonasera,
>>
>> Giuseppe Attardi <attardi(a)di.unipi.it <mailto:attardi@di.unipi.it>> writes:
>>
>> > C’è tutta un’area di ricerca, che passa sotto il nome di BERTology,
>> > che analizza la questione e si dimostra ad esempio che dalle relazioni
>> > presenti nella matrici di attention delle frasi, si può ricavare
>> > l’intero albero sintattico della frase:
>> > https://aclanthology.org/N19-1419.pdf
>>
>> «A Structural Probe for Finding Syntax in Word Representations»
>> John Hewitt, Christopher D. Manning
>> Published 1 June 2019
>> (via
>> https://www.semanticscholar.org/paper/A-Structural-Probe-for-Finding-Syntax…)
>>
>> --8<---------------cut here---------------start------------->8---
>>
>> Recent work has improved our ability to detect linguistic knowledge in
>> word representations. However, current methods for detecting syntactic
>> knowledge do not test whether syntax trees are represented in their
>> entirety. In this work, we propose a structural probe, which evaluates
>> whether syntax trees are embedded in a linear transformation of a neural
>> network’s word representation space. The probe identifies a linear
>> transformation under which squared L2 distance encodes the distance
>> between words in the parse tree, and one in which squared L2 norm
>> encodes depth in the parse tree. Using our probe, we show that such
>> transformations exist for both ELMo and BERT but not in baselines,
>> providing evidence that entire syntax trees are embedded implicitly in
>> deep models’ vector geometry.
>>
>> --8<---------------cut here---------------end--------------->8---
>>
>> Interessante, ma se davvero vogliamo parlare di BERTology allora, ripeto
>> [1] che nel Vol. 8 del Transactions of the Association for Computational
>> Linguistics del MIT (2020) è pubblicato questo articolo:
>>
>> «A Primer in BERTology: What We Know About How BERT Works»
>> by Anna Rogers, Olga Kovaleva, Anna Rumshisky
>>
>> https://direct.mit.edu/tacl/article/doi/10.1162/tacl_a_00349/96482/A-Primer…
>>
>> che cita il paper sopra tra le fonti per descrivere le caratteristiche
>> di syntactic knowledge di BERT, mentre più avanti, nel capitolo "3.3
>> World Knowledge" e "3.4 Limitations" scrive:
>>
>> --8<---------------cut here---------------start------------->8---
>>
>> However, BERT cannot reason based on its world knowledge. Forbes et
>> al. (2019) show that BERT can “guess” the affordances and properties of
>> many objects, but cannot reason about the relationship between
>> properties and affordances. For example, it “knows” that people can walk
>> into houses, and that houses are big, but it cannot infer that houses
>> are bigger than people. Zhou et al. (2020) and Richardson and Sabharwal
>> (2019) also show that the performance drops with the number of necessary
>> inference steps. Some of BERT’s world knowledge success comes from
>> learning stereotypical associations (Poerner et al., 2019), for example,
>> a person with an Italian-sounding name is predicted to be Italian, even
>> when it is incorrect.
>>
>> 3.4 Limitations
>>
>> Multiple probing studies in section 3 and section 4 report that BERT
>> possesses a surprising amount of syntactic, semantic, and world
>> knowledge. However, Tenney et al. (2019a) remark, “the fact that a
>> linguistic pattern is not observed by our probing classifier does not
>> guarantee that it is not there, and the observation of a pattern does
>> not tell us how it is used.” There is also the issue of how complex a
>> probe should be allowed to be (Liu et al., 2019a). If a more complex
>> probe recovers more information, to what extent are we still relying on
>> the original model?
>>
>> Furthermore, different probing methods may lead to complementary or even
>> contradictory conclusions, which makes a single test (as in most
>> studies) insufficient (Warstadt et al., 2019). A given method might also
>> favor one model over another, for example, RoBERTa trails BERT with one
>> tree extraction method, but leads with another (Htut et al., 2019). The
>> choice of linguistic formalism also matters (Kuznetsov and Gurevych,
>> 2020).
>>
>> [...]
>>
>> --8<---------------cut here---------------end--------------->8---
>>
>> Nel 2020 i ricercatori citati sopra sostenevano che BERT non è in grado
>> di ragionare.
>>
>> Sullo stesso numero della rivista è pubblicato anche questo articolo:
>>
>> «What BERT Is Not: Lessons from a New Suite of Psycholinguistic
>> Diagnostics for Language Models»
>> by Allyson Ettinger
>>
>> https://direct.mit.edu/tacl/article/doi/10.1162/tacl_a_00298/43535/What-BER…
>>
>> cito dalle conclusioni:
>>
>> --8<---------------cut here---------------start------------->8---
>>
>> In this paper we have introduced a suite of diagnostic tests for
>> language models to better our understanding of the linguistic
>> competencies acquired by pre-training via language modeling. We draw our
>> tests from psycholinguistic studies, allowing us to target a range of
>> linguistic capacities by testing word prediction accuracies and
>> sensitivity of model probabilities to linguistic distinctions. As a case
>> study, we apply these tests to analyze strengths and weaknesses of the
>> popular BERT model, finding that it shows sensitivity to role reversal
>> and same-category distinctions, albeit less than humans, and it succeeds
>> with noun hypernyms, but it struggles with challenging inferences and
>> role-based event prediction—and it shows clear failures with the meaning
>> of negation. We make all test sets and experiment code available (see
>> Footnote 1), for further experiments.
>>
>> The capacities targeted by these test sets are by no means
>> comprehensive, and future work can build on the foundation of these
>> datasets to expand to other aspects of language processing. Because
>> these sets are small, we must also be conservative in the strength of
>> our conclusions—different formulations may yield different performance,
>> and future work can expand to verify the generality of these results. In
>> parallel, we hope that the weaknesses highlighted by these diagnostics
>> can help to identify areas of need for establishing robust and
>> generalizable models for language understanding.
>>
>> --8<---------------cut here---------------end--------------->8---
>>
>> Allora ripeto la mia domanda: ci sono nuovi studi che dimostrino che le
>> limitazioni evidenziate nei test sulla competenza logico/linguistica di
>> BERT siano stati risolti da altri LLM?
>>
>> Perché credo che sulla _perfomance_ sintattica degli LLM nessuno abbia
>> proprio nulla da ridire.
>>
>> Saluti, 380°
>>
>> [...]
>>
>> [1] Message-id: 87o7ux2i16.fsf(a)xelera.eu <mailto:87o7ux2i16.fsf@xelera.eu>
>> https://server-nexa.polito.it/pipermail/nexa/2022-September/049508.html
>>
>>
>> --
>> 380° (Giovanni Biscuolo public alter ego)
>>
>> «Noi, incompetenti come siamo,
>> non abbiamo alcun titolo per suggerire alcunché»
>>
>> Disinformation flourishes because many people care deeply about injustice
>> but very few check the facts. Ask me about <https://stallmansupport.org <https://stallmansupport.org/>>.
>> _______________________________________________
>> nexa mailing list
>> nexa(a)server-nexa.polito.it <mailto:nexa@server-nexa.polito.it>
>> https://server-nexa.polito.it/cgi-bin/mailman/listinfo/nexa
Oct. 16, 2023