Intanto, perché nel titolo parlo di modelli GPT e non di chatGPT, quella che conosciamo tutti? Le versioni di GPT in realtà ci dicono come si è evoluto il motore, che sta sotto la chat, ossia chatGPT. La sigla sta per Generative Pre-trained Transformers, e sono i modelli di intelligenza artificiale sviluppati da OpenAI, progettati per comprendere e generare linguaggio naturale. Sono quindi gli LLM creati da OpenAI, per saperne di più puoi iniziare da questo post. Il loro funzionamento si basa su una particolare architettura chiamata Transformer, che permette di gestire il contesto di un testo per prevedere e generare le parole successive. Ognuno dei tre termini che compongono l’acronimo è importante, così vediamo cosa vogliono dire.
Il funzionamento dei modelli GPT
- Generative: significa che lo schema che c’è sotto questo LLM (Large Language Model) è in grado di generare testo (completare frasi, scrivere articoli, rispondere a domande, ecc.). Per questo si dice che il modello è generativo. Ma come fa a generare cose come un testo? Ce lo spiega la seconda parola.
- Pre-trained: il modello viene pre-addestrato su enormi quantità di testo (libri, siti web, forum, ecc.) prima di essere adattato a compiti specifici. Se volete avere un’immagine fantasiosa, potreste pensare ad un GPT come un piccolo robot che passa il tempo a leggere, guardare film, ascoltare musica: ad imparare, insomma.
- Transformer: è l’architettura neurale alla base, introdotta da Google nel 2017, che consente di gestire lunghe sequenze di testo in modo efficiente e con attenzione al contesto. Il Transformer è un insieme di tanti software, che possiamo considerare i ‘neuroni’ del modello, che analizzano il materiale preso dallo step di Pre-training. Ognuno di questi software è legato al precedente e al successivo, non per forza in modo lineare: si possono creare connessioni che il programmatore non aveva previsto. L’unione di tutti questi software, di questi neuroni software, è una rete neurale. È grazie all’architettura del Transformer che il modello impara a prevedere la parola successiva a quella che ha appena letto, ad esempio dal prompt inserito dall’utente. L’associazione, nei modelli moderni, è fatta a livello di frase o addirittura di più frasi, in modo da comprendere il contesto della domanda e fornire così una risposta coerente.
Cosa possono fare i modelli GPT?
Ormai sono già almeno due anni che tutti quanti usiamo, o abbiamo usato almeno una volta, un sistema di Intelligenza Artificiale, di cui chatGPT è stato il primo. La piattaforma chatGPT, quella che otteniamo quando andiamo direttamente sul sito o usiamo dall’app sullo smartphone, non è altro che un sistema comodo per interagire con il modello GPT. In pratica, GPT è il motore dell’automobile, che sta sotto il cofano e non vediamo, mentre chatGPT è l’insieme dei comandi, volante, pedali, cambio, cruscotto, che ci permette di guidare l’automobile. In questo modo, i modelli GPT possono creare oggetti come testi o immagini, in funzione di quello che chiediamo usando chatGPT, e quindi quando scriviamo il nostro prompt.

Per farlo ci sono tre passaggi fondamentali:
Pre-addestramento: leggono enormi quantità di testi (ma non sanno nulla in tempo reale né hanno memoria a lungo termine).
Apprendimento tramite istruzioni: vengono ottimizzati per seguire comandi e richieste umane.
Fine-tuning o RLHF: migliorano ulteriormente imparando da feedback umani.
Evoluzione dei modelli GPT
Ecco un rapido excursus delle versioni principali:
| Versione | Anno | Novità principale |
|---|---|---|
| GPT-1 | 2018 | Primo modello Transformer |
| GPT-2 | 2019 | Generazione coerente di testo |
| GPT-3 | 2020 | Comprensione profonda, few-shot learning |
| GPT-3.5 | 2022 | Più stabile e precisa. Presentata al pubblico il 30 novembre, la prima AI per l’utente disponibile da febbraio 2023. |
| GPT-4 | 2023 | Multimodalità (testo + immagini) |
| GPT-4o | 2024 | Input/output multimodale in tempo reale |
Il pappagallo stocastico
I modelli GPT, non solo quelli di OpenAI, sono a volte definite con l’espressione “pappagallo stocastico” (in inglese: stochastic parrot), inteso come critica agli LLM. È un pappagallo, perché ripete frasi e parole che ha “sentito” durante l’addestramento, senza capire davvero ciò che dice. Ed è stocastico perché sceglie le parole in base a probabilità, non a comprensione logica o consapevolezza. Un LLM infatti non ha una vera e propria comprensione di quel che legge, né di quel che risponde. Semplicemente è addestrato per mettere insieme le parole una dietro l’altra in modo da costruire una frase di senso compiuto e coerente con la domanda dell’utente. Questo modo di lavorare provoca anche le cosiddette allucinazioni, ci torno più avanti con un post dedicato.
L’espressione è diventata famosa grazie a un paper del 2021, dove le autrici mettevano in guardia dai rischi dei modelli GPT e di tutti i LLM, sottolineando in particolare:
- Bias e pregiudizi presenti nei dati di addestramento
- Mancanza di comprensione reale
- Uso etico e ambientale dell’AI
- Illusione di intelligenza (gli utenti credono che l’AI “capisca”)
Non si può però negare che in molte occasioni i LLM sono estremamente utili per:
- Riassumere testi
- Scrivere email, articoli, codice
- Trovare idee
- Tradurre
- Automatizzare conversazioni
Basta essere consapevoli che gli LLM, come i modelli GPT, non “capiscono” nel senso umano del termine. E che quindi i risultati vanno sempre controllati (da un essere umano!)
