martedì 6 ottobre 2026

Un'IA su un computer del 2012: prima il compito, poi il modello

Volevo capire qual è il miglior modello di intelligenza artificiale che riesce a girare su un computer del 2012. Ho deciso a che cosa mi serviva, ho preparato dei test e ho scritto un programma che li fa fare a tutti i candidati: ha vinto un modello da 2,7 GB, che risponde bene a tutte le domande in circa 6 secondi.

Il punto di partenza

In casa ho un piccolo server. Ha un processore Intel Core i5-3470T del 2012, un modello a basso consumo con due core, 16 GB di memoria e nessuna scheda grafica. È alimentato da un Pico ATX, un alimentatore in miniatura, e consuma circa 50 W. È silenzioso e resta acceso tutto il giorno.

Su questa macchina volevo far girare un modello linguistico, cioè lo stesso tipo di programma che sta dietro a ChatGPT o a Claude, ma in locale: senza abbonamenti, senza mandare i miei dati a nessuno.

I modelli che si usano online girano su centri di calcolo con migliaia di schede grafiche. Quelli che stanno in 16 GB di memoria sono enormemente più piccoli. Non possono fare tutto. La domanda giusta quindi non è "qual è il modello migliore?", ma "quale modello fa bene la cosa che mi serve, e in quanto tempo?".

Migliore per fare cosa

Il mio modello deve fare una cosa sola: leggere una frase scritta come parlo e trasformarla in una scheda compilata. Non deve conversare, né sapere tutto.

Sul server gira un assistente personale che tiene le mie liste della spesa per negozio, i progetti in corso e il registro di quello che faccio. Gli scrivo in italiano, senza comandi fissi. Il modello deve capire quale delle nove azioni previste sto chiedendo ed estrarre i dettagli: negozio, progetto, oggetto, quantità, prezzo, durata.

Io scrivo

Il modello deve restituire

"vado da Action"

azione: mostra la lista; negozio: Action

"aggiungi 2 resistenze da 10k per la domotica, le prendo da Action, 2 euro"

azione: aggiungi; negozio: Action; progetto: domotica; quantità: 2; prezzo: 2

"stamattina un'ora e mezza di palestra"

azione: registra attività; categoria: allenamento; durata: 90 minuti

"che tempo fa domani a Torino?"

azione: nessuna, non è compito mio

Definire l'uso in modo così stretto ha due effetti. Rende il compito alla portata di un modello piccolo, che in generale sa poco ma su un lavoro circoscritto può essere affidabile. E dice che cosa conta davvero:

  • Non deve sbagliare. Un'azione capita male scrive dati sbagliati nelle mie liste.
  • Non deve inventare. Se non ho detto il prezzo, il prezzo resta vuoto.
  • Deve saper dire "non lo so". Una domanda fuori tema va riconosciuta, non forzata in una delle nove azioni.
  • Deve rispondere in pochi secondi. Mi ero dato come soglia 5 secondi per la risposta tipica e 15 per la peggiore.

La scelta dei test

Ho usato due tipi di prova: un test mio, costruito sul compito vero, e alcuni test pubblici già usati da altri.

Le classifiche che si trovano online non mi bastavano: sono fatte su macchine potenti e non dicono quanti secondi aspetterò io. Dovevo rifare le prove in casa.

Il test mio dice se il modello fa il lavoro che mi serve. Quelli pubblici servono ad avere numeri confrontabili con quelli di chi usa altre macchine, e permettono a chiunque di rifare le stesse prove.

Di test pubblici ne esistono moltissimi. Li ho scelti con quattro criteri.

  • Compiti alla portata di un modello piccolo. Capire un testo, rispettare un formato, scegliere uno strumento. Niente cultura generale o problemi di matematica.
  • Anche in italiano. È la lingua in cui userò il modello.
  • Correzione automatica. La risposta deve risultare giusta o sbagliata senza il giudizio di una persona.
  • Durata sostenibile. Su questa macchina il modello che ho poi scelto impiega quasi un minuto e mezzo solo per leggere le istruzioni del mio test, che stanno in meno di una pagina. Il primo piano, fatti i conti, chiedeva circa 83 giorni di calcolo. L'ho ridotto accorciando i testi e tenendo da 40 a 80 domande per test.

Test

Che cosa misura

Quante prove

Il mio test

Capisce una mia frase e compila la scheda dell'assistente

38 frasi

Comprensione (Belebele)

Legge un breve testo e risponde a una domanda a quattro scelte, in italiano e in inglese

80 domande per lingua

Uso di strumenti (BFCL)

Sceglie lo strumento giusto da usare, o capisce che non ne serve nessuno

80 domande

Formato (JSONSchemaBench)

Compila una scheda rispettando uno schema dato

50 schede

Velocità pura (llama-bench)

Quanto testo al secondo il modello legge e scrive

3 ripetizioni

Come ho costruito il mio test

Il test è un elenco di 38 frasi, ognuna con la risposta giusta scritta accanto. Un programma le manda al modello una alla volta, confronta la risposta con quella attesa e cronometra.

Le frasi le ho scritte come le direi davvero, comprese quelle scomode: abbreviazioni ("ali" per AliExpress), richieste implicite ("passo dal Leroy dopo il lavoro"), durate a parole ("un'ora e mezza") e tre domande fuori tema.

Per ogni modello guardo tre numeri.

  • Tutto giusto: quante frasi su 38 hanno l'azione corretta e tutti i dettagli corretti. Non ci sono mezzi punti: un'azione giusta con il negozio sbagliato vale zero.
  • Pulizia: in quante risposte il modello non ha aggiunto dati che nella frase non c'erano.
  • Tempo: quanti secondi impiega la risposta tipica (la mediana) e la più lenta.

Quattro regole rendono il confronto onesto.

  1. Tutti i modelli ricevono le stesse istruzioni, parola per parola.
  2. Gli esempi contenuti nelle istruzioni non coincidono mai con le frasi del test. Altrimenti si misura chi copia meglio.
  3. La risposta è obbligata nella forma di una scheda con campi fissi. Il modello non può divagare.
  4. Il modello lavora senza casualità: la stessa frase dà sempre la stessa risposta, così chiunque può ripetere la prova.

Il programma che fa le prove

Provare tutto a mano era impensabile. Ho scritto un programma che, dato un elenco di modelli e un elenco di test, fa da solo tutte le prove e ne registra i risultati.

Per ogni modello ripete lo stesso giro.

  1. Scarica il modello, se non c'è già.
  2. Lo avvia sul server.
  3. Gli manda le domande di ogni test, una alla volta.
  4. Confronta ogni risposta con quella attesa e cronometra il tempo.
  5. Salva tutto in un archivio: risposta, esito, secondi, memoria occupata.
  6. Spegne il modello e passa al successivo.

Lo stesso giro si ripete cambiando una cosa per volta: il modello più o meno compresso, il programma che lo fa girare, le sue regolazioni. Così si vede che cosa incide davvero sul risultato.

Tre accorgimenti lo rendono usabile su una macchina lenta, dove un giro completo dura giorni.

  • Riparte da dove era. Se lo interrompo, non rifà le prove già finite.
  • Ripete solo il necessario. Se cambio un test, rifà quel test e non gli altri.
  • Si fa guardare da lontano. Copia ogni risultato su un foglio online, che controllo dal telefono.

In tutto ha eseguito 233 prove valide in circa 54 ore di calcolo, tra il 28 settembre e il 5 ottobre 2026.

I risultati

Ho provato 15 modelli gratuiti, da 0,5 a 5,7 GB: due hanno risposto bene a tutte le 38 frasi, e il più rapido dei due impiega 6,3 secondi.

Tutti sono nella stessa versione compressa standard e girano con lo stesso programma, sulla stessa macchina. La tabella è ordinata per risposte giuste e poi per tempo.

Modello

Produttore

File (GB)

Tutto giusto (su 38)

Senza dati inventati (%)

Tempo tipico (s)

Qwen3.5-4B

Alibaba

2,7

38

100

6,3

Gemma 4 E4B

Google

5,0

38

100

7,8

Ministral 3 3B

Mistral

2,1

37

100

5,8

Qwen3.5-9B

Alibaba

5,7

37

100

11,4

Qwen3.5-2B

Alibaba

1,3

35

92

3,6

Llama 3.2 3B

Meta

2,0

35

76

6,0

Qwen3-4B-2507

Alibaba

2,5

35

95

7,4

Gemma 4 E2B

Google

3,1

32

100

4,3

SmolLM3 3B

Hugging Face

1,9

31

92

5,2

Phi-4-mini

Microsoft

2,5

31

84

5,6

Qwen3.5-0.8B

Alibaba

0,5

27

89

1,4

LFM2.5-8B-A1B

Liquid AI

5,2

25

68

24,6

Llama 3.2 1B

Meta

0,8

22

58

2,5

MiniCPM5-2B

OpenBMB

1,6

21

92

4,2

LFM2.5-1.2B

Liquid AI

0,7

14

11

20,4

I nove modelli rimasti in gara hanno fatto anche i test pubblici. In quello di comprensione chi è in testa nel mio test è in testa anche lì, e tutti vanno meglio in inglese che in italiano.

Modello

Mio test (su 38)

Comprensione in italiano (su 80)

Comprensione in inglese (su 80)

Qwen3.5-4B

38

75

78

Gemma 4 E4B

38

72

76

Qwen3.5-9B

37

75

79

Ministral 3 3B

37

68

74

Qwen3-4B-2507

35

71

72

Qwen3.5-2B

35

62

70

Gemma 4 E2B

32

67

70

Phi-4-mini

31

64

70

Qwen3.5-0.8B

27

49

60

Gli altri due test pubblici hanno aiutato meno. In quello sul formato quasi tutti i modelli stanno tra il 90 e il 98%. Quello sugli strumenti ha dato un ordine diverso dagli altri, e per il mio uso conta poco.

Le conclusioni

Su questa macchina, per questo compito, il modello migliore è Qwen3.5-4B: risponde bene a tutte le 38 frasi in 6,3 secondi e occupa 3,3 GB di memoria sui 16 disponibili. È quello che uso oggi sul server.

L'ho scelto con una regola semplice: prima scarto chi sbaglia, poi tra i rimasti prendo il più veloce. Dalle prove escono altre quattro indicazioni.

  • Più grande non vuol dire migliore. Il modello da 5,7 GB della stessa famiglia impiega 11,4 secondi e non dà una risposta giusta in più.
  • Più piccolo vuol dire più veloce, ma sbaglia. Il più piccolo della famiglia risponde in 1,4 secondi e sbaglia 11 frasi su 38. Quello da 1,3 GB risponde in 3,6 secondi e ne sbaglia 3.
  • Comprimere conviene. Lo stesso modello non compresso pesa 8,4 GB e risponde in 16,6 secondi, senza fare meglio.
  • Le regolazioni contano. Se il programma tiene a mente le istruzioni, che sono sempre uguali, la risposta arriva in 6,3 secondi. Se le rilegge ogni volta, in 86.

Sei secondi sono più dei 5 che mi ero dato come obiettivo. Tra i modelli provati, nessuno di quelli che fanno bene il lavoro scende sotto quella soglia: per riuscirci serve una macchina più veloce.

Questi risultati valgono per questo computer e per questo uso. Con un altro compito il vincitore può cambiare. Il metodo resta lo stesso.

Il prossimo passo: la seconda macchina

Sto allestendo un secondo computer, con un processore Intel del 2014 a quattro core e gli stessi 16 GB di memoria. Appena sarà pronto rifarò le stesse prove, per vedere quanto scende il tempo di risposta e se il modello migliore resta lo stesso.

Il metodo in otto righe

Chi ha un computer vecchio e vuole farci girare un modello può seguire questa traccia. Non serve saper programmare bene: serve sapere che cosa si vuole.

  1. Scrivi in una frase che cosa deve fare il modello, e che cosa non deve fare.
  2. Decidi la soglia: quanti errori accetti e quanti secondi sei disposto ad aspettare.
  3. Scrivi almeno 30 o 40 richieste vere con la risposta giusta accanto. Più sono, meglio è.
  4. Scegli i candidati che stanno nella tua memoria. Le classifiche pubbliche servono qui, per scremare.
  5. Fai rispondere tutti con le stesse istruzioni, sulla tua macchina, e misura risposte giuste e tempo.
  6. Leggi gli errori uno per uno. Se sbagliano tutti nello stesso punto, correggi le istruzioni o il test.
  7. Scarta chi sta sotto la soglia e tieni il più veloce dei rimasti.
  8. Rifà tutto quando cambia la macchina, esce un modello nuovo o cambia l'uso.

Nessun commento:

Posta un commento