Riccardo Rizzo – Costruire un’IA in stile GPT (Italian Edition) (2026)

Italian | June 11, 2026 | ISBN: N/A | ASIN: B0H4X7YV9F | 693 pages | EPUB | 1 Mb

La maggior parte dei libri sugli LLM presenta concetti ad alto livello o strumenti già completi. Questo libro insegna l’intero percorso ingegneristico.

Train a GPT-Style LLM inizia da una cartella vuota e costruisce un progetto di modello linguistico passo dopo passo. Creerai l’ambiente, il tokenizzatore, la pipeline dei dataset, il transformer decoder-only, il ciclo di addestramento, il sistema di checkpoint, i report di validazione, il percorso a precisione mista, il modulo di generazione, il flusso di lavoro LoRA, il flusso di lavoro QLoRA, la checklist di rilascio e l’API locale.

L’enfasi è sulla comprensione pratica. Vedrai perché la tokenizzazione viene prima della modellazione, come funziona l’addestramento next-token, come i checkpoint proteggono le esecuzioni lunghe, perché la validation loss non è sufficiente, come CUDA AMP utilizza torch.autocast e GradScaler, perché BF16 di solito non richiede lo scaling del gradiente nello stesso modo di FP16 e come i fallback CPU e MPS dovrebbero essere gestiti in modo pulito.

Il libro è onesto riguardo alla scala. Un modello da 0.5B è abbastanza grande da insegnare una reale pressione ingegneristica. Un modello da 7B cambia la conversazione sull’hardware. I sistemi commerciali di frontiera come GPT-5.5 e Claude richiedono infrastruttura industriale, pipeline di dati proprietarie, post-training, sistemi di sicurezza, programmi di valutazione e piattaforme di serving. Questo libro non finge il contrario. Invece, ti fornisce gli strumenti e il giudizio per comprendere come vengono costruiti i sistemi LLM.

Imparerai a:

  • Costruire un transformer in stile GPT direttamente in PyTorch.
  • Addestrare e ispezionare un tokenizzatore.
  • Preparare i dataset per la predizione next-token.
  • Implementare addestramento, validazione, checkpoint e ripresa.
  • Usare CUDA AMP con torch.autocast e GradScaler.
  • Comprendere BF16, FP16, fallback CPU e comportamento MPS di Apple Silicon.
  • Progettare una configurazione di modello da 0.5B prima di sprecare risorse di calcolo.
  • Ragionare sullo scaling da 0.5B a 3B e 7B.
  • Fare il fine-tuning di modelli esistenti con LoRA e QLoRA.
  • Valutare, rilasciare, quantizzare e servire un modello in locale.

Il codice companion è disponibile su https://github.com/riccione83/tiny-llm.

DOWNLOAD
FILESTORE