La maggior parte dei libri sugli LLM presenta concetti ad alto livello o strumenti già completi. Questo libro insegna l’intero percorso ingegneristico.
Train a GPT-Style LLM inizia da una cartella vuota e costruisce un progetto di modello linguistico passo dopo passo. Creerai l’ambiente, il tokenizzatore, la pipeline dei dataset, il transformer decoder-only, il ciclo di addestramento, il sistema di checkpoint, i report di validazione, il percorso a precisione mista, il modulo di generazione, il flusso di lavoro LoRA, il flusso di lavoro QLoRA, la checklist di rilascio e l’API locale.
L’enfasi è sulla comprensione pratica. Vedrai perché la tokenizzazione viene prima della modellazione, come funziona l’addestramento next-token, come i checkpoint proteggono le esecuzioni lunghe, perché la validation loss non è sufficiente, come CUDA AMP utilizza torch.autocast e GradScaler, perché BF16 di solito non richiede lo scaling del gradiente nello stesso modo di FP16 e come i fallback CPU e MPS dovrebbero essere gestiti in modo pulito.
Il libro è onesto riguardo alla scala. Un modello da 0.5B è abbastanza grande da insegnare una reale pressione ingegneristica. Un modello da 7B cambia la conversazione sull’hardware. I sistemi commerciali di frontiera come GPT-5.5 e Claude richiedono infrastruttura industriale, pipeline di dati proprietarie, post-training, sistemi di sicurezza, programmi di valutazione e piattaforme di serving. Questo libro non finge il contrario. Invece, ti fornisce gli strumenti e il giudizio per comprendere come vengono costruiti i sistemi LLM.
Imparerai a:
- Costruire un transformer in stile GPT direttamente in PyTorch.
- Addestrare e ispezionare un tokenizzatore.
- Preparare i dataset per la predizione next-token.
- Implementare addestramento, validazione, checkpoint e ripresa.
- Usare CUDA AMP con torch.autocast e GradScaler.
- Comprendere BF16, FP16, fallback CPU e comportamento MPS di Apple Silicon.
- Progettare una configurazione di modello da 0.5B prima di sprecare risorse di calcolo.
- Ragionare sullo scaling da 0.5B a 3B e 7B.
- Fare il fine-tuning di modelli esistenti con LoRA e QLoRA.
- Valutare, rilasciare, quantizzare e servire un modello in locale.
Il codice companion è disponibile su https://github.com/riccione83/tiny-llm.
DOWNLOAD
FILESTORE
