Large Language Models¶
Notes on adapting large language models and engineering efficient inference systems for language, image, and video generation.
-
Finetuning¶
Adapt pretrained language models to specialized tasks and instructions.
-
Inference engineering¶
Model mechanics, bottlenecks, quantization, speculative decoding, caching, parallelism, and disaggregated serving.
-
Retrieval Augmented Generation (RAG)¶
RAG, Chunking, Retrieval, GraphRAG, Agentic RAG.