Skip to content

Large Language Models

Notes on adapting large language models and engineering efficient inference systems for language, image, and video generation.

  • Finetuning

    Adapt pretrained language models to specialized tasks and instructions.

    Explore finetuning →

  • Inference engineering

    Model mechanics, bottlenecks, quantization, speculative decoding, caching, parallelism, and disaggregated serving.

    Start with motivation →