Операция выполнена!
Закрыть
Хабы: Машинное обучение, Natural Language Processing, Искусственный интеллект

На NLP/LLM собеседованиях все чаще проверяют не только знание трансформеров, но и понимание того, как устроены современные GPT-like модели: почему большинство генеративных LLM используют decoder-only архитектуру, чем LLaMA отличается от ванильного Transformer, зачем нужны RoPE, RMSNorm, SwiGLU и GQA.

Почему инференс LLM дорогой и какие оптимизации помогают его ускорять: fused kernels, FlashAttention, KV-cache и PagedAttention, continuous batching, speculative decoding, квантизация и дистилляция.

Много схем и картинок, а также полный список вопросов с собесов в конце.

Читать далее
Читайте также
НОВОСТИ

ПИШИТЕ

Техническая поддержка проекта ВсеТут

info@vsetut.pro