Операция выполнена!
Закрыть
Хабы: Искусственный интеллект, Машинное обучение, Операционные системы, Серверное администрирование

Когда меня однажды спросили, что такое инференс и как выглядит локальное развёртывание модели, я ответил правильно, но слишком общо. Через несколько дней пришлось пройти этот путь целиком: поднять две LLM на NVIDIA DGX Spark, отдельную ASR-модель на AMD GPU и подключить всё к мультиагентной платформе. В статье — инженерный разбор того, почему файлы модели ещё не сервис, как длинный контекст конкурирует с KV-кэшем и параллелизмом, почему tokens/sec не описывают пользовательскую задержку и зачем иногда откатывать более быструю модель из-за качества.

Читать далее
Читайте также
НОВОСТИ

ПИШИТЕ

Техническая поддержка проекта ВсеТут

info@vsetut.pro