Операция выполнена!
Закрыть
Хабы: Блог компании OTUS, Искусственный интеллект, Машинное обучение, Программирование

Как собрать собственную визуально-языковую модель с нуля, имея ограниченный бюджет и одну арендованную GPU? Автор эксперимента взял небольшую языковую модель, подключил к ней визуальный энкодер и прошёл весь путь обучения VLM – от настройки архитектуры до оценки качества ответов. В статье – разбор решений, ошибки первых запусков и результаты модели на 628 млн параметров, которая научилась описывать изображения примерно за $200.

Смотреть результат
Читайте также
НОВОСТИ

ПИШИТЕ

Техническая поддержка проекта ВсеТут

info@vsetut.pro