Операция выполнена!
Закрыть
Хабы: Блог компании GPTunneL, Работа с видео, Искусственный интеллект, CGI (графика), Будущее здесь

Есть такой тип новостей – после которых ты просто закрываешь ноутбук и минуту тупишь в стену. Вот у меня так случилось пару дней назад, когда я добрался до демок MiniMax H3. И нет, не потому что “о боже, ещё одна видеомодель” – их сейчас штампуют как флагманские смартфоны. А потому что H3 упорно отказывается вести себя как обычная видюха.

Обычно у таких генераторов фокус один: текст → видео, ну или картинка → видео, максимум монтаж отдельным сервисом прикрутят. А тут прям с порога плюют на границы – между “сгенерировать” и “отредачить”, между “картинкой” и “звуком”. Кидаешь ей шесть референсных изображений, ролик-образец для тайминга монтажа и одно предложение текста – она выдаёт 15-секундный клип, смонтированный именно так, как в примере. Просунул зелёный экран с актёром – уберёт хромакей, подставит сказочный лес и перестроит освещение под новую сцену.

Разрабы формулируют красиво: H3 – «шаг к более общему мультимодальному интеллекту», а все эти специализированные модельки под конкретную задачу они прямо называют «лишней сложностью». Вместо зоопарка узких инструментов – один трансформер, который смотрит на текст, картинки, видео и аудио как на единый контекст. Спорно? Ну… отчасти да.

Но у этой позиции теперь есть проверка на прочность: модель открыли под лицензией, и любой желающий может прогнать её на своих материалах и убедиться, врёт маркетинг или нет. Чем мы, собственно, и займёмся.

Читать далее
Читайте также
НОВОСТИ

ПИШИТЕ

Техническая поддержка проекта ВсеТут

info@vsetut.pro