Операция выполнена!
Закрыть
Хабы: Искусственный интеллект

Всем привет!

В прошлой статье я гонял Алису и Гигачат как чаты: Arena-Hard, WildBench, MultiChallenge, τ³, ПРАКТ-120. Там модель должнв была отвечать текстом в браузере - как будто она общалас с пользователем, пользователь задавал разные задания и тесты определяли, справляется ли модель.

Тут - уже совсем другой экзамен. Агенту дают настоящий компьютер и настоящее задание: починить пайплайн, разобраться с проблемами в консоли сервера, собрать форму, закрыть визу, свести таблицу из почты и банка. На выходе ждут рабочий артефакт.

Terminal-Bench 4 и OSWorld 2 - это два теста, которые различные лаборатории сейчас считают маст хэв.

Как вы наверное заметили, мне интересно тестировать наши, отечественные модели, отечественные решения. Почему? Ну потому что в первую очередь я верю в мозги наших разработчиков, которые во всем мире всегда считались топовыми. Мне совершенно непонятно почему мы так отстаем в ИИ, и я отказываюсь в это верить. Хотя нет, понятно - все дело в отсутствии венчура, поддержки от государства и увядших мозгах наших чиновников, но это уже предмет другого обсуждения и холиворов, которые мне тут не нужны.

Я общаюсь с несколькими командами, которые развиват ИИ решения в России, и все они классные и я уверен, покажут интересные результаты, а я о них напишу или даже скоро потестирую и поделюсь результатами. Надеюсь, что общение с командой Гигачата разовьется в нечто большее, чем самостоятельное проведение мной предыдущих бенчмарков, надеюсь что и разработчики Алисы сомной подружатся и мы вместе сделаем что-то интересное и полезное. Сейчас же самое интересное и просто топовая новость - агентская обвязка команды Маракуйи прошла одни из самых сложных тестов в мире с очень крутыми показателями.

Читать этот жЫр полностью
Читайте также
НОВОСТИ

ПИШИТЕ

Техническая поддержка проекта ВсеТут

info@vsetut.pro