Операция выполнена!
Закрыть
Хабы: Блог компании Cloud.ru, Искусственный интеллект, Машинное обучение

В этом году Anthropic опубликовала исследование инфраструктурного шума в бенчмарках для ИИ-агентов, которые пишут и запускают код. На Terminal-Bench 2.0 разница между самой строгой и неограниченной конфигурациями достигла шести процентных пунктов. Это больше, чем типичный разрыв между соседними позициями в верхней части рейтинга. Работа интересна не только конкретными цифрами, она показывает более фундаментальную проблему: бенчмарки измеряют не модель в вакууме, а всю систему, в которой эта модель действует.

Читать далее
Читайте также
НОВОСТИ

ПИШИТЕ

Техническая поддержка проекта ВсеТут

info@vsetut.pro