Операция выполнена!
Закрыть
Хабы: Блог компании Open Data Science, Искусственный интеллект, Анализ и проектирование систем, Natural Language Processing

Что, если нужную книгу больше не нужно искать — её можно собрать под собственный вопрос?

Я проверил эту идею на реальном корпусе: 206 длинных видео, 160 часов 56 минут и 2,15 млн слов транскриптов.

Вместо сотен summary я построил конвейер, который выделяет сущности, схлопывает дубли, отслеживает происхождение выводов, проверяет важные утверждения и понимает, когда оставшиеся источники уже не нужно читать подряд.

По ходу выяснилось, почему 9 URL могут оказаться одним источником, почему векторная кластеризация не решила задачу смысловых дублей, чем такой подход отличается от RAG и почему длинная работа ИИ-агента неожиданно начинает напоминать разработку обычной программной системы.

Но главный вывод оказался шире самого проекта: единицей работы с информацией может становиться не источник, а наш вопрос.

Читать далее
Читайте также
НОВОСТИ

ПИШИТЕ

Техническая поддержка проекта ВсеТут

info@vsetut.pro