Операция выполнена!
Закрыть
Хабы: Python

Я бы сделал начало более естественным и менее похожим на презентацию продукта. Например:

В прошлой статье я разбирал, как с помощью Python и Telethon автоматизировать сбор публикаций из Telegram-каналов. Тогда мы фактически решали задачу первого уровня: получили сообщения, забрали текст и сохранили результат.

На практике довольно быстро выясняется, что у Telegram-публикации есть гораздо больше интересных данных, чем просто текст.

У сообщения есть источник, время публикации, просмотры, реакции, комментарии, медиафайлы и другие связанные данные. Если собирать информацию сразу из нескольких каналов, всё это уже хочется не просто выгрузить в таблицу, а нормально связать между собой.

Например, один и тот же пользователь может встречаться сразу в нескольких чатах, а один пост может иметь десятки комментариев и несколько типов реакций. При обычном экспорте такие связи быстро теряются.

Поэтому после первой версии парсера я решил пойти немного дальше и посмотреть, что получится, если относиться к Telegram не как к источнику отдельных сообщений, а как к набору связанных данных.

В этой статье покажу, как я организовал такой сбор, какие данные можно получить из публикаций и что с ними можно делать после парсинга.

Читать далее
Читайте также
НОВОСТИ

ПИШИТЕ

Техническая поддержка проекта ВсеТут

info@vsetut.pro