Откуда берётся статистика каналов MAX и почему у неё нет прошлого
Числовая основа статистики — три открытые величины: число подписчиков, счётчик просмотров публикации и реакции под ней. К ним добавляются метаданные самих публикаций: время выхода, тип вложения, признак пересылки и то, из какого канала она пришла. Из первых считаются охваты и вовлечённость, из вторых — тепловая карта, регулярность, разбивка по форматам и индекс цитирования.
Ничего сверх этого MAX наружу не отдаёт, и это объясняет как то, что мы умеем, так и то, чего не умеем принципиально.
Наблюдения, а не поток
Мы не получаем события в реальном времени. Сборщик периодически обходит каналы и записывает текущие значения — каждое число в базе есть снимок на момент обхода.
Частота обхода зависит от того, входит ли канал в активный пул. Каналы, за которыми следят пользователи, снимаются чаще; остальные — заметно реже.
Отсюда следствие: чем короче интервал, тем больше в нём веса у случайного момента обхода. На дневных и недельных величинах это сглаживается, на попытке поймать точный час притока — нет.
Почему прошлого канала у нас нет
Наблюдения бывают только в настоящем. Если канал не был в сборе, его вчерашние цифры взять неоткуда — MAX не отдаёт исторических рядов, и восстановить их нечем.
Практически это значит, что у только что подключённого канала график начинается с первого наблюдения. Не потому что мы что-то не показываем, а потому что данных за прошлое не существует.
По той же причине мы не можем пересобрать статистику задним числом после изменения формулы: детальные снимки живут ограниченное время, и глубже этого срока пересчитать нечего.
Что мы храним по публикациям
По каждому посту фиксируются просмотры на контрольных точках — к первому часу, к третьему, к суткам — и текущий итог.
Просмотры мы считаем монотонными и берём из наблюдений максимум. Это осознанная модель: она устойчива к пропущенным обходам, но если источник когда-либо скорректирует счётчик вниз, мы этого не увидим. С реакциями иначе — их снимают, и максимум зафиксировал бы пик навсегда, завышая показатель, поэтому реакции берутся по времени последнего наблюдения.
Сводка по набору просмотров переживает детальные снимки: она остаётся, когда исходных наблюдений уже нет.
Где цифры приблизительны
«Просмотры за час» — значение на момент последнего наблюдения внутри первого часа, а не ровно на 60-й минуте. Насколько рано в этот час попадёт наблюдение, зависит от расписания обхода конкретного канала.
Публикации, замеченные поздно. Если пост впервые попал в наблюдение позже часа после выхода, он исключается из расчёта долей: иначе нулевая точка обвалила бы средние.
Подписчики в знаменателях. В сводке за период ER и ERR делятся на текущее число подписчиков, а не на число на момент выхода поста: у быстрорастущего канала это слегка занижает показатели старых публикаций. Дневной ERR устроен иначе — там охват на возрасте 24 часа делится на подписчиков того же дня.
Индекс цитирования считается по каналам каталога: сеть пересылок, которую мы наблюдаем, заведомо неполна. Сама величина — наша взвешенная модель, а не измерение «настоящей цитируемости», которой вне формулы не существует.
Что мы решили не показывать
Процент накрутки. По открытым данным MAX отличить рекламную кампанию от ботов невозможно, и любое число здесь было бы вычислено из предположений, а не измерено. Мы показываем аномалии прироста и называем их аномалиями.
Оценки на данных, которых мало. Ряды и топы при отсутствии данных отдаются пустыми. Со скалярными оценками сложнее: стабильность охвата при нехватке дней возвращается нулём, и по значению этот ноль неотличим от настоящего — поэтому рядом мы показываем, по скольким дням и публикациям посчитан показатель.
Уникальных читателей. Счётчик считает открытия, а не людей, и восстановить одно из другого нельзя.
Где посмотреть формулы
Расчёты всех показателей, окна и пороги собраны на странице методологии. Определения отдельных величин — в глоссарии. Как читать статистику канала по порядку — в руководстве.
Частые вопросы
Через сколько после подключения появится статистика? Первые значения — после первого обхода канала. Динамика становится осмысленной по мере накопления ряда.
Почему у моего канала цифры отличаются от встроенной статистики MAX? Мы работаем по периодическим наблюдениям, мессенджер видит данные напрямую. Разница на коротких интервалах ожидаема, разбор — в отдельной статье.
Можно ли получить историю канала до подключения? Нет. Её не существует в наших данных, и взять её неоткуда.