Не советы блогеров, а то, что опубликовали сами компании: статья инженеров YouTube, инженерный блог Meta и внутренний документ TikTok, попавший в The New York Times. Где данные старые или неполные — помечено.
У всех трёх площадок архитектура одинаковая по смыслу — многоступенчатая воронка. Перебрать миллиарды роликов тяжёлыми моделями невозможно, поэтому сначала грубый отбор дешёвыми методами, потом всё более дорогие модели на всё меньшем числе кандидатов.
Главное следствие: ролик не «оценивается по качеству». Модель предсказывает вероятность, что конкретный человек совершит конкретное действие, и складывает эти вероятности с весами. Соревнование идёт не за красоту, а за предсказуемость реакции.
Ковингтон, Адамс и Саргин описали систему как две нейросети. Первая формулирует задачу как «угадать следующий просмотр» среди миллионов роликов и отбирает кандидатов. Вторая ранжирует отобранное.
В ранжирующей модели положительные примеры взвешены длительностью просмотра. Это прямое следствие проблемы кликбейта: если учить модель на кликах, она начинает продвигать обманки. Взвешивание по времени делает обманку невыгодной — клик есть, времени нет, вес близок к нулю.
Статье десять лет, архитектура с тех пор менялась. Но принцип «целевая метрика — время, а не клик» остался: именно он объясняет всю нынешнюю логику площадки.
Для Shorts площадка отдельно называет сигнал «viewed vs swiped away»: как часто зритель останавливается вместо того, чтобы смахнуть. Пока ролик не прошёл этот барьер, остальные метрики роли не играют. Дальше — средняя длительность и доля досмотра.
Раздача ступенчатая: небольшая пробная порция показов, проверка поведения, затем расширение.
P — предсказанная вероятность действия (лайк, комментарий, запуск). V — ценность этого действия для площадки, то есть назначенный вес. E — ожидаемое время просмотра.
Смысл: система считает ожидаемую ценность показа этого ролика этому человеку. Обрати внимание, что время просмотра входит отдельным слагаемым — не как множитель поверх, а как самостоятельная величина.
В документе названы четыре задачи: сиюминутная ценность для пользователя, его удержание в долгую, ценность для автора (чтобы авторы не уходили) и здоровье площадки в целом. Последние две объясняют, почему иногда продвигают то, что не максимизирует просмотры прямо сейчас.
Рекомендательная система ByteDance обновляет параметры модели с интервалом около минуты, а не раз в сутки, как принято в пакетном обучении. Прирост качества от этого авторы оценивают в 14–18 процентов.
Практическое следствие: судьба ролика на TikTok решается за часы, а не за дни. Система почти мгновенно учитывает, как на него отреагировали первые зрители.
Meta публикует структуру напрямую: складываются вероятности положительных действий с весами, и вычитается вероятность отрицательной реакции — «показывать меньше такого».
Это принципиально отличает Instagram от остальных в практическом смысле: раздражение зрителя не просто «не помогает», оно прямо уменьшает итоговый балл. Кликбейт, который бесит, здесь наказывается арифметически.
Отбор кандидатов из миллиардов → ранняя ранжировка тысяч лёгкой моделью → поздняя ранжировка около сотни тяжёлой моделью → финальная переранжировка по правилам площадки.
Для Reels главными названы время просмотра и отправки в личные сообщения в пересчёте на охват. Репост другу ценится существенно выше лайка, потому что это сигнал реальной ценности, а не рефлекса.
Всё описанное выше — каскад из отбора и нескольких ранжировок — сейчас уходит. На смену идёт генеративная рекомендация: единая модель, которая вместо перебора кандидатов сразу порождает то, что показать. Ролики при этом превращаются в семантические токены — смысловые коды содержания, а не просто номера в базе.
Это не теория: система OneRec работает в продакшене Kuaishou — китайской площадки коротких видео с сотнями миллионов ежедневных пользователей. Заявленный прирост времени просмотра — 1,6%, а в сервисной части до 21% по обороту. Похожее внедряют Spotify, Pinterest, Alibaba и Meituan.
В старой схеме ролик описывался поведением: кто досмотрел, кто лайкнул. В новой он описывается смыслом — содержание кодируется в токены, и близкие по смыслу ролики получают близкие коды. Система начинает различать не «что кликнули», а «про что это».
Следствие для фермы: пересказ чужого содержания становится опознаваемым на уровне смысла, а не только по картинке и звуку, как в нынешней проверке авторских прав. Одновременно растёт цена действительно своего содержания — его нечем заменить, потому что у него нет семантических близнецов.
Оговорка. Всё перечисленное — Kuaishou, Spotify, Pinterest. Публичных подтверждений, что YouTube, TikTok или Instagram перешли на такую архитектуру, нет. Но направление индустрии видно по публикациям всех крупных игроков сразу, и обычно это вопрос года-двух.
| Площадка | Главный сигнал | Что делать в ролике |
|---|---|---|
| YouTube Shorts | остановился или смахнул | вкладывать всё в первый кадр и первые две секунды |
| TikTok | доля досмотра и пересмотры | короче, плюс незаметная петля конца в начало |
| Instagram Reels | пересылки в личные | давать повод отправить конкретному человеку |