Платформа A/B-тестирования Trisigma от Авито выходит на рынки Армении, Грузии, Казахстана и Узбекистана. Руководитель направления Trisigma в Авито Виталий Черемисинов рассказал FinTech & Retail Eurasia, как компаниям проверять изменения в цифровых продуктах, если покупатель переходит из Telegram на сайт, а платит в офлайне, и как оценить реальный эффект рассрочки и ИИ-помощников.
FinTech & Retail Eurasia: Почему для выхода Trisigma вы выбрали именно эти страны? Чем различаются задачи компаний на этих рынках и какие продукты вы предлагаете тестировать в каждой стране в первую очередь?
Виталий Черемисинов: Мы запускаемся сразу в четырех странах: Армении, Грузии, Казахстане и Узбекистане. В Ташкенте проводим первый митап в СНГ, потому что здесь очень много компаний, которые прямо сейчас строят свои цифровые продукты. Им особенно важно быстро понимать, что работает, а что нет. На рынке в Узбекистане видим большой потенциал, но планируем также приезжать знакомиться в другие страны.
Казахстан и Узбекистан — два очень разных рынка. Отдельные сегменты внутри них сильно различаются между собой. Давайте посмотрим конкретнее на примере электронной коммерции. Казахстан — зрелый рынок. По данным Бюро национальной статистики, онлайн-торговля занимает там больше 14% розницы, и 86% всей электронной коммерции проходит через маркетплейсы. Клиент уже привык покупать онлайн, поэтому главный вопрос для бизнеса — как его удержать и заставить возвращаться. Узбекистан — рынок, который растёт на глазах. Онлайн-торговля занимала в 2025-м году пока около 5% розницы. Здесь задачи другие: привлечь нового клиента, сформировать новые привычки.
Что тестировать первым? Представьте, что вы открываете кофейню в новом городе. Можно сварить тот же кофе, что дома, и надеяться, что людям понравится. А можно в первую неделю предложить два рецепта и посмотреть, какой заказывают чаще. Мы про второй подход, но в цифровых продуктах. Сейчас они меняются постоянно: новые экраны, новые сервисы, ИИ-ассистенты. Выигрывает не тот, у кого самая смелая идея, а тот, кто быстрее всех понимает, какая идея работает. Эксперимент превращает каждое изменение в интерфейсе из ставки вслепую в информированное действие на основе знаний о своём клиенте. На активно развивающихся рынках это очень ценный фактор, который помогает успешнее конкурировать.
FinTech & Retail Eurasia: В Узбекистане клиент может начать покупку в Telegram, продолжить на сайте и оплатить при получении. Как проверять изменения в такой цепочке? Можно ли достоверно оценить эксперимент, если часть действий покупателя происходит за пределами приложения?
Виталий Черемисинов: Суть A/B-теста в том, что аудитория случайным образом делится на группы. Контрольная группа видит текущую версию продукта, тестовая — измененную. Затем мы сравниваем ключевые метрики и понимаем, дало ли изменение эффект.
С точки зрения эксперимента Telegram — один из источников трафика, например, как контекстная реклама. Пользователь переходит по ссылке из канала и попадает на сайт или в приложение. Именно там мы и проверяем изменения.
Работать с этим трафиком можно двумя способами. Первый — после эксперимента выделить пользователей, пришедших из Telegram, в отдельный сегмент и проанализировать результаты по нему. Второй — запускать эксперимент только на этой аудитории: одна часть видит одну версию сайта, другая — другую.
При этом тестировать изменения внутри самого Telegram сегодня не может ни одна платформа. API мессенджера позволяет управлять каналом или чатом, но не даёт рандомизировать аудиторию, в том числе в ботах. Сравнить, например, два варианта публикации в канале пока можно только вручную.
FinTech & Retail Eurasia: Как банкам и платежным сервисам Узбекистана тестировать процесс первой регистрации? Как определить, на каком этапе человек отказывается от подключения — при вводе данных, идентификации или привязке карты — и какие изменения действительно помогают?
Виталий Черемисинов: Это классический эксперимент. Новые пользователи случайным образом делятся на две группы: одни проходят регистрацию по-старому, другие — по-новому. Каждый остаётся в своей группе до конца теста, так что сравнение получается честным.
Регистрацию удобно представить как воронку. На каждом шаге кто-то уходит, и до конца доходят не все. Главный вопрос — где именно люди теряются. Если большинство уходит на анкете, нужно смотреть, в каких полях они ошибаются и что им непонятно.
Дальше появляются гипотезы. Путаются в полях введения паспортных данных? Помогут подсказки прямо в форме или строка вроде «осталось два шага, это займет пару минут». Уходят, не начав заполнять? Значит, предложение недостаточно убедительное: стоит понятнее рассказать про сервис. Каждую такую идею можно проверить экспериментом и оставить только то, что действительно работает.
И не стоит ограничиваться цифрами. Поговорите с пользователями: они часто сами скажут, что им мешает. Лучшие гипотезы рождаются на стыке аналитики и живых интервью.
FinTech & Retail Eurasia: Как учитывать узбекский, казахский и русский языки при проведении экспериментов? Нужно ли отдельно тестировать тексты, навигацию и объяснение финансовых условий для каждой языковой аудитории?
Виталий Черемисинов: Когда продукт работает сразу на трёх языках, у команды почти всегда возникает вопрос: достаточно просто перевести интерфейс или под каждую аудиторию нужно делать что-то своё — другие тексты, другой порядок шагов, другое объяснение условий?
Начинать стоит с аналитики. Она показывает, ведут ли себя пользователи на разных языках по-разному. Если на казахском, узбекском и русском люди одинаково проходят регистрацию и одинаково понимают условия, хватит хорошего перевода. Если же, например, на одном языке заметно чаще бросают анкету на одном и том же шаге, это сигнал, что что-то не так с текстом или подачей.
Дальше появляется гипотеза: допустим, условия рассрочки на этом языке сформулированы слишком сложно. И её уже проверяют экспериментом. Половина пользователей видит старый текст, половина — новый, и становится понятно, помогло ли изменение.
При этом важно помнить о цене. Первое желание — сделать под каждый язык свою версию продукта. Но каждая такая версия — это не разовая работа, а постоянные расходы: её нужно обновлять при каждом изменении, проверять, поддерживать в аналитике. Содержать три версии не всегда выгодно. Легко оказаться в ситуации, когда их поддержка стоит дороже, чем дополнительная выручка, которую они приносят. Поэтому основу продукта — экраны, шаги, навигацию — лучше держать общей, а адаптировать и тестировать то, что человек читает: формулировки и объяснения условий.
FinTech & Retail Eurasia: Как банкам Казахстана проверять востребованность нефинансовых сервисов в своих приложениях? Как отличить функцию, которая действительно удерживает клиента, от той, которой пользуются только ради бонуса?
Виталий Черемисинов: Нефинансовые сервисы в банке — это чаще всего лайфстайл: авиабилеты, билеты на концерты, бронирование отелей. Их запускают, чтобы клиент решал повседневные задачи внутри банка и не уходил к другим.
Поэтому главная метрика здесь действительно — удержание: насколько регулярно человек возвращается в приложение. Как понять, работает ли сервис на удержание? Через A/B-тест. Одной группе клиентов функцию включаем, другой — нет, и сравниваем, как меняется их поведение. Стоит проверять и обратный эффект — каннибализацию. Может оказаться, что чем больше в приложении лайфстайла, тем реже им пользуются как банком — например, потому что пользователю неудобно добраться до основной функции, за которой он пришел в приложение.
FinTech & Retail Eurasia: Как бизнесу в Узбекистане и Казахстане оценивать реальную эффективность рассрочки? Как понять, создает ли она дополнительные продажи или лишь переводит в рассрочку покупки, которые клиент и так оплатил бы полностью?
Виталий Черемисинов: Проверить это довольно просто. Сервисы рассрочки, или BNPL (buy now, pay later — «купи сейчас, плати потом»), обычно подключаются к сайту как готовый блок кода, и на странице товара появляется виджет. Дальше классический A/B-тест: половине покупателей показываем рассрочку, половине нет, и сравниваем, в какой группе больше покупок.
Как правило, рассрочка помогает человеку решиться на первую покупку, а потом растут и повторные продажи: привлечённые так клиенты возвращаются снова. Для онлайн-торговли это особенно важно: на первом заказе магазин обычно не зарабатывает, экономика сходится со второго-третьего.
Со скидками история сложнее. Они легко дают всплеск продаж, но у этого есть обратная сторона: покупатель привыкает, что полная цена — это переплата, и начинает ждать следующей акции. А когда бизнес пытается от скидок отказаться, люди уже не готовы платить полную цену.
Скидки по этой причине тестируют довольно часто, особенно порог — минимальный размер скидки, при котором покупатель действительно принимает решение. Может оказаться, что скидка 10% работает почти так же, как 20%. Тогда вторая половина скидки — просто потерянная выручка, а заодно и лишний шаг к тому, чтобы приучить покупателя к низким ценам.
FinTech & Retail Eurasia: Насколько результаты теста в Ташкенте или Алматы применимы к другим городам и регионам? Как учитывать различия в качестве связи, доступности доставки и привычках покупателей, не дробя аудиторию на слишком маленькие группы?
Виталий Черемисинов: Поведение пользователей в столице и в регионах может различаться. Разный доступ к интернету, разные устройства, разный уровень доходов. В столице почти у всех современные смартфоны, а в регионах часть людей всё ещё пользуется кнопочными телефонами.
Чтобы понять, как конкретно эти различия влияют на продукт, можно запустить эксперимент с разделением аудитории по географии: например, адаптировать под регион предложение, описание услуг, визуальную подачу. Если в каком-то регионе пользователей слишком мало для надёжного результата, отдельно его тестировать не нужно: маленькая выборка искажает результат. Лучше укрупнить географию, например объединить несколько соседних регионов в одну группу.
FinTech & Retail Eurasia: Как казахстанскому или узбекскому ритейлеру связать эксперимент в приложении с покупкой в обычном магазине? Например, как определить, увеличили ли персональные предложения общую выручку или просто переместили продажи из одного канала в другой?
Виталий Черемисинов: Чтобы связать эксперимент в приложении с покупкой в обычном магазине, нужен общий идентификатор клиента. В ритейле это может быть карта лояльности. Клиент показывает её на кассе, и покупку в магазине можно связать с его профилем в приложении.
Представьте двух покупателей. Азиз получил в приложении персональную скидку на одежду и обувь, а Бахтиёр — нет. За месяц Азиз купил товаров в приложении на 100 тысяч сумов, а Бахтиёр — только на 50.
Кажется, что скидка сработала. Но смотрим, что было в обычном магазине. Бахтиёр купил там вещей ещё на 50 тысяч, а Азиз — ни на сколько. Получается, каждый потратил по 100 тысяч. Азиз не стал покупать больше, он просто стал покупать в другом месте.
Поэтому считать нужно всё вместе: приложение плюс магазин. Выросла общая сумма — предложение работает. Не выросла — продажи могли просто «переехать» из одного канала в другой или снизиться.
Отдельная и очень интересная тема — эксперименты в самих магазинах. Здесь можно тестировать прикассовую зону, цены, выкладку товаров, навигацию по залу. Но покупателей в офлайне нельзя случайно разделить на группы: на входе не поставишь два турникета, которые отправят одного человека в одну версию магазина, а другого в другую. Поэтому делят не аудиторию, а сами магазины: одни работают по-старому, в других пробуют новое. Такие эксперименты сложнее, но они тоже дают надежный результат.
FinTech & Retail Eurasia: Что вы предложите местному банку или интернет-магазину, у которого недостаточно пользователей для классического A/B-теста? Сколько времени разумно ждать результата и когда лучше выбрать другой способ проверки гипотезы?
Виталий Черемисинов: Если пользователей мало, есть два варианта. Первый — проводить A/B-тест дольше, чтобы накопить достаточно данных. Второй — использовать специальные методы, которые помогают получить более точный результат на меньшем объёме данных.
Один из таких методов — CUPED. Он учитывает, как пользователи вели себя до начала эксперимента. Например, если один человек и раньше покупал много, а другой — мало, метод принимает это во внимание и не путает обычные различия между людьми с эффектом от новой функции. За счёт этого в данных становится меньше случайного разброса, и результат теста можно увидеть быстрее.
FinTech & Retail Eurasia: Как проверять качество ИИ-помощников на узбекском и казахском языках? Как оценивать не только скорость ответа, но и точность объяснения тарифов, условий рассрочки и банковских услуг?
Виталий Черемисинов: Проверять качество ИИ-помощника на любом языке нужно на реальных вопросах пользователей. Например: «какой у меня тариф?», «сколько я заплачу по рассрочке?», «есть ли комиссия?». Для каждого такого вопроса заранее должен быть известен правильный ответ — и дальше мы проверяем, насколько точно его даёт ИИ.
Дальше можно тестировать разные части системы. Промпт — это инструкция для модели: можно сравнивать разные формулировки и смотреть, с какой она отвечает точнее. RAG — это поиск информации в базе знаний компании перед ответом: здесь проверяем, нашёл ли ассистент правильные условия тарифа или рассрочки и не исказил ли их. Eval — это сама система оценки: набор вопросов и критериев, по которым мы регулярно проверяем качество ответов.
Если есть две версии ассистента, их можно сравнивать через A/B-тест: части пользователей показывать одну версию, части — другую и смотреть, где меньше ошибок и выше удовлетворенность. Существует метод Team Draft Interleaving — когда варианты от двух алгоритмов показываются пользователю вперемешку и по его выбору оценивают, какой работает лучше.
То есть принцип простой: берём реальные вопросы, знаем правильный ответ, проверяем точность ИИ и сравниваем разные версии системы между собой.
FinTech & Retail Eurasia: Как будет устроено внедрение Trisigma с учетом требований к персональным данным в Узбекистане и Казахстане? Какие вычисления можно выполнять внутри инфраструктуры банка и нужен ли вашей команде доступ к клиентским данным?
Виталий Черемисинов: Trisigma можно развернуть on-premise — на серверах самого клиента или в его облачной инфраструктуре. В этом случае данные остаются внутри инфраструктуры компании: Trisigma не получает к ним доступ и не хранит их у себя. Такой формат позволяет соблюдать требования к локальному хранению персональных данных.
FinTech & Retail Eurasia: Какова полная стоимость внедрения для компании из Узбекистана или Казахстана? Помимо лицензии, какие ресурсы потребуются на интеграцию и подготовку данных и по каким результатам через полгода можно будет судить об окупаемости?
Виталий Черемисинов: Стоимость зависит от масштаба и сложности внедрения и рассчитывается индивидуально под задачи конкретного бизнеса. Собственная разработка и поддержка аналогичной платформы обычно обходится дороже: на примере российского рынка, в среднем это от 50 млн руб. в год. На этих стартовых значениях готовое решение получается в среднем на порядок дешевле собственной разработки.
Для внедрения со стороны клиента в идеале должны быть настроены кликстрим и хранилище данных, а в команде нужны разработчики и аналитики. При этом команда Trisigma активно участвует во внедрении, помогает с интеграцией, конфигурацией, доработками под конкретные задачи.
Экономический эффект можно оценивать по двум направлениям: сколько компания экономит по сравнению с разработкой и поддержкой собственной платформы и насколько быстрее команды начинают проверять продуктовые гипотезы. Дополнительно можно считать бизнес-эффект от изменений, которые были запущены по результатам экспериментов.
