Вопрос, который мы получаем регулярно, в той или иной формулировке:
DeepSeek стоит копейки за миллион токенов. Почему Reverie не может быть просто бесплатной?
Справедливый вопрос, и он заслуживает настоящего ответа, а не пожатия плечами. Посылка отчасти даже верна: некоторые модели действительно дёшевы в пересчёте на токен, и эта цена публична — её может посмотреть кто угодно.
Чего это число не показывает — так это всего, что должно произойти вокруг вызова модели, чтобы разговор ощущался как разговор. Об этом и пойдёт речь, максимально конкретно.
Мы уже касались этой темы. В тексте про систему кредитов мы разбирали множители и программы наград, в тексте про бесплатные модели — почему запустили их несмотря на всю неопределённость. Но оба останавливались прямо перед вопросом, который всё равно продолжают задавать: куда на самом деле уходят деньги? Это и есть ответ — подробнее, чем мы давали его раньше.
Счёт за модель — это одна строка, а не весь счёт
Когда вы отправляете сообщение, вызов модели — видимая часть. И единственная с опубликованным ценником, поэтому именно она задаёт тон всем разговорам о затратах.
Вот примерная опись того, что ещё участвует в одном обмене репликами в Reverie:
- Сбор и компоновка контекста — определение персонажа, ваша персона, world books, записи долговременной памяти, свежая история и активные плагины нужно достать, отранжировать и уместить в бюджет токенов.
- Суммаризация и сжатие памяти — подробно ниже; это отдельный вызов модели.
- Модерация — и это далеко не только фильтр сообщений. При публикации персонажа его изображения прогоняются через визуальную модель. Жалоба на персонажа, плагин или автора запускает ИИ-разбор, который читает и содержимое, и саму жалобу ещё до того, как на неё посмотрит человек. Обновления плагинов проходят такую же проверку.
- Хранение — каждое сообщение, каждое изображение, каждая карточка персонажа, каждая версия каждой ветки, хранятся и отдаются бессрочно.
- Инфраструктура — серверы приложения, база данных и её реплики, кэши, очереди, CDN, потоковые соединения, удерживаемые открытыми на всё время ответа.
- Мониторинг и наблюдаемость — трекинг ошибок, метрики задержек и отказов, проверки состояния провайдеров и те самые логи, благодаря которым мы узнаём о деградации модели через два часа, а не через два дня.
- Инженерия — люди, которые строят функции, и люди, которых поднимают в три часа ночи, когда у провайдера авария.
- Поддержка и операционка — ответы на тикеты, возвраты, разбор жалоб, апелляции по модерации, комиссии платёжных систем, налоги, бухгалтерия.
И этот список тоже неполный — это лишь то, что легко назвать.
Ничего из перечисленного нет на странице цен провайдера моделей. Всё это — реальные регулярные затраты, и большинство из них растёт вместе с нагрузкой, а не остаётся фиксированным.
А вот что удивляет сильнее всего: вызов модели, который вы видите, — лишь одна часть того, за что мы платим. Вокруг него есть серверы, хранилище, фоновые вызовы модели, которые никому не выставляются, и люди, поддерживающие работу платформы. Эти расходы не исчезают, когда снижается цена токенов одной модели.
Мы не станем выдумывать красивый процент: соотношение плавает вместе с нагрузкой, и называть цифру, которую потом придётся отзывать, не хочется. Неизменно другое: цена API провайдера и стоимость эксплуатации платформы — не одно и то же число. Более дешёвый инференс уменьшает одну часть счёта, но не убирает всё вокруг неё.
Суммаризация: функция, за которую с вас не берут денег
Её стоит выделить отдельно, потому что по замыслу она невидима.
Контекстное окно конечно. Если бы разговор просто рос бесконечно, случилось бы одно из двух: самые старые части тихо выпадали бы из окна и персонаж начинал бы забывать — либо каждое сообщение тащило бы за собой всю историю, становясь всё медленнее и дороже, пока не перестало бы работать вовсе.
Поэтому Reverie суммаризирует. Когда тред становится длинным, система сжимает старую часть в повествовательное резюме — сохраняя состояние отношений, эмоциональную динамику, незакрытые линии — и подаёт в контекст его вместо сырой истории. Это происходит автоматически, в фоне, без вашего запроса.
Сама эта суммаризация — вызов модели. Она читает много токенов и пишет новые. И повторяется на протяжении всей жизни длинного разговора.
Мы не выставляем вам за это счёт. В истории кредитов нет строки «обслуживание памяти». Это поглощается стоимостью работы платформы, потому что брать с пользователей деньги за механизм, который держит их же разговоры связными, показалось нам неправильным разменом.
Та же логика — и у другой фоновой работы: оптимизация контекста, извлечение памяти, проход, который вообще решает, что достойно запоминания.
Вызовы модели, которые происходят, когда вас нет
Часть того, за что мы платим, вообще не привязана к вашему запросу.
Проактивные сообщения — когда персонаж пишет первым — запускаются по расписанию. Задача решает, кому имеет смысл написать, читает достаточно контекста, чтобы понять, что сказать, и пишет то, что стоит открыть. Это вызов модели на каждое сообщение — для разговора, который вы ещё даже не начинали.
Моменты персонажей работают так же: тихо генерируются в фоне, чтобы на странице персонажа появлялось что-то новое — независимо от того, общался ли с ним кто-нибудь в этот день.
Ни то, ни другое не списывает кредиты. Никакой платы, когда персонаж пишет вам первым, и никакой — когда появляется момент. Они идут по нашему расписанию и по нашему счёту.
На этом стоит задержаться, потому что здесь привычная схема переворачивается. За заметной долей наших расходов на модели вообще не стоит пользовательского запроса. Она существует потому, что персонаж, который только отвечает, кажется менее живым, чем тот, кто иногда начинает сам — и эта разница стоит настоящих денег, потраченных авансом, на разговоры, на которые может не быть ответа.
Разбор жалоб тоже относится сюда — и это самый странный случай. Когда кто-то жалуется на персонажа, первый проход проверки — это вызов модели: запущенный посторонним человеком, по контенту, который вы могли опубликовать несколько месяцев назад. Ни с кого из вас плата не берётся. То же самое, когда автор публикует персонажа и его изображения проходят через визуальную модель: проверка идёт по нашему счёту — за работу, о которой мы надеемся, что с ней всё в порядке.
Подсказки ответов, донастройка первой реплики и прочие небольшие проходы за качество — из той же категории. По отдельности дёшевы, работают постоянно, никогда не выносятся в отдельную строку.
Да, мы используем кэширование промптов
Резонный следующий вопрос: если определение персонажа и начало истории не меняются между сообщениями, зачем платить за их отправку каждый раз?
Мы и не платим — там, где можем. Кэширование промптов уже используется, и мы отслеживаем долю попаданий в кэш по каждому запросу именно затем, чтобы заметить, когда наш собственный релиз случайно ломает кэшируемый префикс.
Но доля попаданий не идеальна и никогда идеальной не станет. Запросы маршрутизируются между несколькими провайдерами через OpenRouter, а кэш живёт у того конкретного провайдера, который его создал. Ушло следующее сообщение на другой бэкенд — кэш за ним не пойдёт. К тому же провайдеры реализуют кэширование с разной семантикой, разными минимальными размерами и разным поведением при истечении. И сверх того: те части промпта, которые меняются чаще всего — свежие сообщения, обновлённое резюме, только что включённый плагин — находятся ровно там, где обнуляют хвост закэшированного префикса.
Кэширование ощутимо снижает счёт. Но не обнуляет его, а расчёты, где за базу берут теоретические 100 % попаданий, не переживают встречи с продакшеном.
Мифы и реальность
Миф: DeepSeek стоит очень мало, значит любой ИИ-сайт должен быть почти бесплатным. Реальность: API модели — одна из составляющих стоимости готового продукта. Инференс — часть с публичной ценой; всё, что обёрнуто вокруг него, — часть, которую вы не увидите ни в одном счёте.
Миф: Обнулите счёт за API — и продукт станет дешёвым в эксплуатации. Реальность: Нет. Инфраструктура, хранение, модерация, поддержка и инженерия не исчезают от того, что токены подешевели. Даже если вызов модели при отправке сообщения ничего не стоил бы, эти сопутствующие расходы и описанные выше фоновые вызовы остались бы.
Миф: Суммаризация и память — бесплатные функции, значит и предоставлять их бесплатно. Реальность: Они бесплатны для вас. Суммаризация, проактивные сообщения, моменты персонажей и проходы модерации — всё это вызовы модели, за которые платим мы. Проактивные сообщения и моменты могут запускаться без вашего запроса; модерацию запускает публикация или жалоба, а не тарифицируемое сообщение в чате.
Миф: Раз есть кэширование промптов, повторяющийся контекст бесплатен. Реальность: Кэширование сильно помогает, и мы им пользуемся. Но мультипровайдерная маршрутизация, истечение кэша и постоянно меняющийся хвост каждого промпта означают, что реальные показатели попаданий заметно ниже идеальных.
Миф: Более дешёвое неофициальное API решило бы всё. Реальность: Оно может снизить одно число и поднять другие — задержки, нестабильность, риски для данных или качество ролевой игры. Некоторые неофициальные эндпоинты изменяют запросы или перепродают доступ, полученный без разрешения провайдера. Подробнее — дальше.
Миф: Бесплатные пользователи — издержки, которые платформа терпит. Реальность: Бесплатные пользователи — это то, за счёт чего платформа растёт. Многие становятся авторами и подписчиками. Ограничение не в том, есть ли бесплатное использование, а в том, остаётся ли оно посильным.
Почему мы платим официальные цены
Есть хорошо известный способ сильно уменьшить счёт за модели: неофициальные реверс-инженерные эндпоинты. Источники у них разные. Некоторые перепродают доступ, полученный путями, не разрешёнными провайдером; на злоупотребляющем краю этого рынка часть мощностей финансируется украденными платёжными средствами.
Мы ими не пользуемся и не собираемся. Такие каналы существенно урезали бы наши расходы на модели. Мы их посмотрели и сказали «нет» — по двум разным причинам.
Первая: это попросту неправильно. Если доступ получен или оплачен мошенническим путём, его перепродажа — это кража с парой дополнительных шагов, насколько бы нормальной она ни стала в отдельных углах отрасли. Мы не станем финансировать платформу через такие каналы, а потом писать тексты про прозрачность.
Вторая: это ухудшает продукт — и вот это пользователи чувствуют напрямую, даже никогда не узнав, откуда пришёл ответ:
- Растут задержки. Реверс-маршруты добавляют промежуточные звенья, стоят в очереди за общими аккаунтами и режут скорость непредсказуемо. Разница между ответом за две секунды и ответом за двенадцать — это разница между разговором и отправкой формы.
- Они подмешивают собственные системные промпты. Многие неофициальные эндпоинты оборачивают запрос в свой дефолтный системный промпт перед передачей дальше. Этот промпт невидим и нам, и вам, и он конфликтует с описанием персонажа. Голос сглаживается. Персонаж выпадает из тона, отказывается от того, от чего не должен, или сползает к манере обобщённого ассистента. Качество ролевой игры страдает первым — и это тот тип регрессии, который тяжелее всего отлаживать, когда промпт не в ваших руках.
- Они исчезают без предупреждения, как только провайдер закрывает лазейку, забирая с собой вашу рабочую конфигурацию.
- Версии моделей молча подменяются, и персонаж, который вчера звучал правильно, сегодня отвечает иначе без объяснимой причины.
- За ваши данные никто не отвечает. Ни соглашения об обработке, ни политики хранения, ни адресата для вопроса.
Reverie хранит разговоры, в которые люди по-настоящему вложились. Пропускать их через анонимного посредника ради экономии — не тот размен, на который мы готовы. Официальные провайдеры дороже. Зато они берут трубку — и не переписывают инструкции вашего персонажа по дороге.
Как этот бизнес устроен на самом деле
Команда небольшая, и Reverie — не высокодоходный бизнес.
Есть структурная причина, по которой цена сообщения в кредитах не равна стоимости токенов этого сообщения, и её стоит понимать. Инференс — единственная часть разговора, которую можно измерить на каждое сообщение. У всего остального в этом тексте — суммаризации, проактивных сообщений, проходов модерации, хранилища, серверов, людей — нет естественной единицы, к которой можно привязать счёт. Никто не выставит вам счёт за «фоновую задачу, которая решила, что вашему персонажу стоит запомнить».
Значит, единственное измеримое вынуждено отвечать не только за себя. В этом и весь смысл кредитной системы вместо прямой переброски токенов: если бы сообщение стоило ровно свои токены и ничего сверх, всё вокруг него работало бы из ниоткуда — а всё вокруг него и есть большая часть.
Мы не пытаемся максимизировать прибыль. Но и работать в вечный убыток не можем: платформа, у которой кончились деньги, просто перестаёт существовать — а для всех, кто ею пользуется, это заметно худший исход, чем кредитная система с лимитами.
Между этими двумя ограничениями мы намеренно выбрали сторону, которая ближе к пользователям. Сейчас приоритет — сделать лучший продукт, какой сможем, до официального запуска, а не закручивать монетизацию. Это значит: сначала функции и качество, потом оптимизация конверсии. И значит, что текущая экономика мягче, чем была бы, если бы выручка стояла первым пунктом.
Бесплатные кредиты — тоже реальные затраты
Способов пользоваться Reverie без оплаты довольно много:
- ежедневная награда за отметку входа
- ежедневный розыгрыш, который идёт сверху
- достижения
- официальные баунти
- награды авторам
- реферальные награды и комиссия, когда приглашённый покупает кредиты
- награды за репост
- промокоды и подарочные карты
- награда за годовые итоги (Wrapped)
- вклад сообщества, включая помощь в продвижении Reverie
О розыгрыше стоит сказать конкретно, потому что именно его считают декорацией. В нём пять уровней — 1 000 / 2 000 / 8 000 / 30 000 / 80 000 кредитов — с весами 50 / 30 / 15 / 4 / 1. Перемножьте — и математическое ожидание выйдет около 4 300 кредитов за розыгрыш. На пользователя, в день, и это сверх награды за отметку входа. Если сложить всё вместе, бесплатный уровень — не символический жест. База за отметку входа — 10 000 кредитов, бонусы за серию идут сверху: +5 000 на третий день, +8 000 на седьмой, +50 000 на тридцатый, +200 000 на сотый, — а розыгрыш ложится поверх всего этого. На седьмой день ожидаемая сумма без трат составляет около 22 300 кредитов; фактическая сумма зависит от результата розыгрыша.
Насколько этого хватает на самом деле
Здесь уместен честный вопрос: что можно купить примерно на 22 300 кредитов — и мы этого никогда толком не объясняли.
Кредиты списываются как токены × множитель модели. Множители текстовых моделей лежат в диапазоне от 0 до 2, и селектор модели показывает каждый из них ещё до отправки.
Недооценивают обычно другое: количество токенов не фиксировано, оно растёт вместе с разговором. Новый чат отправляет пару тысяч токенов: персонаж, ваша персона, немного истории. Давний — гораздо больше, потому что свежая часть переписки едет с каждым ходом. Мы ограничиваем сырую историю примерно 10 000 токенов, а всё более старое уходит в резюме — ровно ради этого суммаризация и существует: без такого потолка полугодовой разговор пересылал бы всю свою историю на каждом сообщении, и стоимость хода росла бы без предела.
На практике ход в новом чате на модели 0,3× стоит несколько сотен кредитов, а тот же ход в глубине долгого разговора на модели 1× — десять тысяч и больше. Одна платформа, один день, разница больше чем на порядок.
Этот диапазон и есть честный ответ на вопрос «надолго ли хватает кредитов». Если они уходят быстрее, чем вы ожидали, вы, скорее всего, глубоко в длинном разговоре на дорогой модели — и теперь знаете, какую из двух ручек крутить.
Сам экран отметки входа тоже делает вызов модели. То приветствие, которое персонаж пишет вам при входе, — не шаблон: оно генерируется, кешируется раз в день на персонажа и ограничено по количеству за сутки, чтобы не разрасталось. Это всё равно инференс, за который платим мы, — на странице, весь смысл которой в раздаче кредитов.
Есть ещё одна деталь о том, как тратятся кредиты, и её место здесь: бесплатные кредиты всегда расходуются раньше платных. Если у вас есть и те и другие, первым пустеет кран. Так задумано — купленные кредиты остаются с вами дольше — но это же означает, что расход каждый раз в первую очередь принимает на себя бесплатный уровень.
Каждый из них — реальный расход. Когда вы забираете ежедневную награду и тратите её на разговор, провайдер модели всё так же выставляет нам счёт, серверы всё так же работают, суммаризация всё так же выполняется. Кредиты бесплатны для вас; вычисления за ними не бесплатны ни для кого.
Мы всё равно финансируем эти программы, потому что бесплатный доступ — то, как большинство людей понимает, подходит ли им эта платформа, и потому что заметная доля сегодняшних бесплатных пользователей завтра становится авторами и подписчиками. Но работает это, только пока бесплатная часть остаётся в пределах того, что платформа способна нести. Когда цифры меняются, программы корректируются — не потому что нам хочется давать меньше, а потому что раздавать больше, чем выдерживаешь, заканчивается тем, что раздавать становится нечего.
Снизятся затраты — снизится и цена
Эта часть — обязательство, а не описание.
Цены на модели со временем падают. Кэширование улучшается. Инфраструктура становится эффективнее. Наш собственный код всё меньше тратит токены впустую — большая часть тихой работы последних месяцев над сборкой контекста и суммаризацией была именно об этом.
Когда мы находим устойчивый способ снизить операционные затраты, мы сильно предпочитаем передать это пользователям, а не записать в маржу. Более дешёвые модели, лучшие множители, более щедрые награды. Мы делали так неоднократно и хотели бы продолжать: платформа, которой люди могут позволить себе пользоваться много, ценнее для нас, чем чуть лучший спред.
Ключевое слово здесь — устойчивый. Передать экономию, которая окажется временной, — значит потом её забрать, а это хуже, чем не давать вовсе.
За что вы платите на самом деле
Тратя кредиты в Reverie, вы не покупаете токены у провайдера модели с наценкой.
Вы платите за разговор, который помнит, что было; который остаётся связным дальше той точки, где сырой контекст уже развалился бы; который работает на провайдерах, отвечающих за свою доступность и за ваши данные; который забэкаплен и экспортируем; и который заметно улучшается каждые несколько недель, потому что над ним работают люди на полную ставку.
Вам всё ещё может хотеться больше бесплатных кредитов. Это совершенно нормально, и нам самим хотелось бы давать больше — мы работаем над этим со стороны затрат, а не со стороны прайс-листа.
Но нам важнее, чтобы вы понимали, почему ответ не так прост, как число на странице цен провайдера моделей.
Есть вопросы по конкретному списанию или кажется, что мы где-то ошиблись в цифрах? В истории кредитов видно реальное количество токенов за каждым сообщением, а наш Discord открыт. Спорить о настоящих числах нам интереснее, чем о смутных впечатлениях.
Приведённые здесь суммы наград и множители кредитов отражают состояние платформы на момент публикации и корректируются вслед за изменением затрат. Актуальные значения всегда видны в приложении.

