我们经常会收到这样一个问题,措辞各有不同:
DeepSeek 每百万 token 才那么点钱,Reverie 为什么不能直接免费?
这是个合理的问题,值得一个认真的回答,而不是一句敷衍。它的前提甚至有一部分是对的:确实有些模型的单价非常低,而且价格是公开的,谁都能查到。
那个数字没有展示的,是为了让一次对话真的像一次对话,模型调用之外还必须发生的所有事情。这篇文章就来讲这些。
这个话题我们之前提过。关于积分系统的那篇讲了倍率和奖励机制,关于免费模型的那篇讲了我们为什么明知不确定也要上线它们。但两篇都停在了大家真正一直在问的那个问题之前:钱到底花到哪去了。这篇就是那个答案,而且比我们以前讲得更细。
模型账单只是其中一行,不是整张发票
当你发出一条消息时,模型调用是看得见的那部分。它也是唯一有公开标价的那部分——所以关于成本的讨论总是被它主导。
下面大致列一下,在 Reverie 上完成一次交互还牵涉到什么:
- 上下文的检索与拼装 —— 角色设定、你的人格、世界书、长期记忆条目、最近的对话记录、以及所有启用的插件,都需要被取出、排序,并塞进有限的 token 预算里。
- 摘要与记忆压缩 —— 下面会详细讲;它本身就是一次模型调用。
- 审核 —— 而且远不只是消息过滤。公开一个角色,它的图片要过一遍视觉模型;举报一个角色、一个插件或一位创作者,会触发一次 AI 初审,在任何人工介入之前把内容和投诉一起读一遍;插件的每次版本更新也走同样的流程。
- 存储 —— 每一条消息、每一张图片、每一张角色卡、每一个分支的每一个版本,都要长期保存并随时可读。
- 基础设施 —— 应用服务器、数据库及其副本、缓存、队列、CDN,以及每次回复期间持续保持的流式连接。
- 监控与可观测性 —— 错误追踪、延迟与失败率指标、供应商健康检查,以及那些让我们在两小时内、而不是两天后发现某个模型开始劣化的日志。
- 工程 —— 构建功能的人,以及凌晨三点供应商故障时被叫醒的人。
- 客服与运营 —— 处理工单、退款、举报、审核申诉,还有支付手续费、税务和记账。
这份清单也并不完整——它只是其中容易点名的那部分。
这些没有一项会出现在模型供应商的价目表上。它们全都是真实的、持续发生的成本,而且大多数会随使用量增长,而不是保持固定。
而最让人意外的一点是:你看得见的那次模型调用,只是我们需要承担的成本之一。 它周围还有服务器、存储、没有向任何人收费的后台模型调用,以及维持平台运转的人。某个模型的 token 单价下降,并不会让这些成本消失。
我们不打算为此编一个漂亮的百分比:这个比例会随用量浮动,我们不想报一个日后还要收回的数字。但有一件事是稳定的:供应商的 API 单价和平台的运营成本不是同一个数字。推理价格下降,会减少账单中的一部分,却不会移除包围在它周围的一切。
摘要:一个你从未被单独收费的功能
这一项值得单独拿出来讲,因为它在设计上就是隐形的。
上下文窗口是有限的。如果一段对话就这么无限增长下去,只会出现两种结果:要么最早的部分悄悄滑出窗口,你的角色开始遗忘;要么每条消息都携带全部历史,越来越慢、越来越贵,直到彻底跑不动。
所以 Reverie 会做摘要。当一段对话变长,系统会把较早的部分压缩成一段叙述性摘要——保留关系的当前状态、情绪走向、尚未收束的线索——然后把它而不是原始记录送进上下文。这一切自动发生在后台,你不需要提出请求。
而这个摘要本身就是一次模型调用。它要读进大量 token,再写出新的 token。在一段长对话的生命周期里,它会反复发生。
我们不会为此向你收费。 你的积分记录里没有一项叫"记忆维护"。它被算进了平台的运营成本里——因为让用户为"维持自己对话连贯性的机械装置"付费,在我们看来是个错误的取舍。
同样的逻辑也适用于其他后台工作:上下文优化、记忆抽取,以及判断什么内容值得被记住的那一道处理。
你不在的时候发生的那些模型调用
我们付费的一部分,根本就不挂在你的任何一次请求上。
主动消息 —— 角色先来找你 —— 是按计划任务跑的。一个任务判断联系谁合适,读进足够的上下文来决定说什么,然后写出一条值得点开的消息。这是每条消息一次模型调用,而对应的对话你甚至还没开始。
角色 moments 同理:在后台安静地生成,好让角色的主页上有新东西,无论那天有没有人在跟他聊天。
这两者都不扣积分。角色主动给你发消息时不收费,moment 出现时也不收费。它们跑在我们的计划表上,也记在我们的账上。
这一点值得停下来想想,因为它把通常的心理模型反了过来:我们模型开销中相当一部分背后并没有用户请求。它之所以存在,是因为一个只会回答的角色,比一个偶尔会主动开口的角色显得更没有生命——而这个差别要花真金白银,还是预先花出去的,花在那些可能根本不会有回复的对话上。
审核初筛也属于这一类,而且是其中最奇特的一种:当有人举报某个角色时,第一道审查是一次模型调用——由一个陌生人触发,针对的可能是你几个月前发布的内容。你们两个人都不会被扣费。创作者公开角色、图片过视觉模型时也一样:这次检查记在我们账上,而我们还希望它的结论是"没问题"。
推荐回复、首条回复调优,以及其他细小的质量处理,都属于同一类。单次很便宜,一直在跑,从不单列。
是的,我们用了提示词缓存
一个合理的追问:既然角色设定和早期对话在两条消息之间并没有变化,为什么每次都要重新付费传输?
在能做到的地方,我们确实没有。提示词缓存已经在使用中,而且我们会逐请求追踪缓存命中率——正是为了在某次上线不小心破坏了缓存前缀时能立刻发现。
但命中率并不完美,也永远不会完美。请求会通过 OpenRouter 路由到多个供应商,而缓存是跟着创建它的那个具体供应商走的。下一条消息被路由到另一个后端,缓存不会跟过去。不同供应商的缓存语义、最小长度、过期行为也各不相同。除此之外,提示词中变动最频繁的部分——最新的几条消息、更新过的摘要、刚被打开的插件——恰好就位于会让缓存前缀尾部失效的位置。
缓存确实显著降低了账单,但它不能消除账单。把理论上的 100% 命中率当作基准线,算出来的数字经不起生产环境的检验。
误区 vs 事实
误区: DeepSeek 那么便宜,所以每个 AI 网站都该几乎免费。 事实: 模型 API 只是交付一个成品所需成本中的一个组成部分。推理是有公开报价的那部分;包裹在它周围的一切,才是你在任何发票上都看不到的部分。
误区: 只要把 API 账单压到零,产品就变得很便宜。 事实: 并不会。token 变便宜,并不会让基础设施、存储、审核、客服和工程消失。即使消息发出时的那次模型调用完全免费,这些外围成本,以及前面提到的后台模型调用,仍然存在。
误区: 摘要和记忆是免费功能,所以提供它们也是免费的。 事实: 它们对你免费。摘要、主动消息、角色 moments 和审核初筛都是我们在付费的模型调用。主动消息和 moments 可以在你没有发出请求时运行;审核则由发布或举报触发,而不是一条可计费的聊天消息。
误区: 有了提示词缓存,重复的上下文就免费了。 事实: 缓存帮助很大,我们也在用。但多供应商路由、缓存过期、以及每个提示词中不断变化的尾部,让真实命中率离完美还有很远的距离。
误区: 用更便宜的非官方 API 就能解决一切。 事实: 它可能让一个数字变小,却让另外几个变大——延迟、稳定性、数据风险或角色扮演质量。一些非官方接口会改写请求,或者转售未经供应商授权取得的访问权限。下一节细说。
误区: 免费用户是平台勉强承受的成本。 事实: 免费用户是平台增长的方式。他们中的很多人后来成为创作者和订阅者。真正的约束不是"要不要有免费额度",而是"免费额度能不能持续"。
我们为什么按官方价付费
有一种众所周知的方式可以把模型账单压得很低:使用逆向工程出来的非官方接口。这些接口的来源并不相同。有些会转售通过供应商未授权途径取得的访问权限;在这个市场最恶劣的一端,也存在使用盗刷支付方式购买算力的情况。
我们不用,也不打算用。这类渠道确实能大幅降低我们的模型成本。我们看过,然后拒绝了,出于两个彼此独立的理由。
第一,这件事本身就是不对的。 如果访问权限本身是通过欺诈取得或支付的,再转售它,本质上就是多绕了几步的偷窃——哪怕它在这个行业的某些角落已经被视为常态。我们不打算通过这类渠道养活平台,然后再写文章谈透明度。
第二,它会让产品变差,而这一部分用户会直接感受到,哪怕你永远不会知道某条回复是从哪来的:
- 延迟上升。 逆向线路多了转发层,要在共享账号池后面排队,限流也不可预测。回复两秒到达和十二秒到达之间的差别,就是"对话"和"提交表单"的差别。
- 它们会注入自己的系统提示词。 很多非官方接口会在把请求转发给上游之前,先包一层自己的默认系统提示。这层提示对我们和对你都是不可见的,而且它会和角色设定互相打架。语气被抹平,角色跑调、拒绝本不该拒绝的东西,或者一路漂向千篇一律的助手腔。角色扮演的质量恰恰是最先受损的那一项,而当提示词不在你手里时,这类劣化又最难排查。
- 它们会毫无预告地消失 —— 供应商一旦堵上漏洞,你调好的一切跟着一起没。
- 模型版本会在你不知情的情况下悄悄更换,于是昨天感觉正好的角色,今天回复方式突然不同,谁也解释不了。
- 对你的数据没有任何责任主体。 没有数据处理协议,没有留存策略,出了事没人可问。
Reverie 承载着人们真正投入了感情的对话。为了省钱而把它们交给一个匿名的中间商,这个交易我们不愿意做。官方供应商更贵,但他们会接电话,也不会在半路上改写你角色的指令。
这门生意的实际形态
团队很小,Reverie 也不是一门高利润的生意。
一条消息的积分价格并不等于这条消息的 token 成本,这背后有个结构性原因,值得讲清楚。推理是一次对话中唯一能按条计量的部分。这篇文章里的其他所有东西——摘要、主动消息、审核、存储、服务器、人——都没有一个天然的计费单位。没有人能给你开一张叫"决定你的角色该记住什么的那个后台任务"的账单。
所以唯一能计量的那一项,必须承担超出它自身的部分。这正是积分系统存在、而不是按 token 原样透传的原因:如果一条消息只收它自己那点 token 钱,那么围绕它的一切就等于没有来源,而围绕它的一切才是大头。
我们不打算把利润最大化。我们同样也无法长期亏损运营——一个把钱烧完的平台会直接消失,对所有正在使用它的人来说,这个结果比"积分系统有额度限制"糟糕得多。
在这两条约束之间,我们刻意选了更靠近用户的那一侧。当下的优先级是在正式发布之前把产品做到最好,而不是把变现拧紧。这意味着功能和质量排在转化率优化之前,也意味着当前的账目比"以营收为首要目标"时要宽松。
免费积分同样是真实成本
在 Reverie 上,不花钱也有相当多的使用方式:
- 每日签到奖励
- 每日幸运抽奖,叠加在签到之上
- 成就
- 官方悬赏
- 创作者奖励
- 邀请奖励,以及被邀请人购买积分时的佣金
- 分享奖励
- 兑换码与礼品卡
- 年度总结奖励
- 社区贡献,包括帮助宣传 Reverie
抽奖值得单独说清楚,因为大家往往以为它只是个装饰。它有五档——1,000 / 2,000 / 8,000 / 30,000 / 80,000 积分——权重分别是 50 / 30 / 15 / 4 / 1。乘开来算,期望值大约是每次 4,300 积分,按用户、按天计,而且是叠加在签到奖励之上的。
把这些叠起来,免费额度并不是象征性的。签到基础是 10,000 积分,连签奖励在此之上叠加——第 3 天 +5,000,第 7 天 +8,000,第 30 天 +50,000,第 100 天 +200,000——而抽奖又坐在这一切之上。在连签第 7 天,用户不花钱获得的积分期望值约为 22,300;实际数量会随抽奖结果变化。
这些积分到底够用多久
到这里有个合理的问题:大约 22,300 积分能买到什么?我们从来没讲清楚过。
积分的消耗方式是 token 数 × 模型倍率。文本模型的倍率在 0 到 2 之间,模型选择器里发消息前就能看到每个模型的倍率。到这为止都很简单。
大家低估的是:token 数不是固定的,它会随对话变长。一段新对话大约发送几千 token:角色设定、你的人格、一点点历史。而一段长对话要发送得多得多,因为最近的对话记录每一轮都要跟着一起发。我们把原始历史截在约 10,000 token,更早的部分交给摘要——这正是摘要存在的理由:没有这个上限,一段聊了半年的对话会在每条消息上重发全部历史,每轮成本将无限增长。
所以实际情况是:新对话里用 0.3× 的模型,一轮几百积分;同样一轮,放在一段很长的对话里用 1× 的模型,就是一万甚至更多。同一个平台,同一天,差距可以超过一个数量级。
这个区间就是"我的积分能用多久"的诚实答案,也是为什么不同的人感受差别那么大。如果你的积分消失得比预期快,那你多半是在一段长对话里用着贵模型——现在你知道该调哪个旋钮了。
签到页面本身也会发起一次模型调用。你签到时角色写给你的那句问候不是模板,而是生成出来的,按角色每天缓存一次,并设了每日次数上限以免失控。它依然是我们付费的推理——发生在一个存在意义就是"送积分"的页面上。
还有一个关于消费顺序的细节该放在这里:免费积分永远先于付费积分被扣掉。 如果你两种都有,先流干的是水龙头那部分。这是有意为之——你真金白银买的积分能留得更久——但这也意味着,每一次,最先承担成本的都是免费额度。
这里的每一项都是一笔真实支出。当你领取每日奖励并把它花在一次对话上,模型供应商照样会给我们开账单,服务器照样在跑,摘要照样会发生。积分对你免费,但它背后的算力对谁都不免费。
我们仍然会为这些计划买单,因为免费访问是大多数人判断这个平台适不适合自己的方式,也因为今天的免费用户中有相当一部分会成为明天的创作者和订阅者。但这一切成立的前提,是免费的部分保持在平台扛得动的范围内。当数字发生变化,这些计划会被调整——不是因为我们想少给,而是因为给出超过承受能力的量,最终的结果是什么都给不出。
成本降下来,价格也会降下来
这一节是承诺,而不是描述。
模型价格会随时间下降。缓存会改进。基础设施会更高效。我们自己的代码也会越来越少浪费 token——过去几个月在上下文拼装和摘要上做的那些不显眼的工作,做的正是这件事。
当我们找到一种可持续的方式降低运营成本时,我们强烈倾向于把它交给用户,而不是记进利润。更便宜的模型、更好的倍率、更慷慨的奖励。这件事我们做过很多次,也更愿意继续做下去——因为一个大家能放心大量使用的平台,对我们的价值高于稍微好看一点的利差。
这里最关键的词是可持续。把一项其实只是暂时的节省提前发出去,意味着之后要收回来,而那比从来没给过更糟糕。
你实际上在为什么付费
当你在 Reverie 上花掉积分时,你买的并不是加价转售的模型 token。
你买的是:一段记得住发生过什么的对话;一段在原始上下文早该崩塌的地方依然连贯的对话;它运行在对可用性和你的数据负责的供应商之上;它被备份、可导出;并且因为有人在全职投入,它每隔几周就会明显变得更好。
你可能仍然希望有更多免费积分。这完全合理,我们也希望能给更多——我们正在从成本那一侧、而不是价目表那一侧推进这件事。
但我们更希望你知道,为什么答案不像模型供应商价目表上的那个数字那么简单。
对某一笔扣费有疑问,或者觉得我们哪里算错了?你的积分记录里能看到每条消息背后真实的 token 数量,我们的 Discord 也一直开着。比起模糊的印象,我们更愿意就真实数字争论。
本文引用的奖励数额与积分倍率反映的是发布时的平台状态,会随成本变化而调整。应用内始终显示当前数值。

