当一个开发者发布一次实验的成本低到不值得计数时,他的决策会发生什么变化?

当实验足够便宜,目标就不再是做出更多东西,而是更宽地搜索、更快地筛选,把注意力投给少数几个真正显示出信号的想法。
最近我碰到一个从没预料到的问题:一堆便宜的中档模型额度,用不完。
它们不是最强的模型。遇上复杂架构、重要决策,或者需要真正推理的工作,我还是会去拿更好的。但日常开发的大部分并不难:改页面、加小功能、清理代码、重跑测试、照着日志修报错。便宜的模型就够了。
我以前会琢磨怎么省 token。现在我琢磨的是:既然这些额度放着也是不用,能不能拿它换点别的?
这不是一篇复盘。实验才刚开始。我没有流量曲线,也没有哪个数字能证明这个策略成立。这是我最近形成的一个判断,以及因为有了这个判断我开始做的一件事。
便宜的模型正从「备选」变成「默认」
便宜的模型不再像那个「不够好,但要省钱」的备胎。Google 发布 Gemini 3.6 Flash 时把它称作 workhorse,强调编码、agent 工作、token 效率和规模化执行。后来 Google 的 Managed Agents 直接把 3.6 Flash 设成了默认。
给 agent 干活的模型,正在变便宜。
分工本身不新鲜。Claude Code 一直把「主模型」和「小而快的模型」当成两个角色。官方模型配置文档 里至今还能看到 ANTHROPIC\_MODEL 和一个已废弃的 ANTHROPIC\_SMALL\_FAST\_MODEL,后者由 ANTHROPIC\_DEFAULT\_HAIKU\_MODEL 接管,用于 Haiku 和后台工作。这个想法一直都在,只是对我从来都还不够便宜。
模型路由过去回答一个问题:怎么让一个昂贵的 agent 稍微便宜一点。我现在问的是另一个:
当 agent 的大部分步骤都便宜到我不再去数它,会发生什么?
降下来的是「一次实验」的成本
一次 API 调用从几美分降到一分钱,不会改变我怎么做产品。改变行为的是从一个想法走到一个能发布的东西,总共要花多少。这个总成本降下来了。
以前任何一个小的网页项目我都会先算一笔账:设计、写码、调试、样式、部署、维护。如果这东西可能带来一丝流量,而我要花上两三天,我大概会跳过。
现在一个 agent 可以自己读代码、改、跑测试、失败、再看日志、再改、再跑一轮。这可能是几十次模型调用。只要每一步都便宜,我要花的就收窄成:描述我想要什么、检查结果、做取舍、决定要不要继续。
把一个想法变成一次真实的、可发布的实验,要花我多少?
一旦这个成本降下来,原本不值得做的事就挪进了「值得一试」的范围。我就是这么开始做小游戏的。
我开始把闲置算力花在小游戏上
我在做小的网页游戏,纯粹当作实验的载体:没打算成为游戏工作室,也没有证据表明游戏能带来流量。
小游戏的边界清楚。大部分不需要后端,纯前端跑,可以独立部署,还能和别的游戏放进同一个合集。通过搜索或分享链接找到其中一个的人,可以玩一下,然后翻翻其他的,或者落到我别的页面上。
当发布一个东西只要这么点成本,我能不能多跑一些小实验,从中找出带来流量的那几个?
我不觉得「做得更多」是竞争优势。如果 AI 对所有人都更便宜,那所有人都能生产更多的网页、应用、文章和游戏。单纯增加供给本身不再意味着什么。我要的是一个更大的搜索空间。
以前我只能小心地挑一个想法,因为每一次尝试都很贵。如果尝试很便宜,我就能一次测更多候选,快速丢掉没有信号的,把时间留给那几个显示出迹象的。
我现在的框架
低成本地制造候选 → 观察 → 淘汰大部分 → 把注意力集中在少数有信号的上。

这是我正在试的框架:低成本地制造候选,观察早期信号,快速淘汰掉大部分,把时间和注意力集中到少数几个值得深入投入的上。
AI 扩大的是我能多便宜地探索候选,而不是我能维护多少产品。生成越来越便宜,但判断、筛选和持续投入仍然在我这边:一个没有信号的项目应该尽快停止占用我的时间;只有显示出一点价值的东西,才配得上 SEO、内容或者长期维护。
所以我不是在生产更多内容去抢注意力。注意力是稀缺的。便宜的探索之所以重要,是因为它能找出少数几个值得我投入注意力的东西。
我想验证的:瓶颈会移到哪里
实验才刚开始,所以我不能宣称分发就是瓶颈。这是我目前的猜测。
如果生产成本继续下降,我怀疑稀缺的东西会从「能不能做出来」转移到:
- 分发
- 注意力
- 选择做什么
- 品味与判断
- 用户信任
- 维护
- 开发者自己的注意力
最后一条对我来说最明显:AI 能生成什么,和我能管过来什么,是两件事。
就算我很快发布十个小的游戏,我仍然得判断留哪个、关哪个、哪些配得上 SEO、哪些指标有意义、真实需求在哪里。一旦生成的速度超过我的管理能力,生成得更快就没有用了。筛选才是工作本身。
我也把模型当成不同层级的劳动力,而不是围绕一个中心模型搭工作流:常规任务用便宜的模型,难的任务用更强的,失败了就升级,高风险决策直接上最强的。具体哪个模型胜出几个月就会变,这个结构可以留着。
还没有答案
我不知道这些游戏会怎么样。也许一个都没有流量。如果是这样,这个实验仍然告诉了我一件事:生产变便宜不会自动带来分发。也可能有几个游戏拿到了搜索流量,变成通向其他项目的门,那我就把更多时间投到那些信号上。现在还太早,假装自己有结论没意义。
有一件事已经真实发生了:
我以前会跳过这类实验,因为它不值得花上几天开发。现在它便宜到值得一试。
我以前花力气去用更少的模型能力。这是我第一次开始琢磨,怎么把富余的能力换成更稀缺的东西。
眼下,我拿它换的东西是流量。
瓶颈到底落在哪,等这些实验跑上一阵子再看。