文 | 字母 AI
就在 DeepSeek 测试 V4.1 Flash 中间版的两天后,V4.1 Flash 就正式上线了。
总参数 552B 的 MoE 模型,采用了全新的 Causal-Encoder-Decoder 非对称结构。输入激活只有 8B、输出激活 16B,推理成本大幅低于同尺寸模型,还原生支持多模态视觉理解,无需外挂视觉模块。
并且通过 KV Cache 压缩,对显存需求需求降至上一代的 1/4、SSD 降至 1/8,社区实测输出速度达 300 到 500 tokens/ 秒。
通常来说,又小又快的模型性能也就越低。然而 V4.1 Flash 不一样,各项基准全面超越 V4 Pro,GPQA Diamond 达 90.9。
而且它还降价了。9 月 10 日 12:00,Flash 起闲时缓存命中输入 0.02 元、未命中 1 元、输出 4 元 / 百万 token,高峰时段翻倍。
之前缓存命中是 0.05 元、未命中 1.5 元、输出 4.5 元 / 百万 token。
一天以前,崔添翼曾在社交媒体上发文表示,以后 V4 Pro 的调用会转到性能更高、速度更快的 V4.1 Flash 上,并且价格也会按 Flash 价算。
Pro 的价格是 Flash 的 3 倍,这么一改,我就又能在外卖里加俩鸡腿了。看来我又要多认一个赛博义父了。
月初的时候我总喜欢大手大脚,月末发现,到下一个发薪日前,我好像只能吃土了。
模型额度也是类似的。订阅的第一天,把大文件整个塞进上下文,明明只需要文件里 20 行的逻辑,却让 Agent 通读 2000 行的源码。于是它把整个仓库的索引、构建产物、lockfile 全都读了一遍。几百 token 能搞定的问题,直接烧掉了大几万。
没办法,有额度就是任性。
可过不了几天,额度就花的差不多了,想买更高级别的订阅,怎奈囊中羞涩,但是不用 AI 又没办法完成工作。
左右为难之际,突然天降甘霖,你获得了一次重置额度的机会。
于是网友就管这些发放额度的人叫做 " 赛博义父 "。
比较知名的有 OpenAI 的 Tibo,谷歌的洛根,如今崔添翼也是位列仙班。
" 赛博义父 " 经济,也正在成为 AI 大厂的胜负手。尤其是当模型性能难分伯仲的时候,额度就是成了 AI 厂商手里最温柔的武器。
模型参数好有什么用,我的 " 赛博义父 " 在你之上!
赛博义父起源
在大模型圈," 赛博义父 " 起源自西方,他们走的是 " 恩赐派 " 路线。不定期发放像是重置额度这样的小礼物。这套玩法的集大成者,是 OpenAI 的 Tibo。
Tibo 外号叫做重置额度的神,他本名为蒂堡特 · 索蒂奥(Thibault Sottiaux),比利时人,鲁汶天主教大学应用数学出身。
他从小就是个 " 非典型神童 ",7 岁就写下人生第一个程序。但 Tibo 说他自己真正想要的,是一台能跟自己说话的机器。后来 Tibo 先去了 Google Maps,又去 DeepMind 参与 AlphaGo 背后的研究基建,2024 年加入 OpenAI,接手了当时还没什么人看好的 Codex。
真正让他封神的,是 2025 年 11 月。
那段时间 Codex 系统错误频发,Tibo 给受影响的用户补偿额度。没人想到,这个朴素的补偿动作,会演变成一场持续至今的互联网仪式。
2026 年 4 月,Codex 周活突破 300 万,OpenAI 宣布此后每增加 100 万用户就重置一次额度,一路重置到 1000 万。于是 500 万、600 万、700 万、800 万。
7 月 15 日,Codex 和 ChatGPT Work 的活跃用户达到 800 万,Tibo 在社交媒体上宣布再次全员重置,还顺手 " 继续不设 5 小时速率限制 "。到 8 月底,他在访谈里提到,Codex 的用户如今已经超过了 2000 万。
Codex 有 Bug?好,重置额度。修好了 Bug 庆祝一下,再重置额度。发新模型,更要重置。
Tibo 就像当年的王思聪,凭自己的喜好在微博上给大家发苹果手机。
于是社区就专门建了个网站,叫做 codex-reset.com,用以记录 Tibo 重置额度的次数。
根据网站的信息,Tibo 重置额度已经将近 40 次。
GPT-5.6 发布后的 12 天里就来了 10 次。OpenAI 发布 GPT-6 Astra 时,由于网络安全的,只有授权的网络安全机构以及 Plus 用户能够使用 Astra。于是 Tibo 就给这些暂时用不上 Astra 的付费用户 " 每天存一个重置 ",最后干脆又给全员发了一次完整重置。
Tibo 自己调侃这份日程表:休息,重置,休息,重置。
Tibo 本人也很会接梗。OpenAI 被曝算力紧张时,他在评论区自嘲:" 我真的应该停止按我桌子上那个巨大的 Codex 重置按钮了。"
他甚至真的搞了一颗实体重置按钮,名言是 " 只要哥想重置,哥随时都可以重置 "。有一次用户喊他 " 宝贝 ",他回:" 不用叫我宝贝,重置将于今天下午进行。"
这些梗甚至被做成了一个叫做 TiboGPT 的网站。网站上只有一段话:"Tibo 重置了吗?",答案是 " 大概率!"。

起初大家都以为这是闹着玩的,可是当一位中文粉丝在社交媒体上给 Tibo 留言,说自己自从用了 Codex 就再没打开过 Claude Code,Tibo 直接回了一句中文:" 你最牛了!"
隔壁 Claude 正在不断封禁中文用户,Tibo 却用中文回复中文区粉丝,让不少国内开发者直呼:这义父,认得不亏。
2026 年 6 月 11 日,Codex 上线了 Banked Reset(库存重置)功能。
就像卡包一样,OpenAI 把重置券直接存进用户的账户,30 天内想什么时候用就什么时候用。一次完整兑换,可以同时重置 5 小时窗口和每周窗口,还把周重置日期顺延 7 天。
如果说 Tibo 是 OpenAI 的 " 额度之神 ",那谷歌这边对应的就是谷歌白嫖大使洛根 · 基尔帕特里克(Logan Kilpatrick),DeepMind 旗下 AI Studio 和 Gemini API 的产品负责人。
他此前正是 OpenAI 的开发者关系负责人,跟 Tibo 恰好互换东家。
再往前,洛根在 Apple 做过机器学习工程师,给 NASA 当过开源政策顾问,还帮 Julia 语言建过开发者社区。2024 年他跳槽时只有 27 岁,曾被媒体形容为 " 奥特曼最的秘密武器 "。
到了谷歌,外媒直接称他是 Gemini 的 " 门面 ",谷歌内部对他的评价是 " 一个人包揽了 90% 的营销工作。"
在他的任上,AI Studio 的免费额度多到让开发者怀疑人生。
2.5 Pro 免费一天使用大约 50 次,上下文支持最高 100 万 token,2.5 Pro 的单次调用成本约为 1 美分。
2025 年 11 月,Gemini 3 Pro 问世,奥特曼因为受到了这个模型的威胁,首次拉响了 OpenAI 内部的红色警报,公司放下所有其他业务,全力投入到模型中,以防止被谷歌超越。
洛根这边更 " 过分 " 了,不仅可以在 AI Studio 白嫖 Gemini 3 Pro,他还把额度提升,每天的免费额度一度达到了 250 次。按照 Gemini 3 Pro 单次调用 1.5 美分的价格来算,每天约为 4 美元,每月约为 120 美元。要知道,联合国难民署每月给的救济金也就才 100 美元。
在洛根的管辖下,单单 Gemini 3 Pro 这一个模型的白嫖额度,就超过了每月 800 块钱人民币。
如果你以为这样就完了,那你还是太小瞧洛根这个 " 白嫖大使 " 的称号了。AI Studio 虽然面向所有人,但毕竟有些许的上手门槛。真正让洛根一战封神的,是学生免费送 12 个月的谷歌 AI Pro 订阅。以至于在闲鱼上出现了大量的代注册 edu 邮箱业务,3 块钱到 5 块钱不等。
按美区的价格统计,一年的谷歌 AI Pro 是 240 美元。不需要任何门槛,只要你想办法弄个 edu 邮箱就能免费领到洛根给你的大礼。
随后,洛根再次发力,新用户注册绑个卡,就送 300 美元额度,有效期 3 个月的谷歌云余额。哪怕这个信用卡明天就注销,洛根照送不误。
除此以外,洛根还改了谷歌的站内直接付费流程,砍掉了跳转 Cloud Console 绑信用卡的劝退流程。
有赛博义父,自然就有赛博义母,就比如 Anthropic 的雷蒂亚 · 哈莉(Lydia Hallie)。
雷蒂亚是 Claude Code 团队的 MTS(Member of Technical Staff,技术成员),主管开发者体验与教育,之前在 Vercel 做 DX 工程师,后来当过 Bun 的 Head of DX。
一切的开始要从 3 月底说起。当时 Anthropic 因为限额收紧被全网嘲讽。有 Max 20x 用户发文称,他只用了 19 分钟就烧光了 5 小时额度。
随后雷蒂亚回复他说:" 你的打开方式不对 "。
5 月 20 日,雷蒂亚又发布了完整的免费课程《Claude Code》,在 Frontend Masters 和 master.dev 正式上线 ,甚至不需要绑定信用卡就能观看。
到了 9 月 5 日,她突然发文:" 我们刚刚为所有 Claude Max 用户重置了每周限额。Fable 5.1 发布在即,加上很多人即将迎来长周末,我们想让你继续写下去。"
西方义父们的共同点是,他们不能改变模型的费用,却可以变着法的帮用户省钱。
国内的赛博义父
如果说西方走的是 " 恩赐派 ",那国内走的就是 " 定价派 "。不搞仪式感,不按重置键,直接把价格打穿。
典型代表就是 " 梁圣 " 梁文锋。
梁文锋从不送券,甚至不搞社区运营,他选择把模型权重 MIT 开源,并以远低于行业的 token 价格开放给市场。
梁文锋的逻辑是理性克制,DeepSeek 的定价原则是 10 个月回本,对应 6 倍利润。梁文锋认为,在这个目标下,开源对商业模式毫无负面影响。
今年 4 月,DeepSeek 把 Flash 的缓存命中价格降到了 0.02 元 / 百万 token,创下全球大模型价格新低。
可到了 8 月 6 日,DeepSeek 突然预告全线涨价。8 月 17 日新价生效,V4 Pro 高峰时段缓存命中价涨了 11 倍,输出价涨了 3.5 倍。
一夜之间,梁文锋从 " 梁圣 " 变成了 " 梁叔 ",然后又跌到了 " 梁子 "、" 牢梁 "、" 小梁 "。
OpenCode 上 DeepSeek 的调用量也随之下降,Flash 两天内下降了 59.1%,Pro 下降了 55.7%。
事实上 4 月的时候,DeepSeek 官方还预告称 " 下半年超节点批量上市后,V4 Pro 价格将大幅下调 "。
然而等到了 V4.1 Flash 发布,大家一拍大腿才发现," 哎呀!是我们误会梁圣了!"

我的赛博义父终究是放不下我。
国内另一个定价派就是智谱首席科学家唐杰和 CEO 张鹏了。
DeepSeek 多少还得花钱,智谱是直接免费。
智谱第一个免费大模型 API 是 2024 年 8 月上线的 GLM-4 Flash,也因此开创了 "Flash 免费档 " 的先河。
2026 年 1 月 20 日,GLM-4.7 Flash 发布,官方称永久免费、无 token 上限、200K 上下文、并发限制约 30 QPS,连缓存都免费。
国内开发者社区流传的几个《白嫖指南》中,GLM-4.7 Flash 一直是头号选择。
8 月 20 日,一个叫 Ox Alpha 的匿名模型空降 OpenRouter。
100 万 token 上下文、原生多模态、免费一周,使用量一度冲到 DeepSeek 的两倍以上,直接霸榜,终结了 DeepSeek 在 OpenCode 上 56 天的垄断。
因为模型名字中带有 " 牛 "(Ox),又因当时电影《牛来》的爆火。因此,社区给它起名 " 牛来 "。
为一探牛来的究竟,全网开发者当了六天侦探,从分词器特征猜到模型架构,猜它到底是谁家的孩子。
8 月 26 日谜底揭晓,智谱发文称,牛来就是 GLM-5.3-Flash,320B-A18B,Artificial Analysis 智能指数 57 分,对标 Claude Opus 4.8,其性能甚至超过了 DeepSeek V4 Pro。并且 MIT 全开源。
但牛来不再免费,而是改成了低价收费模式,其价格为旗舰模型 GLM-5.3 的 1/10。
国内义父们的逻辑也很一致,不搞花里胡哨的这卡那券,把 " 便宜 " 做成产品属性,用技术升级实现 " 降价 "。开发者少花点钱,AI 厂少挣点钱又如何,积攒客户才是硬道理。
义父经济学
这些义父到底图什么?
重置额度本就是营销。
就像健身房的年卡,会员办卡后平均只去三分之一,健身房却按全价收钱。重置只是把 " 没用到的那部分 " 提前释放出来,对巨头来说成本接近零。
但用户感知到的价值是实在的。
按照社区的推算,一张 Banked Reset,哪怕是用满,Plus 用户的算力成本大约 1-2 美元,Pro 用户 5-8 美元。
假设 OpenAI 给所有订阅用户发放一张 Banked Reset,并且这些用户全都将其使用掉,那么按照 Codex2000 万周活的数据来看,满打满算也就 1.8 亿美元。
2025 年,OpenAI 在超级碗上的广告约花费将近 2 亿美元,大型全球品牌 campaign 也是 2 亿美元。但是这些曝光几千万到几亿的广告,OpenAI 能获得的用户,可能不到其中的 10%。而 Banked Reset 则是 100% 直达账户。
用户看过广告,可能 3 秒后就忘了。然而用户拿到一张 Banked Reset,那用户很有可能会发自内心地感谢 Tibo。
而且额度本身,也是 2026 年的 AI 大厂的第二战场。
7 月 12 日,Anthropic 宣布 Claude Fable 5 订阅访问期限第三次延期,延到 7 月 19 日,同时维持 Claude Code 周额度 50% 的上调。
不到一个小时后,Tibo 就宣布暂时取消 Codex 和 ChatGPT Work 的 5 小时使用限制,Plus、Pro 和 Business 全覆盖,同时给 600 万活跃用户全员重置额度。
现实的商战就是这么朴实无华。
而雷蒂亚重置 Claude Max 周限额,背景也是 OpenAI 发布 GPT-6 Astra。
给用户的福利,本就是一颗射向敌人的炮弹。
西方义父们选择把重置权交给用户,30 天内自选时机用掉。这本质上是在发 " 期权 "。降价是确定性的,今天降了明天还在。可重置券是不确定的,你不知道 Tibo 下次什么时候发。这种 " 等待感 " 本身就是粘性。
codex-reset.com 上守夜的人平均等约 9 天,最长等过 70 多天,等得越久,就越离不开 OpenAI。
你会因为 Tibo 没有重置就退订 Pro 吗?显然不会。你只会因为重置而更离不开 Codex,一次重置,买断了接下来一个月的忠诚。
那为什么国外是恩赐派,国内是定价派?
底层原因是市场成熟度不同。OpenAI 和 Anthropic 已经有了稳定的付费基本盘,订阅用户本就是它们的现金牛。
重置额度,是在不触动基本盘定价的前提下,给开发者群体的 " 增量福利 "。
而国内厂商还没有这个基本盘,DeepSeek、智谱、月之暗面都还在争夺市场份额,没有稳定的订阅收入可以依靠,所以必须用性价比去从巨头手里抢用户。
今年 7 月,Kimi K3 上线 48 小时就把集群挤爆,月之暗面干脆暂停接收新付费用户,把算力优先留给老用户。杨植麟宁可少收钱也要保住体验,不是因为他不想赚钱,而是因为在这个阶段,用户比短期收入重要得多。
这是两种发展阶段的必然选择,不是谁比谁更慷慨。
当然,义父的恩情不是永久的。只有当策略和用户利益恰好同向时,才叫做双赢。