
9 月 10 日,观察者网官方微博转述深度求索发给接口用户的邮件:V4.1 Flash 在当天(北京时间)切成正式档,Flash 系列新单价从 12 点起算。这与 9 月 9 日「10 日前后」预告不是同一件事:预告只给窗口。
价目按该转述:闲时输入,缓存打中 0.02 元 / 百万 Token,打不中 1 元,输出 4 元;忙时按闲时乘二。忙时定为周一到周五上午 9 点至正午、下午 2 点至 6 点(北京时间)。公司称内测与外部评测后,效果、花费、速率和端到端耗时都压过 V4 Pro。停服节点写到 9 月 14 日 12 点;过点后,原先模型名写成 v4-pro 的调用全部改接到 V4.1 Flash,账单跟 Flash。该帖还写:这是新结构家族里体量最小的一档,自带看图;相对上代,KV Cache 对 HBM 的占用压到四分之一、对固态盘压到八分之一。做 Agent 时命中缓存往往更吃账单。
蓝鲸新闻同日(古东管家转载)对照调价前 Flash:命中 0.05 元降到 0.02 元(六成),未命中 1.5 元到 1 元(约三成),输出 4.5 元到 4 元(约一成)。同文记 8 月 26 日 GLM-5.3-Flash、Qwen3.8-Flash 价带,并称涨价后部分用户改走其他国产模型;相对涨价前,命中和未命中回到旧位,输出仍是 4 元不是 2 元。把 Pro 请求切到 Flash,等于用更小档接原 Pro 账单,前提是官方自评成立。本稿依据媒体转述的平台通知,未能抓到深度求索官网对应长文;压过 V4 Pro 是公司口径,未附榜单。



