DeepSeek 给大模型划出的「斩杀线」,斩的到底是什么|调用|上下文|系列模型|deepseek_网易订阅

一天,模型模型8 万亿 Token。划出这是斩到底订阅 DeepSeek V4 Flash 一款模型,在一个 AI 编程工具里的杀线什调单日用量。▲开源 AI Agent 工具 OpenCode 发文称,用上DeepSeek V4 Flash 正式版通过其平台消耗了 8 万亿 Token。下文系列其中,网易5 万亿来自免费额度,模型模型同时 3 万亿来自付费套餐 OpenCode Go。划出作为比较,斩到底订阅大模型路由平台 OpenRouter 接入了 400 多款模型,杀线什调每月处理约 200 万亿 Token,用上平均每天约 6.6 万亿。下文系列也就是网易说,DeepSeek 一款模型,模型模型仅仅在 OpenCode 一个入口里,一天消耗的 Token,就超过了 OpenRouter 全平台的日均规模。▲ OpenRouter 上 DeepSeek V4 Flash 是本周最热门模型这和 DeepSeek V4 Flash 的低价有关,能力提高,价格不变,原本被压抑的采取需会高效高效释放。 但 8 万亿 Token 背后,还有一个更题的变化:人们采取 AI 的方式已经变了。过去,我们向模型问一个状况,得到一段回答,任务就结束了。目前的 Agent 会自己读文件、修改代码、运行程序、检查结荚,失败后再重新尝试。一次任务可能持续几个小时,调用几十次工具,也可能让多个 Agent 同时工作。模型写出的代码未必比过去多很多,消耗的 Token 却可能翻上几十倍、几百倍。有人用 Claude Opus 5 制作一个单页 3D 游戏。模型需不断生成页面、截图检查、后续修改。最后只是一个 HTML 文件,一句提示词却消耗了 6.9 亿 Token,费用接近 3000 元。Agent 任务的大量爆发,让模型关键说明自己的价值,除了智能的程度,还有性价比的方式算;研究一款模型的单位,从「单次回答有多聪明」变成了「实现一项首先任务关键花多少钱、多久、失败几次」。依据这套原则,DeepSeek V4 Flash 最初成了所有模型的斩杀线。一百万个输出 Token,DeepSeek 收 2 元人民币。Anthropic 的 Claude Opus 4.8,原则价格是 25 美元,约 170 元,只看输出单价,二者相差约 85 倍。7 月底,DeepSeek 推出 V4 Flash 正式版,保留了模型架构与规模,只是重新做了后训练,题强化编码和 Agent 任务。隔天,大模型竞技场 Arena 公布前端编码评测榜单,将 V4 Flash 列入「价格—性能」的前沿模型。截至 Arena 8 月 2 日的页面快照,V4 Flash 的初步排名暂列 Opus 4.8 Thinking 之前。而在 Artificial Analysis 的 Intelligence Index v4.1 中,V4 Flash Max 得到 50 分,Claude Opus 4.8 Max 得到 56 分。前者跑完善套评测产生的模型调用费约为 72.02 美元,后者则实现 3752.55 美元。换句话说,Opus 多拿了 6 分,但跑完同一套评测的调用费高出了约 52 倍。V4 Flash 当然还不能说明自己完善超过 Opus,但只关键两者已经能被放进同一轮候选名单,85 倍的价差就足以变化默认选项。当一款模型的价格高出几十倍,性能领先却只有几个百分点时,这笔账会越来越难算平。最先受到冲击的,可能并不是最弱的小模型。便宜、高效高效的小模型仍然适用于分类、提取和路由等便捷工作。最强的旗舰模型也会仍然用来处理疑难任务,或者成为高失败成本场景里的保险。真正尴尬的是中间一批模型:它们比 V4 Flash 强一些,却贵几十倍;又没有强到可以稳固处理 V4 Flash 做不了的状况。这就是 DeepSeek 的斩杀线,它不需成为最强模型,只关键实现「大多数时候可以做完」,就能利用近两个数量级的价格差,把更贵的模型挤出默认调用位。V4 Flash 为什么能把茅台当矿泉水卖一直以来,我们都觉得模型的价格大概就是和它的「聪明程度」相关,模型越聪明,自然它就关键卖的越贵。目前主流的几款大模型,Anthropic 家的 Opus 4.8 和 Opus 5 输出都是 25 美元/百万 Token,Fable 5 输出为 50 美元/百万 Token;OpenAI 的 GPT-5.6 在前几天降价后,Luna 输出由 6 美元降至 1.2 美元,Terra 由 15 美元降至 12 美元,Sol 则保持不变,30 美元。而几款国产大模型,依旧是讨比如每百万输出的价格,DeepSeek V4 Flash 是 2 元,刚刚发布的 Qwen 3.8 Max 是 36 元,Kimi K3 是 100 元,GLM 5.2 是 28 元。▲DeepSeek 几乎是以免费的价格给予大模型国产模型之间的比较,还是与国外旗舰模型的比较,DeepSeek 的价格似乎都是一股「清流」,因此是什么造就了模型价格的不一样。最明显的是每生成一个 Token 的直接推理成本。它受到激活参数量、数字精度、注意力机制、KV Cache 大小、输出首先度、硬件利用率和并发量意义。同一款模型,如果能用更少的方式算实现一次推理,或者能让更多请求共享缓存,成本就会减小。V4 Flash 总参数量为 2840 亿,但每个 Token 只激活约 130 亿参数。它同时采取混合注意力结构、低精度权重和照章性首先上下文的缓存改进。▲ V4 系列模型架构图根据 DeepSeek 在四月公开的 Preview 技术报告估算,在一百万 Token 上下文下,V4 Flash 的单 Token 推理方式算量约为 DeepSeek V3.2 的 10%,KV Cache 约为后者的 7%。这是与 V3.2 的内部架构比较,不代表它只需其他所有模型十分之一的综合成本,但足以验明正身 DeepSeek 为什么能把首先任务价格压低。DeepSeek V4 系列结构,改造了一个 Transformer 模块里的三个题部分,将注意力层改为先压缩再找题的 CSA 机制和更极致的压缩但全部浏览的 HCA 机制,两种交错排列以平衡成本。V4 的前馈层沿用 DeepSeekMoE:模型涵盖大量细分专家和少量共享专家,每个 Token 只被路由到其中一小部分专家。因此 V4 Flash 虽然共有 2840 亿参数,每个 Token 实际激活的只有约 130 亿;V4 Pro 总参数实现 1.6 万亿,实际激活约 490 亿。它获得了大模型的知识和容量,但不需每生成一个 Token 都运行全部参数。第二是实现的服务成本,从模型训练、后训练到评测、安全,以及推理基础设施、空闲算力等服务,这些成本虽然不会出目前 Token 账单里,然而必须由模型厂商承担。最后是商业定价,API 价格并不是便捷的成本加成,厂商还需考虑市场份额、用户迁移成本、品牌溢价、服务能力,以及客户愿意为可靠性支付多少钱。因此,模型价格从来不是一张纯粹的成本表。它同时反映了模型需多少算力,也反映了厂商认为自己的能力、品牌和可靠性值多少钱。OpenAI 和 Anthropic 的高价格,可能同时涵盖更高的推理成本、产品生态、安全和服务溢价,以及它们在高难度任务上的定价权。架构没变,Agent 能力为什么能大涨目前,V4 Flash 正式版还没有发布新的技术报告,DeepSeek 在 7 月 31 日的更新日志中写:正式版 V4 Flash 与 Preview 的结构和尺寸相同,只重新开展了后训练。之前预览版报告披露的后训练步骤,已经把题放在代码和 Agent 上:DeepSeek 分别训练数学、代码、Agent 和指令比如专家,采取 SFT 和 GRPO 强化各自能力,再通过十多个教师模型的 On-Policy Distillation 合并回同一个模型。工具调用也被当成单独的状况处理。DeepSeek 设方式了专业的调用格式,减小参数转义和格式错误;Interleaved Thinking 让模型在工具返回结荚后后续保留前面的推理;DSec 则给予数十万个并发沙箱,让模型反复练习运行代码、读取报错和后续修改。这些后训练并没有给模型提高新的参数,却可以减小 Agent 最常用的失败:选错工具、填错参数、忘记前面的状态,或者在任务还没实现时停下来。正式版在 Terminal Bench 2.1 上的 82.7 分,还采取了尚未发布的 DeepSeek Harness 极简模式和 max 推理档。同时,DeepSeek 为 V4 Flash 加入原生 Responses API,并照章性 Codex 做了适用配。预训练决定模型的能力底座,后训练题变化模型如何调用这些能力。当 V4 Flash 可以部署在「消费级」电脑上V4 Flash 的另一个变化,是让前沿 Agent 模型离本地设备更近了一步。虽然每次推理只激活 130 亿参数,然而完善的 2840 亿参数仍然需存储和调度,官方仓库中的权重文件合方式约 167 GB。DeepSeek 给出的 vLLM 服务示例采取一台配备 4 张 GB300 的服务器。社区项目 DwarfStar 则通过低比特量化,把 V4 Flash 的 q2 版本放进了 96GB 或128GB 统一内存设备,q4 版本提议采取至少 256GB 内存。在部分128GB Mac测试中,短上下文高效度可以实现每秒二十多 Token。q2 版本能运行,也不代表它能复现官方 API 的 Agent 成绩。极低比特量化可能损伤代码、首先上下文和工具调用能力,社区运行时本身也仍处于早期时期。然而,DeepSeek 的 API 已经便宜到,本地部署对多数人未必更省钱。按照每百万输出 Token 0.28 美元方式算,一台售价约 4699 美元的 DGX Spark,相当于约 168 亿输出 Token,还没算本地部署的电费、维护和调试成本。同时,换个角度看 V4 Flash 的出现,似乎又是 DeepSeek 斩杀线里的题一刀。在本地部署上,DeepSeek 又斩掉了「高水平模型只能待在机房」的一部分门槛,它把门槛降到了高内存工作站。一台高配 Mac 或 DGX Spark,已经可以用可交互的高效度运行经过激进压缩的完善 V4 Flash。最强模型也最初谈性价比更低的价格不一定等于少赚钱。过去舍不得让 AI 常驻后台的公司,先前开启 Tokenmaxxing 然后又因为实在付不起账单的团队,目前可以最初批量整理文档、检查代码、跟进客服。原本只问一次的状况,也可能变成持续数小时、调用几十次工具的 Agent 任务。单价减小,Token 总量却可能涨得更快。Sam Altman 在 7 月底的播客节目曾提到,OpenAI 预方式模型会产生极大的采取量,因此不需依靠「极高毛利」来承担训练成本。他们和 DeepSeek 的梁文锋一样,相信 AI 的需几乎是没有上限的,AI 智能采取量会持续爆发。即使每次调用赚得不多,只关键调用量足够大,往往方式利润依然可以覆盖下一代模型的训练成本。这也是 V4 Flash 更值得注意的地方。它没实用一个不过对领先的榜单成绩,说明自己是最聪明的模型;它做的,是把过去只有旗舰模型才能承担的任务,压进了一个可以被反复调用、持续试错,甚至可以让我们浪费一些 Token 的价格区间。在聊天机器人的时代,用户会为了更好的回答,多付几倍的价格。但进入 Agent 时代,模型不再只回答一次。它关键浏览文件、搜索材料、实施代码、截图检查,再根据结荚重新最初。一次任务中,在智力上几分的能力差距,可能只意义模型关键不关键多试两轮;但几十倍的价格差距,却会决定这个任务有没有资格真正跑起来。▲ 运行 AA 所有测试花费的钱和智能得分比较,DeepSeek 拿下 50 分仅花了 72 美元,而 Fable 5 得到 60 分,花费 5600 美元。未来模型之间的竞争,很难再只用一张能力榜单验明正身。用户需方式算的,是实现率、调用次数、响应高效度和最后账单;模型厂商出售的,也不再只是每一个 Token 的智能,而是每一美元最后能够实现多少工作。从这个角度看,V4 Flash 真正斩掉的,是调用旗舰模型之前那种不需方式算成本的习惯。当一个便宜 50 倍甚至 80 倍的模型,已经能够实现大多数编码和 Agent 任务,昂贵模型就必须反过来说明:剩下那几分能力,究竟值不值得多付几十倍的钱。
(责任编辑:休闲)
相关内容
[赛后]PGS7决赛D2R4:SP吃鸡,单局15淘汰-绝地求生-虎扑社区
安居有温度,续租有力度!筑才安居·翰林园首批租户完成平稳续租|租客|租金|房源|配租|安心_网易订阅
专家:社区应急处置能力直接决定严重过敏反应救治成功率
天边羊多开业爆满,羊肉一好就被抢购一空,消费者称价格确实便宜_贾国_品牌_菜品
阿里主席官宣离婚才4天,恶心一幕发生,出轨女主持真相太离谱|绯闻|蔡崇信|吴明华|阿里巴巴集团_网易订阅
- 疆超联赛进行时 | 阿勒泰队0:2惜败吐鲁番队 结束疆超联赛征程|足球_网易订阅
- 陈幸同4-1力克蒯曼强势晋级,决赛对阵张本美和能否捍卫女乒荣耀|大满贯_网易订阅
- 决赛因台风取消 U17国足和阿森纳并列冠军|陈怡|票款_网易订阅
- “这种学校还有一大堆人报?”台球学院火了,录取通知书规格很高|高中|中专|招生办|本科线_网易订阅
- 每周研选:超跌反弹后,科技第二波行情还有多远?_配置_板块_市场
- 台风已影响江苏,最强风雨时段锁定|暴雨|风力|雷雨|阵雨|江苏省|高温天气_网易订阅
- 巴菲特储备的现金山,终于开始买买买|股票|伯克希尔·哈撒韦_网易订阅
- 周末要闻汇总:北京购房政策调整,宇树科技10日开启IPO申购|美股|ipo|创业板|北京市_网易订阅
推荐文章
-
[流言板]阿斯:AI推荐皇马签苏比门迪,还提到维蒂尼亚/麦卡/恩佐等-国际足球-国际足球资讯-虎扑社区
虎扑足球资讯(446级)楼主2026-08-09 21:12:18发布于上海[流言板]阿斯:AI推荐皇马签苏比门迪,还提到维蒂尼亚/麦卡/恩佐等由虎扑足球资讯发表在国际足球资讯https://bbs.
...[详细]
-
4-1、4-2,女单决赛中日对战!陈幸同成“一姐”,王艺迪遭翻盘|国乒|张本美和|奥运会开幕式_网易订阅
北京时间8月9日,2026年WTT横滨冠军赛结束女单半决赛争夺,两场对决呈现出截然不同的比赛走向。上半区的焦点外战中,国乒主力王艺迪在先胜一局的有利局面下,连续三局关键分失守,最终以2比4不敌日本选手
...[详细]
-
要吸干左手了,感觉世界赛圣枪又要送大的-英雄联盟丨LPL-虎扑社区
高泰明o(3级)楼主2026-08-09 16:12:24发布于辽宁要吸干左手了,感觉世界赛圣枪又要送大的由高泰明o发表在英雄联盟https://bbs.hupu.com/lol
...[详细]
-
中新社北京8月9日电 (陶思阅)中国国家统计局9日公布,尽管国内部分行业需求增加,但受输入性和季节性等因素影响,7月中国工业生产者出厂价格指数(PPI)环比下降0.7%;同比涨幅回落至3.5%。国家统
...[详细]
-
克雷桑单骑闯关破门,泰山队2-1绝杀,津门虎4连胜被终结,季胜攀又扮奇兵|鲁能|中超|高准翼|辽宁铁人|克雷桑(足球运动员)|天津津门虎足球俱乐部_网易订阅
唐田只兵强马壮了一场,中超第22轮,山东泰山队迎战天津津门虎,泽卡、瓦科因为小的伤病问题,没有进入到首发名单,替补待命。泰山队本场只有3外援首发,买乌郎、杨瑞琦出战,面对保级对手,球队不想当“垫脚石”
...[详细]
-
我认为现阶段比较现实的一些转会想法。一起探讨下,不喜勿喷。-英超-曼联专区-虎扑社区
老特拉福德的西看台(4级)楼主2026-08-09 11:15:00发布于上海我认为现阶段比较现实的一些转会想法。一起探讨下,不喜勿喷。由老特拉福德的西看台发表在曼联专区https://bbs.hup
...[详细]
-
[流言板]热身赛:沙拉夫贾姆茨33分,蒙古男篮67-65战胜日本亚运队-CBA-CBA专区-虎扑社区
虎扑篮球资讯(1280级)楼主2026-08-09 16:37:14发布于上海[流言板]热身赛:沙拉夫贾姆茨33分,蒙古男篮67-65战胜日本亚运队由虎扑篮球资讯发表在CBA专区https://bbs
...[详细]
-
经济高质量发展里的“心”与“新”|向西开放筑枢纽 丝路核心启新程_实践_京顺利_政策研究室
2026年上半年发展改革形势通报会于7月30日在京顺利召开,国家发展改革委政策研究室联合中国新闻网、中宏网推出“经济高质量发展里的心与新——2026上半年因地制宜促发展实践”系列报道,展现“十五五”开
...[详细]
-
中新网哈尔滨8月9日电 (记者 刘锡菊)8日,由北京燕京八绝博物馆、哈尔滨市博物馆共同主办的“京韵宫艺汇耀龙江——燕京八绝哈尔滨展示中心”启动仪式在哈尔滨市博物馆举行。来自京哈两地的工艺美术大师等齐聚
...[详细]
-
特纳:刚练瑜伽的时候被队友嘲笑 但它真的改变了我的职业生涯|冥想|普拉提|女裁判|约瑟夫·玛罗德·威廉·特纳_网易订阅
北京时间8月9日,雄鹿球员迈尔斯-特纳在播客节目中透露,瑜伽显著提升了他的耐久力、呼吸节奏和心理状态,他直言这项训练"拯救了他的NBA生涯"。特纳在节目中说道:"我开始接触一种不同形式的瑜伽,叫作'空
...[详细]
热点阅读
随机内容
- [流言板]热身赛:胡瑞燕17分3板,中国U18女篮95-53大胜世新大学女篮-CBA-CBA专区-虎扑社区
- 世体:巴黎对费兰-托雷斯转会乐观,转会费可能为5000万欧|法国|十大中场|巴塞罗那队|尤文图斯队|巴黎圣日耳曼_网易订阅
- 日本二队惨遭世界排名108蒙古绝杀-CBA-CBA专区-虎扑社区
- 陈幸同4-1力克蒯曼强势晋级,决赛对阵张本美和能否捍卫女乒荣耀|大满贯_网易订阅
- 十大机构看后市:业绩期是主线行情演绎的关键变奏点,短期内市场或继续反弹,关注三条业绩主线_新浪财经_新浪网
- 奇幻小说改编游戏今秋发售 NS与NS2推出实体版|冒险游戏_网易订阅
- 上市公司业绩预告总体经营稳健 折射经济韧性_南方网


