📄 文章总结:《一夜之间,DeepSeek V4 Pro和Grok 4.6把全球大模型推入了新的斩杀线。》
公众号: 数字生命卡兹克 | 分类: LLM | 收录日期: 2026-08-13 原链接: https://mp.weixin.qq.com/s/JDYKMEbLYMSAUGnxut7C0g
一夜之间,DeepSeek V4 Pro和Grok 4.6把全球大模型推入了新的斩杀线。
公众号:数字生命卡兹克
一、今日发布概览与个人选择
今天发生了两件大事:DeepSeek V4 Pro正式版发布,Grok 4.6正式发布,二者相隔不到2小时。有趣的是,这两个都是同等参数模型,一个1.6T,一个1.5T,但都在今晚逼近了Claude Fable 5的体验。
作者在体验完后“用脚投票”:人生第一次为Grok怒氪了300美元的SuperGrok Heavy会员,同时给DeepSeek的API充了1000块钱额度,雨露均沾。
作者认为,这两个模型发布后,大模型市场会有一层非常鲜明的斩杀线,这一轮大模型可能会淘汰很多玩家。从曾经Claude遥遥领先、让人感受到绝望的差距,到现在“各领风骚好几周”,也才不过短短3、4个月。
二、作者更新后的常用AI组合
- 未来的日常主力Vibe Coding产品:使用Grok Build + Grok 4.6,理由后面会说。
- ChatGPT和Codex:继续负责最困难、绝对不能出任何差池的超大型任务,以及日常所有办公任务、创意、内容生产,还有浏览器操控和电脑操控相关。
- DeepSeek V4 Pro正式版:因为无与伦比的性价比,大量不要求实时反馈的自动化任务、异步任务,以及作者开发产品(如AIHOT)里的一些自动化Agent工作交给它。
这是作者今晚重新分配后暂时形成的模型组合,是目前自己用着最舒服的最优解,未来新模型诞生后可能会变。
三、大模型的不可能三角
作者认为,大模型存在一个很难同时满足的不可能三角:性能、价格、速度。前两项讨论最多,最后一项常被遗忘。速度不只跟模型有关,也跟厂商的推理能力、算力储备有关。
作者每天接近十个小时几乎都在让各种Agent不停歇地干活,速度至关重要。作者已经快接受不了Codex用GPT-5.6 Sol正常模式的速度:一个任务十几分钟很常见,半小时起步不稀奇,有些任务常干到一个小时。最讨厌的就是十几分钟或半小时一个反馈,时间被切成碎片,只能百无聊赖地刷X,导致刷X时间暴涨。
所以最近用Codex常年被迫开Fast模式,200刀会员的额度随便跑两天就撑不住。这是非常现实的情况。
聪明但贵的模型(如Claude Fable 5、GPT-5.6 Sol)经常又贵又慢;便宜的(如DeepSeek V4 Flash)速度快但性能差一截;速度快性能好的基本就是各种Fast模式,也便宜不了。这就是大模型的不可能三角,也是整个行业的斩杀线。
四、不可能三角被撕开口子
就在今天凌晨,DeepSeek V4 Pro和Grok 4.6从两个方向一起把这个不可能三角逐渐撕开了一个口子。
按照目前定价,DeepSeek把Fable级Agent能力压到了百万输出Token 0.87美元。虽然之前发过涨价预告,不知道涨价后多少,但作者觉得应该超不过2美元。
Grok 4.6把接近Fable 5的综合能力变成了2美元输入、6美元输出的价格,还给了一个快到有点离谱的真实开发体验。
新的斩杀线形成。作者把那幅著名的大模型斩杀线图补上了这次的DeepSeek V4 Pro和Grok 4.6。DeepSeek V4 Pro的分因为还没出,作者根据跑分估计是56~58左右。“大模型世界,再无活口,全面覆盖。”
五、DeepSeek V4 Pro:跑分表现
跑分看着比较夸张,但只需关注两个:
- Terminal Bench 2.1:可简单理解成让模型自己进入电脑终端,装环境、敲命令、处理报错,最后真的把任务做完。DeepSeek V4 Pro预览版只有72.1,正式版直接涨到87.9,而Fable 5是88.0,只差0.1。
- DeepSWE:作者重点看的评测集,更接近真实软件开发,模型需要自己读懂一个代码项目,再处理复杂工程问题。DeepSeek从12.8一路冲到62.7,一次涨了将近50分。Fable 5是70分,DeepSeek依然有差距,但已经从几乎干不了变得能干活一点了。
其他代码仓库理解、网络安全、自动化和工具调用,趋势差不多:只要给它工具,让它真的开始操作环境,DeepSeek V4 Pro就会迅速逼近Fable 5,个别项目甚至能超过。
短板也很清楚:不使用工具、只考模型自身知识和推理时,和Fable 5差十几分;碰到最困难的软件工程和复杂全栈任务,依然会落后几分。作者更愿意把它叫作“Agent和Coding领域的准Fable级模型”。它在工具环境里的战斗力已经进入第一梯队,但纯知识、困难软件工程和超长期稳定性,作者自己测试下来感觉有点问题。还有一个致命点:还是没有多模态。但在如此离谱的价格和缓存命中率下,也不算啥。
六、DeepSeek V4 Pro:价格优势与速度短板
Fable 5的API价格是百万输入Token 10美元,百万输出Token 50美元。DeepSeek V4 Pro当前是百万输入Token 0.43美元,百万输出Token 0.87美元,缓存命中输入只有0.0036美元。普通输入大约便宜23倍,输出大约便宜57倍,缓存命中输入的差距接近276倍。DeepSeek的缓存技术过于黑科技,不仅便宜,命中率还极高。“这个价格,还挑个屁对吧。”当然,前提是DeepSeek V4 Pro不涨价;如果涨价不多,未来搭配WorkBuddy就是新一代真神组合。
作者把DeepSeek V4 Pro直接接进Claude Code,实际跑了一些开发和Agent任务。能力不错,尤其是开发和工具调用,能明显感觉到和预览版已经是两种状态(预览版被作者吐槽过很多)。现在至少可以,不开发大活基本分辨不出区别。这个模型在经济价值上直接就是新一代斩杀线。
但不可能三角定理仍在:DeepSeek V4 Pro实际开发速度真的挺一般。尤其当作者同步用Grok 4.6时,那边都跑三任务了,这边一个还没跑完,速度对比强烈。不过如果对任务实时性和速度要求没那么高,或者跑异步自动化,那这就是当今完美的模型。以前作者习惯把自动化任务挂在Codex上,今天基本全切到DeepSeek V4 Pro了。
七、Grok 4.6:新宠
作者认为Grok 4.6是当今唯一一个快把不可能三角拉满的模型:综合性能媲美Claude Fable 5,速度快到飞起,价格比DeepSeek这种价格屠夫要贵,但相比现在OpenAI和Anthropic的旗舰模型直接砍了好几倍。
Grok 4.6 API起步价是百万输入Token 2美元、输出Token 6美元,输入比Fable 5便宜5倍,输出便宜约8.3倍。虽然价格和性能跟Kimi K3差不多,但不能这么算,因为老马家有订阅。
作者今天开了300刀的SuperGrok Heavy,而且现在有活动,订阅SuperGrok Heavy可直接送Cursor价值200刀的Ultra会员。也就是300刀能享受两个会员订阅的额度。
SuperGrok Heavy的额度有多离谱:作者从2点多订阅完,一直用Grok Build和Coding到早上6点,4个小时,额度一共只消耗2%;从1跳到2%还是5点半左右涨的。前3个半小时一直开发,还用Heavy开了N个Agent去深度调研,只用掉周额度的1%。即使知道第一周包含双倍用量,这依然太离谱。按这个额度算,绝对便宜没边,还没算Cursor额度。
综合性能极强,跟Kimi K3比,除了前端审美差一些,其他没啥区别。在真实世界任务(如财务模型、PPT、法律案件)中,Grok还能赢一些;但短板依然是开发和Agent,确实比Fable 5差一些,所以也是准Fable级模型。
开发速度舒适得无以复加:作者用Grok 4.6连续开发了大概四小时,几乎没有碰到超过20分钟的任务,有些任务甚至3分钟就结束且不减质量。这是用Codex时几乎从没体验过的速度。过去一个任务跑十几分钟、半小时甚至一小时,人快被磨麻,绝大多数时间在等;今天用Grok 4.6开发,久违地感受到了跟Agent之间交互的感觉。作者相信:很多时候,速度也会把模型的智力真正变成生产力。这个不可能三角,今天老马做到了,Grok 4.6做到了。
所以作者在开头说,从今天开始把日常主力开发全部切换到Grok Build + Grok 4.6上,“爽怎就一个字了得”。而且老马放话:Grok 4.7要超越所有模型。这一次,作者信老马。
八、新的斩杀线:市场标准被抬高
为什么说DeepSeek V4 Pro和Grok 4.6会把一众大模型推入斩杀线?
因为斩杀线首先斩掉的是一个模型继续傲慢下去的资格。过去大模型市场大家都可以找到自己的生存空间:能力最强的可以贵一点、慢一点;能力弱一些的可以靠低价抢用户;速度足够快的可以专门承接简单任务。因为不可能三角存在,每个模型都有短板,用户只能接受各种妥协。
但今天这个市场的最低标准变得不一样了。DeepSeek V4 Pro告诉所有人:准Fable级的Agent能力,百万输出Token可以只要0.87美元(后面还会涨,但估计也就2美元)。Grok 4.6则告诉所有人:一个综合性能接近Fable 5的模型,可以同时拥有极快的开发速度,以及高强度使用几个小时才掉百分之几的订阅额度。
当这两个东西同时出现后,夹在中间的模型就会非常难受。特别是Grok 4.6,基本在游戏里属于钻石分段守门员:“你要是打不过这两,我用你的意义在哪里?”整条斩杀线被DeepSeek V4 Pro和Grok 4.6向前推了一大截。
“这是一个最好的时代。但,也是一个最坏的时代。”
九、结语
以上,既然看到这里了,如果觉得不错,随手点个赞、在看、转发三连吧;如果想第一时间收到推送,也可以给我个星标⭐。谢谢你看我的文章,我们下次再见。
🎯 Friday 提炼
- DeepSeek V4 Pro正式版与Grok 4.6在2小时内先后发布,分别以1.6T和1.5T参数逼近Claude Fable 5体验,作者第一时间氪金支持并重新分配了自己的AI工具组合。
- 大模型的“不可能三角”——性能、价格、速度——正在被撕开口子:DeepSeek把准Fable级Agent能力压到百万输出Token 0.87美元,Grok 4.6以2美元/6美元的价格和极快速度提供了接近Fable 5的综合能力。
- DeepSeek V4 Pro在Terminal Bench 2.1上从72.1涨到87.9(Fable 5为88.0),DeepSWE从12.8冲到62.7(Fable 5为70),仍缺多模态,且实际开发速度一般,但性价比极高。
- Grok 4.6开发体验极佳:几乎无超20分钟任务,SuperGrok Heavy订阅4小时仅消耗2%周额度,还送Cursor Ultra会员,作者将其列为主力Vibe Coding产品。
- 新的“斩杀线”形成:夹在DeepSeek V4 Pro和Grok 4.6之间的模型将非常难受,市场最低标准被大幅抬高,大模型世界“再无活口,全面覆盖”。
一句话: DeepSeek V4 Pro和Grok 4.6从价格与速度两个方向撕开了大模型的“不可能三角”,把性能接近Claude Fable 5的能力拉到了极低成本,全球大模型市场被推入了新的斩杀线。
💡 Friday 看法
文章里说的“不可能三角”我太有同感了,现在每天用Agent干活,速度和价格往往比那几分性能差距更影响体验。DeepSeek V4 Pro这个价格和缓存命中率确实离谱,但我也担心它像之前Flash一样热度一高就偷偷降速或涨价,希望别把“性价比”变成“一次性”的。至于Grok 4.6,300美元会员我是真舍不得,但看到作者说速度能快到把Codex衬托成PPT,又有点心动——毕竟等任务等出碎片化时间,确实是最磨人的。