Qwen3.8-27B 正式开源:27B 全参数,一张 4090 就能跑
来源: B 站 UP 主「探索未至之境」|转录+整理日期:2026-08-15 原文链接: https://b23.tv/yQlASyo 注意: 视频发布时模型尚未正式开源(北京时间 2026-08-15 晚 23:00 发布),文中规格以官方模型卡为准;本转录含 ASR 识别误差,个别名称已标注存疑。
一、为什么一个 27B 模型这么多人守着
- 千问 3.8 27B 北京时间今晚 11 点正式开源。发布前 HuggingFace 模型页挂了整整一天的倒计时,6200+ 人点了「发布时通知」;ModelScope 页面也写明预计今晚 11 点。
- 官方定位一句话:「把旗舰能力塞进能放在你房间里的尺寸」。
二、模型基本盘
- 27B 全参数稠密模型(dense,非 MoE)。
- 内存/显存测算:17GB 就能跑起来,量化到 Q4 约 16GB——一张 4090 就够了。
- 原生多模态:图片直接读,视频能看小时级别的长片。
- 上下文:原生约 26 万 tokens,用 YaRN 技术可拉到 100 万。
- 思考模式默认打开,可按请求关掉;推理深度三档可调,默认最高;多轮对话中历史推理过程默认保留,Agent 场景下决策更连贯。
三、架构:混合注意力(最核心的设计)
- 一共 64 层,每 4 层一组:前 3 层用 gated delta net(线性注意力),最后 1 层用完整的全注意力。
- 大白话解释:线性注意力省显存、长文本快,但精度差点;全注意力质量高,但贵。
- 千问的做法:让便宜的层干大部分活,每隔几层安插一个「贵的层」把质量拉回来。
- 还带了 MTP(一次预测多个 token),推理速度更快。
- 就靠这套搭法,26 万上下文一张卡也跑得动。
四、发布过程回顾(还挺折腾)
- 8 月 3 日:千问官方宣布 Qwen3.8 Max(2.4 万亿参数),同时预告 27B 也会开源——那条推文拿了 2.3 万个赞。
- 8 月 12 日:先放出来的是 2.4T 的 Max 权重——第一次开放权重,约 4.89TB 切成 213 个分片,而且是纯文本版(视觉能力留在付费版里)。最受期待的 27B 当天没发,社区一片「又割了」。
- 8 月 13 日:HuggingFace 上线预发布页面,ModelScope 官方账号亲自发倒计时,这才算实锤。
- 8 月 15 日上午:官方开直播讲这批模型背后的故事;晚上 11 点 27B 准时开源。
五、社区热度
- X 上的讨论热度,「有人说比漫威电影还火」。
- 「17GB 就能跑」那条推文 7700+ 赞、接近 100 万浏览。
- 做医疗 AI 的 OpenMap(转录存疑)直接放话要拿它微调各种医疗场景(2000+ 赞)。
- 还有人等不及,官方没发倒计时网站,粉丝自己做了一个。
- 日本玩家在琢磨怎么用 SSD 流式加载,把 2.4T 的量化版塞进 128GB 内存里跑。
六、开源生态大背景
- 这周七天放出来七个开源权重:4.6(转录存疑,可能为某模型名)、Gemini 3.7 flash、DeepSeek V4 Pro、GLM 5.3、mglimmer(转录存疑)、Qwen3.8 的 2.4T,再加上今晚这个 27B。
- 两年前,这是一整年的量。
七、部署与接入
- 权重已放出,路子很清楚:transformers、vLLM、SGLang、TensorRT-LLM 都支持。
- 官方给了两套采样参数推荐:思考模式 temperature 1.0,非思考模式 0.7。
- 不想折腾基础设施 → 等千问 Cloud 托管版:默认 100 万上下文,带官方内置工具,模型卡里写着「马上上线」。
- 本地微调圈:unsloth 这些工具大概率这几天就会跟进。
- 权重落地后,接下来几天各家跑分马上就会刷屏。
📌 Friday 查证附注(2026-08-15 10:30,模型发布前)
- ✅ Qwen3.8-Max 真实存在:官方 2026-08-03 发布,2.4T 参数 / 95B 激活 MoE / 多模态 / 1M 上下文,
qwen3.8-maxAPI 已上线。 - ✅ Qwen3.8-27B 真实存在:GitHub 8/14 已出现部署项目——MiaAI-Lab/Qwen3.8-27B-DGX-Spark-RTX-6000、signalnine/q27(Quasar 推理引擎,明确支持「Qwen3.6-27B-MTP / Qwen3.8-27B」)。
- ✅ 混合注意力 + MTP 架构属实:signalnine/q27 README 确认「hybrid GDN+attention, trained-in MTP heads」,且支持 5090/3090/4090 单卡运行;其 262K 上下文窗口与视频「26 万上下文」吻合。
- ⚠️ 具体发布时间(今晚 23:00)、17GB/16GB 显存需求等细节以官方模型卡为准(模型尚未正式放出)。
🎯 Friday 提炼
- 27B dense + 混合注意力(每 4 层 3 线性 1 全量)+ MTP,核心卖点是「旗舰能力装进一张卡」——这是开源模型「小而精」路线的又一落点,和上周小红书 dots3-note(280B/16B 激活)思路同频。
- 发布节奏很有意思:Max 2.4T 先开放纯文本权重「吊胃口」,27B 隔三天再发,社区情绪被拉满——阿里这波营销节奏是算过的。
- 混合注意力(gated delta net + 全注意力交错)是 2026 年长上下文小模型的主流解法,等于把「贵的注意力用在刀刃上」。
- 对哥哥的意义:如果手头有 4090(或 3090/24GB 级别显卡),这类 27B dense 模型是本地部署 Agent/推理的甜点尺寸——17GB 显存门槛比想象中低。
一句话: Qwen3.8-27B(27B 全参数稠密、混合 GDN 注意力 + MTP、26 万原生上下文可拉 100 万、一张 4090 就能跑)今晚 23:00 正式开源,是阿里「旗舰能力塞进单卡」路线的关键落子,社区热度极高。