DeepSeek 发布会

DeepSeek-V4.1-Flash

Pushing the Limits of KV Cache Compression

议程

六幕,讲透一次瘦身

🎬
01
开场·问题
🏗️
02
架构 CED+CSA2
⚙️
03
系统四件套
📚
04
预训练 45T
🤖
05
后训练兵工厂
🏆
06
成绩·开源

为什么是现在

Agent 开始长跑,
内存先撑不住了

  • 工作负载变成 input-heavy:输出不贵,背着的历史贵
  • 预填充依然贵,几十万 token 实打实算
  • KV 缓存同时压爆显存、硬盘与带宽
上下文 → 100 万 tokens显存KV 缓存告急硬盘历史落盘告急带宽搬运带宽告急三座大山同时压过来(示意)

隆重发布

552B
混合专家骨干参数
100 万
上下文 tokens
16B / 8B
解码 / 预填充激活
总参数552B解码激活16B预填充激活8B条长度非等比,示意个子大、饭量小

两大杀器之一

890 bytes / token

  • CSA2 跨层复用,加 FP4 精度
  • 约为 V4-Flash 的 1/4,相对 V1 约 437 倍压缩
Global KV Cache Per TokenDeepSeek-V12023.11389,120DeepSeek-V3.22025.1248,0688.1× smallerDeepSeek-V4-Flash2026.043,51413.7× smallerDeepSeek-V4.1-Flash2026.098903.9× smallerGlobal KV Cache Per Token (Bytes, log scale)四代 KV 对比(简化重绘)

先看成绩

DeepSeek-V4.1-FlashKimi-K3GLM-5.3Opus5GPT5.6-Sol0408030.0Terminal-Bench 3.074.2DeepSWE v1.188.1CyberGym54.8Automation-BenchFigure 1(a) Agentic 基准(重绘)
  • DeepSWE 74.2,CyberGym 88.1,Automation 54.8
  • Terminal-Bench 3.0 为 30.0,落后,还需努力

骨架 · 因果编码器-解码器

读书轻装,
考试全力

  • 40 层 = 20 层编码器 + 20 层解码器
  • 前两层纯 SWA,其余 CSA2
40 层一分为二:读得便宜,考得全力Text EmbeddingVision EncoderVision EmbeddingEngram196B 外挂记忆Single-Pass mHC一次搬运,直达下限Causal Encoder x20SWA x2底层滑窗CSA2 Full x1全算,产出索引CSA2 Reuse复用 KV 与下标MoE 前馈Decoder x20CSA2 Full首层扫全场Reindex / Reuse只看候选池候选池 Top-512DSpark 草稿加速CED前往 Decoder 细看三种注意力模式Figure 3 总体架构(简化重绘)

杀器 · 压缩稀疏注意力二代

三种模式:现算还是复用,越往右越省Main KVIndexer KTop-K 下标Full自己全算全现算Reindex复用 KV,重算选择重算 Top-KReuseKV 与下标全复用连下标都复用绿=现算黄=复用 Main KV / Indexer K红=复用 Top-K 下标Figure 4 三种模式(简化重绘)
  • Full 自己全算
  • Reindex 复用 KV,重算选择
  • Reuse KV 与下标全复用

索引 · 分层稀疏

从扫全场,
到只看候选池

  • 首个 Full 层全量打分,产出 Top-512
  • 深层只在池内重打分,代价与长度无关
首层扫全场,之后只看候选池Full 层第一个 CSA2 层全场位置逐一打分Top-512共享候选池只留中选的块Reindex 层深层,只看池内代价与长度无关候选池复用于所有深层蓝格=选中的位置与块Figure 5 索引漏斗(简化重绘)

高效扩展

四个零件,各管一处浪费

  • Single-Pass mHC:搬运量直达下限
  • Engram:196B 外挂记忆,记忆与计算解耦
  • DSpark:草稿加速解码
  • FP4 主 KV:相对 FP8 近乎减半 (SWA 留 FP8)
Single-Pass mHC搬运直达下限Engram 196B记忆计算解耦DSpark草稿加速解码FP4 主 KV相对 FP8 近乎减半四件套,各管一处浪费

部署侧杀器

持久缓存,1/8

  • 只重放最近 n_win 个 token,性能几乎无损
  • 去 SWA 落盘,乘以全局 1/4
  • 10% 内存分钟级池兜底,SSD 保底 72 小时
全量历史100%只重放窗口1/8持久缓存压到 1/8,效果几乎不掉历史不用全存,只留最近一小段

预训练

45T
多模态 tokens
64K → 1M
34T 处扩展上下文
100.6M
batch tokens
034T64K → 1M 上下文一次扩展到位45T多模态喂到饱batch 开到 100.6M tokens,大水漫灌先喂大,再拉长,一次到位

预训练 · 后劲

Bits-Per-Byte 越低越好Internal DocsV4-FlashV4-Pro0.564V4.1-FlashInternal Code ReposV4-FlashV4-Pro0.1443V4.1-FlashAcademic MaterialsV4-FlashV4-Pro0.4305V4.1-FlashFigure 6 BPB(简化重绘)
  • 内部文档 0.564,代码库 0.1443,学术 0.4305
  • MATH 等三项落后 Pro,还需努力

后训练

给 Agent 造一座兵工厂

  • 大规模合成任务三元组
  • 通用 Mock 工具线 + 多智能体协作线
  • 失败复放与 Fail-to-Pass 双轨
合成任务三元组任务 · 工具 · 答案,批量造数据双生产线Mock 工具线 + 多智能体协作线失败复放重练Fail-to-Pass 双轨,做错的题再做一遍数据不够,自己造;做错,重练

沙箱

2500+

单节点活容器,自研调度,隔离与防作弊拉满

每个小格都是一个活容器,坏一台不影响全局(示意)

可控推理力度

  • 三挡:max 100 / high 75 / low 50
  • 25→100:67.1%→76.3%,约 2.5 倍 token
  • 60–80 覆盖大半涨幅,最划算
推理力度越大,分数越高(60-80 最划算)最划算 60-806466687072747678255075100Reasoning effortlow 50high 75max 100输出 token(虚线)67.1%76.3%Pass@1(实线)曲线为示意,端点为实测值Figure 9 力度曲线(简化重绘)
74.2%
DeepSWE
90.6%
Terminal-Bench 2.1
3471
Codeforces
V4.1-Flash(本代)对手旗舰上代 V4-FlashDeepSWE v1.1(%)V4.1-Flash74.2%Opus-5GPT-5.6 Sol上代Terminal-Bench 2.1(%)V4.1-Flash90.6%Opus-5GPT-5.6 SolGLM-5.3Codeforces(分,轴起于 3000)V4.1-Flash3471V4-Pro上代小个子超前辈:三项关键榜同源对比(简化重绘)

多智能体

单智能体 vs 多智能体(期限拉满时)20.39%单智能体30.04%多智能体ProgramBench 金题1728h 期限28.20%单智能体32.90%多智能体FrontierSWE v220h 期限Figure 10 单 vs 多智能体(简化重绘)
  • Agent Team:1 个 lead 异步拉起一群 teammate,共享仓库,邮箱加任务板分工,lead 复核测试再收口
  • 172 金牌任务 Almost@1:30.04%(单兵 20.39%);FrontierSWE Mean@5:32.90%(单兵 28.20%)
  • deadline 拉到 12 小时 / 20 小时,每个 deadline 全赢;协作奖励加衍生延迟惩罚,真并行不瞎同步

局限与未来

坦诚,然后继续扩展

  • 日常体验可比旗舰,最难推理与边角案例仍有差距
  • 下一步:架构、预训练、后训练联合扩展
架构预训练后训练联合扩展今天是压缩的极限,不是终点三个方向一起加码

开源

huggingface.co
deepseek-ai/DeepSeek-V4.1-Flash

📦
01
模型权重
📄
02
论文报告
💻
03
配套代码

论文、代码、模型全公开,欢迎来验,谢谢大家

提词 · 按 N 开关 · ←/→ 翻页