DeepSeek V4.1-Flash 拆解:8B prefill 打贏旗艦、KV cache 縮到 1/4

2026-09-28 · AI 實戰 · Eric Cheung

發佈:2026年9月10日,V4.1-Flash 直接取代 V4-Pro

DeepSeek 喺 2026年9月10日發佈 DeepSeek-V4.1-Flash,官方定位係「新架構家族裡面最細嘅一隻」,同時開源權重同出技術報告。最實用嘅一句係官方自己講:多個第三方測試顯示 V4.1-Flash 喺性能、成本、速度同總運行時間都超前旗艦 V4-Pro,所以佢開始淘汰 V4-Pro。

呢篇唔做轉載。對落地真正有影響嘅係四件事:① 佢點樣用 8B active 參數做 prefill;② KV cache 縮到四分之一,對 agent 成本結構有咩實際改變;③ 舊 model 名同 V4-Pro 流量會點被路由;④ 官方 benchmark 同第三方實測邊幾行要打折扣。價錢、規格同路由政策嚟自 DeepSeek 官方 news 頁同官方定價頁(2026年9月28日查),第三方資料會另外標明。

DeepSeek V4.1-Flash 拆解:8B prefill、1/4 KV cache、官方定價對比
DeepSeek V4.1-Flash 架構、KV cache 與定價拆解示意圖(上載時生成)

快速結論(TL;DR)


架構:CED 令讀入只動 8B、生成 16B

大模型推理分兩步:prefill(讀你嗰堆輸入、建立 KV cache)同 decode(逐個 token 生成輸出)。其他 MoE 模型兩步啟用相同參數量,V4.1-Flash 就將成個骨幹拆成一個 20 層 causal encoder 加一個 20 層 decoder,decoder 嘅 KV cache 直接由 encoder 輸出投影出嚟 —— 所以 prefill 只需要跑 encoder。

對 agent 嘅意義好直接:一個 agent 迴圈每一步都會重發大部分相同 context,所以**讀入 token 通常遠多過輸出 token**。以前每步都要用 13B active 讀一次;而家用 8B 讀、16B 寫,成本重心就跟實際 token 分佈對齊。官方預訓練用咗 45T tokens 多模態語料,sparse attention 先喺 64K 序列長度訓練,到 34T tokens 時先擴到 1M context。


KV cache:HBM 減到 1/4、SSD 減到 1/8

長 context 嘅真正瓶頸往往唔係算力,而係 KV cache 佔幾多 HBM 同要唔要落 SSD。DeepSeek 官方數字:V4.1-Flash 嘅 KV cache 只需要上一代嘅 1/4 HBM 同 1/8 SSD 儲存;global KV 做到 890 bytes/token,同 V1 世代比差 437 倍。

呢三招合埋有兩重意義:一是記憶體帳單細咗,二是 cache hit 率 —— cache 細就放得落更多 context,prefix 命中嘅機會高,命中就直接跳過重算 attention,time-to-first-token 同每 GPU 吞吐一齊改善。官方自己都講「cache-hit 費用往往佔 agent 成本一大截」,所以壓縮 cache 係壓成本最直接嘅一步。


官方定價:比 V4-Pro 便宜 3.3 至 7.3 倍

一個實務提醒:離峰係一半價,唔係「平少少」。批量 job、夜跑 eval、文件摘要呢類可以排程嘅工作,排去離峰即係直接砍半;但實時 agent 就冇得揀,所以要靠 cache 命中率同 output 長度控制去省。價錢同 model 名單以官方定價頁為準,DeepSeek 明言有權改價。


遷移:舊 model 名會點、V4-Pro 流量去邊

官方亦講得好白:如果你係認真要自架大規模部署,「2,000 張 GPU 加一個儲存叢集」先值得坐低傾。細團隊同個人用 API 起步仍然係合理選擇,順帶一句 —— 呢個「KV cache 壓縮」方向唔止 DeepSeek 做,想睇本地/雲端之間點取捨可以參考 本地 vs 雲端 AI 分析。


Benchmark 點讀:Automation-Bench 54.8 即係仲有一半會失敗

一句總結 benchmark:V4.1-Flash 嘅定位係「接近旗艦嘅 agent 能力,但用少三分二參數、平一大截」,唔係「全面最強」。真正要決策嘅位唔係榜首,而係你嗰條 pipeline 最貴嘅部分係 prefill、cache hit 定 output —— 三樣嘅省錢幅度唔同,揀之前最好用自己嘅 workload 跑一次成本對比。


對實戰嘅意義

呢次發佈最值得學嘅唔係分數,而係成本結構被重新分配:輸入讀取唔再同輸出生成一樣貴,KV cache 由「買幾多 HBM」變成「cache 命中率有幾高」。

想睇上一個世代(V4-Flash 0731 對 V4-Pro)嘅定價同 benchmark 拆解,可以參考 DeepSeek V4 Flash vs V4 Pro 對比;如果關心嘅係企業層面點管 AI 成本,企業 AI 成本管理指南 有整套框架。