← 返回 Siami 首頁

DeepSeek V4-Flash Vision-Exp 上線:Flash 級價格逼近 Opus-4.8 多模態

▲ 472 💬 149
DeepSeek V4-Flash Vision-Exp 上線:Flash 級價格逼近 Opus-4.8 多模態

DeepSeek 於 2026 年 8 月 21 日正式上線全新的實驗型多模態模型「deepseek-v4-flash-vision-exp」,並同步釋出 Files API。這個模型的文字能力與 V4-Flash 對齊,但把多模態 Agent 的整體表現一口氣拉到逼近 Opus-4.8 的區間,搭配 DeepSeek Harness 0.1.1 開箱即用的支援,開發者當天就能把視覺理解接到自己的 agent 工作流。

這次推出的是什麼

V4-Flash-Vision-Exp 是 DeepSeek 第一個原生支援圖文混合輸入的「V4-Flash 系列」視覺變體,官方公告直接寫明「文字端與 V4-Flash 一致——包含 agent、推理、世界知識」。換句話說,它不是把視覺當附加功能,而是讓 V4-Flash 本來就能跑 agent 的能力,長出眼睛。

在多模態 agent 基準上,V4-Flash-Vision-Exp 比純文字版 V4-Flash 大幅躍進,官方宣稱已經「逼近 Opus-4.8」。考量到 V4-Flash 的定價遠低於 Opus,這個「逼近」的意義在於:開發者可以用 Flash 級的預算,拿到接近頂級閉源模型的視覺 agent 表現。

編按:DeepSeek 在公告裡直接拿 Opus-4.8 對比,在中國廠商的公開 release notes 中相當少見,顯示這次官方對自家模型的視覺能力相當有信心。

API 怎麼用:三種丟圖方式

模型接受標準 OpenAI 相容的 Chat Completions 格式,content 改用 block 陣列,而非純字串。Responses API 也同步支援,差別只在圖片改放在 input_image 區塊裡。

所有 base_url 都是 https://api.deepseek.com,呼叫端用熟悉的 OpenAI SDK 即可。

方法一:Base64 內嵌(本地檔最方便)

直接把圖片編碼後塞進 data: URL。優點是零設定,缺點是這份 base64 會算進 48 MiB 的請求體上限。

import base64
from openai import OpenAI

client = OpenAI(api_key="<DeepSeek API Key>", base_url="https://api.deepseek.com")

with open("image.jpg", "rb") as f:
    b64 = base64.b64encode(f.read()).decode("utf-8")

response = client.chat.completions.create(
    model="deepseek-v4-flash-vision-exp",
    messages=[{
        "role": "user",
        "content": [
            {"type": "text", "text": "這張圖裡有什麼?"},
            {"type": "image_url", "image_url": {"url": f"data:image/jpeg;base64,{b64}"}},
        ],
    }],
)
print(response.choices[0].message.content)

方法二:外部圖片 URL(模型自己抓)

丟一個公開的 http(s) 連結給模型,DeepSeek 會自己下載。三條硬限制:URL 不超過 8192 字元、單檔最大 32 MiB、模型必須在 60 秒內下載完成。超過就用方法一或方法三。

response = client.chat.completions.create(
    model="deepseek-v4-flash-vision-exp",
    messages=[{
        "role": "user",
        "content": [
            {"type": "text", "text": "描述這張圖。"},
            {"type": "image_url", "image_url": {"url": "https://example.com/image.jpg"}},
        ],
    }],
)

方法三:Files API 引用檔案 ID(重用同一張圖)

用 Files API 上傳一次,之後在多輪請求裡都用 file_id 引用。同一張圖不會被重複上傳,節省頻寬;單張上限拉到 64 MiB,且不受 32 MiB 的單圖檢查限制。

# 先上傳取得 file_id(形式如 file-api-xxxxxxxxxxxxxxxx)
response = client.chat.completions.create(
    model="deepseek-v4-flash-vision-exp",
    messages=[{
        "role": "user",
        "content": [
            {"type": "text", "text": "這張圖裡有什麼?"},
            {"type": "file", "file_id": "file-api-xxxxxxxxxxxxxxxx"},
        ],
    }],
)

圖片 token 怎麼算

V4-Flash-Vision-Exp 把圖片按尺寸轉成 tokens,跟文字 token 一起計費。視覺模型通常最容易讓人驚嚇帳單,所以這條規則要記住:

  • 圖片一律先 resize:總像素小於 384×384 會等比例放大;較大的圖會等比例縮小,目標是把像素總量壓到接近 800×800。
  • 單張圖片最多算 384 tokens,且沿用 V4-Flash 的價格(Flash 級費率)。

對於 image_url 輸入,可以額外帶 detail 欄位控制處理方式:

  • low:縮到 512×512 再推論。最便宜,適合不需要細節的文字分類、標籤任務。
  • high / original / auto:保留原圖;三者目前效果相同,auto 預留未來自動調度的空間。

Files API 同步上線

這次連帶推出的 Files API 直接寫在官方公告標題上,被定位為「圖文 agent 的標配基礎建設」:

  • 免費使用——只有模型推論才收錢,儲存與上傳本身不另計費
  • 重複利用——同一張 file_id 可以在多輪請求裡重複引用,避免重複上傳相同圖片
  • 大圖支援——單張上限 64 MiB,比直接 inline 的 32 MiB 多一倍

實務上的最佳組合是:大圖、長 context、重複使用的素材(例如產品型錄、設計稿),先丟 Files API 拿 file_id,之後的對話全部走引用;短暫的小圖就直接 base64 inline,免去檔案生命週期管理。


為什麼這件事重要

這次 V4-Flash-Vision-Exp 的關鍵訊號不在「DeepSeek 也會看圖了」這種技術表層,而在於三件事同時發生:

第一,V4-Flash 系列的價格帶與頂級視覺模型出現重疊。 Opus-4.8 級的多模態能力如果真能由 V4-Flash 價格帶的模型交付,對 Anthropic 與 OpenAI 的高階 vision 模型會形成實質價格壓力——尤其是對成本敏感的 agent 產品(批次處理、客服視覺理解、電商商品分析)。

第二,Files API 顯示 DeepSeek 在做「agent 生態系的底層」。 從 V4 系列發布以來,DeepSeek 同步推 Harness、推 Files API、推 Responses API 相容——這些都不是模型本身的差別化,而是把模型包進可被 agent 框架(Harness、LangChain、Anthropic API 相容層)順利取用的介面層。這條路徑接近 Claude 的 Skills/Artifacts 策略,但走的是「API 級別標準化」而非「產品內建工具」。

第三,中國頂尖 AI 廠在視覺模型上正式跨過「可用」門檻。 過去中國 vision 模型多被定位為「追趕者」,V4-Flash-Vision-Exp 這次直接以「逼近 Opus-4.8」自我標定,並且端出實作細節(384 tokens 上限、800×800 resize、Files API),顯示不再只是「有沒有」,而是「怎麼用、怎麼省」的工程問題。


數據解讀:三個值得質疑的數字

官方公告很短,但藏了幾個關鍵數字值得拆開看:

「逼近 Opus-4.8」沒給具體基準。 DeepSeek 沒有在 release notes 列出任何一個公開 benchmark 的分數——沒有 VLM 排名、沒有 MMMU、沒有 ChartQA、沒有 DocVQA。「逼近」可以是 95%、也可以是 80%,差一個字差一個時代。實際部署前必須自行跑任務評估。

HN 用戶 @leumon 實測:V4-Flash-Vision-Exp 在「時鐘顯示幾點」這種基礎視覺推理上答成 5:10,連時針、分針、秒針的顏色和長度都搞錯;同一張圖 Qwen3.8 27B 答對 8:10。

「圖片 384 tokens 上限」是設計選擇。 這數字遠低於 GPT-4o 的 ~1500 tokens(高細節模式),也比 Claude 的視覺 tiling 少。意思是 DeepSeek 把視覺資訊壓得很狠,細節辨識(例如圖表小字、醫療影像)可能會被 resize 過程吃掉。detail: low 模式直接壓到 512×512,等同宣告「我們不走高清路線」。

HN 用戶 @gozucito 點出:800×800 實際只有 0.64 megapixel,連 1995 年的 Super VGA(0.79 MP)都不如;真正的分水嶺約在 1080p,這解析度幾乎什麼都夠,只剩小字和細節會丟失。

Files API 雖然「免費」但仍屬 DeepSeek 帳號綁定。 沒有跨廠商檔案 ID 互通、沒有開放標準、檔案生命週期(保留多久、能不能刪)未公告。對企業用戶來說,這意味著圖片資產的託管位置被鎖在 DeepSeek 帳號下,合規與資料主權需要另議。

HN 用戶 @jerkstate 的地標辨識 benchmark:Seed 2.1 Turbo 12 題答對 11 題,DeepSeek 只對 6 題——曼哈頓大橋被誤認成布魯克林大橋、Chartres 教堂被當成巴黎聖母院。


開始試用

API 已在 https://api-docs.deepseek.com/guides/vision 開放,文件列出完整程式碼範例(Python 與 cURL 都有)。DeepSeek Harness 0.1.1 也同步釋出,讓 agent 框架可以開箱即用新模型,不必等各框架官方適配。

對台灣與中文圈開發者來說,V4-Flash-Vision-Exp 最直接的吸引力是:用 Flash 級的價格拿到 Flash 級的文字 + 接近頂級的視覺,加上 DeepSeek API 在中文任務上的既有強項,這是 2026 年下半年多模態 agent 值得放進評估清單的選項——前提是,自己跑一遍業務真實資料再下結論。

編按:本文綜合整理自 DeepSeek 官方公告 2026-08-21、Vision API 文件,並加入 Siami 編輯部觀點與分析。原始公告為英文,本文技術細節(384 tokens 上限、800×800 resize 規則、Files API 上限)皆出自官方文件原文。

網友熱門留言 (5)

#1 leumon 0
它在我這裡的簡單時鐘測試就掛了,Qwen3.8 27B 答得(幾乎)正確。DeepSeek 答 5:10,但搞錯時針、分針、秒針的顏色和長度;Qwen 答對了 8:10。
#2 LorenDB 0
DeepSeek V4 Flash 0730 版常常以為自己有 vision 能力,結果發現真的看不到時,自己掰一個文字版『圖片分析工具』出來。這次升級對 model 來說是個大改進。
#3 v9v 0
有趣。DeepSeek 創辦人不是說過他們明確決定不做 multimodal,要專攻 text-only,因為相信文字就能通往 AGI?
#4 gozucito 0
800×800 是 0.64 megapixel,比 1995 年的電腦螢幕解析度還低。對不少用途算堪用,但分水嶺大約在 1080p,這解析度幾乎什麼都夠,只剩小字和細節會丟失。
#5 jerkstate 0
我用 12 張地標圖跑 benchmark,Seed 2.1 Turbo 答對 11 張,DeepSeek 只答對 6 張。曼哈頓大橋被誤認成布魯克林大橋、沙利斯伯里教堂跟威爾斯教堂分不出來。