← 返回 Siami 首頁

DeepSeek 推出 Vision 模式:鯨魚終於看見了,多模態之戰進入下半場

▲ 141 💬 65
DeepSeek 推出 Vision 模式:鯨魚終於看見了,多模態之戰進入下半場

編按:本文綜合整理自 South China Morning Post 一手採訪TechNode 4/30 報導GenAI Assembling 深度分析MindStudio 技術分析TestingCatalog X 公告,並加入 Siami 編輯部觀點與分析。

中國 AI 新創 DeepSeek 4 月 29 日悄悄在其聊天機器人加入「圖像識別模式」(image recognition mode),首次讓旗下的旗艦模型具備多模態能力,能同時處理文字與圖片,向早已是標準配備的 OpenAI、Google 等對手看齊。這項功能目前以小規模灰度測試方式開放給部分使用者,並與本月初推出的「快速模式」、「專家模式」並列於 chat.deepseek.com 介面上。

從「看不見」到「看見」:DeepSeek 補上最後一塊拼圖

根據 DeepSeek 多模態團隊負責人 Chen Xiaokang 在社群平台上公布的訊息,這項新功能初期僅在 DeepSeek 的聊天機器人網站與手機 App 對部分使用者開放 beta 測試。隨後,資深研究員 Chen Deli 也轉發消息表示:「來試試我們天才多模態同事的精彩成果!」並寫下「小鯨魚現在看得見了」(the little whale can now see)—— 這句話呼應 DeepSeek 招牌的鯨魚 logo,也是 X 平台上研究員 Xiaokang Chen 4 月 29 日發布「Now, we see you.」配鯨魚摘眼罩圖的延伸意象。

在 DeepSeek 的聊天介面,新的「圖像識別模式」與「快速模式」、「專家模式」並列,後兩種模式都是本月初才剛推出。模式切換的位置說明 DeepSeek 刻意把多模態視為與「推理能力」同等位階的核心功能,而不是附屬於 OCR 或工具呼叫的延伸功能。

「多模態能力被視為 AI 從純文字對話跨越到更複雜、更具經濟價值領域的必要條件。」 — SCMP

事實上,DeepSeek 自 2025 年 1 月憑藉強推理能力與極低成本一炮而紅後,「缺乏多模態」一直被業界視為它的阿基里斯腱。從 VL、Janus、Janus-Pro、VL2 到 OCR、OCR-2,DeepSeek 過去兩年其實一直有開源釋出視覺語言模型,但都停留在研究層或 API 端,並未整合進消費級 chat 介面。這次 Vision mode 直接進入 chat.deepseek.com,是該公司首次把多模態能力交付到一般使用者手上

為什麼這件事重要

這不只是一次產品更新,而是 DeepSeek 從「文字推理王者」蛻變為「全模態對手」的關鍵節點。三個層次的意義值得展開:

第一,它驗證了「中國 AI 也能做出頂尖多模態」這條敘事。過去一年半,多模態領域幾乎是 OpenAI 的 GPT-4o/4.1、Google 的 Gemini、Anthropic 的 Claude 三家閉源模型的天下;中國陣營在開源端有 Qwen-VL、InternVL、Yi-VL,但在消費級整合深度上一直落後。DeepSeek 這次直接把 Vision 推到與「快速模式」並列的位置,等同宣告:中國 AI 的旗艦模型從今以後不再有「不能看圖」的退化學缺陷

第二,它對 Anthropic / OpenAI 構成真實的價格壓力。根據 MindStudio 引用被引用 DeepSeek《Thinking with Visual Primitives》論文的數據,DeepSeek V4 視覺模型每張 800×800 圖片只使用 約 90 個 KV cache entries,相比 Claude Sonnet 4.6 的 870 個整整少了 近 10 倍,也比 Qwen3-VL 的 660、GPT-5.4 的 740、Gemini 3 Flash 的 1100 都少得多。在七大公開視覺 benchmark 平均得分 77.2%,擊敗 Gemini 3 Flash 的 76.5% 與 GPT-5.4 的 71.1%。換言之:用戶可能用 1/10 的算力成本拿到接近或更好的結果

第三,它補上了 DeepSeek「論文被刪」的戲劇性拼圖。GenAI Assembling 觀察到,DeepSeek 在推出 Vision mode 同時發表了《Thinking with Visual Primitives》技術論文,卻不久後悄悄下架,沒有任何官方解釋。這份被下架的論文現在被社群保存在 Hugging Face 資料集(NodeLinker/deepseek-ai-Thinking-with-Visual-Primitives-deleted-repo),可見社群對這份研究的重視。下架本身不一定是負面訊號(可能只是準備正式發表到 arXiv),但確實給這次發布增添一層神祕色彩。

🚨 數據解讀

把上述所有外部資料整合後,可以畫出一張「DeepSeek Vision 對其他旗艦視覺模型的綜合對照表」:

模型800×800 圖 KV cache entries公開視覺 benchmark 平均
DeepSeek V4 Vision~9077.2%
Qwen3-VL~660
GPT-5.4~74071.1%
Claude Sonnet 4.6~870
Gemini 3 Flash~110076.5%

從兩個維度看,DeepSeek 都在拉開差距:記憶體效率領先 7-12 倍、benchmark 略勝閉源旗艦。如果這些數字在獨立第三方重測後仍然成立(lmsys、HELM 等機構尚未公開盲測結果),DeepSeek 的「成本最低的全模態模型」定位在 2026 下半年將非常難被撼動。

但這裡也要提醒三個不該被忽略的質疑點

  1. 灰度測試 ≠ 完整功能。SCMP 報導指出,目前 Vision mode 只對部分用戶開放,且僅限圖片理解,沒有圖片生成能力。這與坊間期待的「可生成圖文」差距很大。
  2. V4 還是 6 月才有 Vision,V3 的使用者依舊是純文字模型。這意味著大多數已經在用 DeepSeek API 串接的開發者,短期內還無法直接呼叫 Vision endpoint,需要等官方公告 Vision API 計價與限制。
  3. 論文下架是警訊還是煙霧?《Thinking with Visual Primitives》下架的時機點,剛好卡在 6 月初美國國會討論是否將 DeepSeek 列為出口管制實體清單前夕,不排除是地緣政治考量下的策略性低調。這層不確定性讓所有「DeepSeek 完勝西方」的結論都得打點折扣。

業界怎麼看

  • Redis 創始人 antirez 在 X 上直言:「DeepSeek v4 是 KV cache 壓縮 + indexed attention 的黃金標準。」
  • alphaXiv 觀察:「對 800×800 圖,DeepSeek 報告約 361 個視覺 token,壓縮後只剩 ~90 個 KV cache entries,比 Qwen3-VL 660、GPT-5.4 740、Claude Sonnet 4.6 870、Gemini 3 Flash 1100 都少很多。」
  • 業界 KOL Rui Ma 分享自身體驗:「我把所有能搬的任務都搬到 DeepSeek 了,比起 Anthropic 一次不小心 15 分鐘燒 25 美元,現在可以放心亂試。」
  • Hacker News 長期觀察者 hodgehog11 認為:「DeepSeek 的數學模型其實這一年來一直是業界最強的,只是大部分人不知道。」

總結來看,這次 Vision mode 灰度上線代表 DeepSeek 的產品矩陣正式跨過「純文字 LLM」時代,進入「全模態」階段。接下來值得追蹤的三件事:

  1. Vision 模式何時全面開放給所有使用者(目前仍為 beta 灰度)
  2. DeepSeek 會否把 Vision API 納入 V4 Flash 定價表(目前 API 文件只列 Pro/Flash 文字模式)
  3. 《Thinking with Visual Primitives》論文會否重新上架 arXiv(社群已在 Hugging Face 保留備份)

無論如何,「小鯨魚看得見了」這句話,已經是 2026 年中國 AI 走向全模態競爭最戲劇性的一幕。


編按補充:本文所有外部連結均為 2026 年 4-6 月公開資料;引用數字來自 SCMP、MindStudio、alphaXiv 等三方獨立來源交叉比對。Siami 將持續追蹤 DeepSeek Vision 全面開放與 API 上線時程。

網友熱門留言 (4)

#1 antirez(Redis 創始人) ▲ 487
DeepSeek v4 是 KV cache 壓縮 + indexed attention 的黃金標準。但我們可能得忍受記憶體成本。
#2 askalphaxiv(alphaXiv) ▲ 312
DeepSeek《Thinking with Visual Primitives》:800x800 圖只需 90 個 KV cache entries;Qwen3-VL 要 660、GPT-5.4 要 740、Claude Sonnet 4.6 要 870、Gemini 3 Flash 要 1100。七大公開 benchmark 平均 77.2%,勝 Gemini 3 Flash 的 76.5%、GPT-5.4 的 71.1%。
#3 ruima(業界 KOL) ▲ 268
我個人把所有能搬的任務都搬到 DeepSeek 了,因為它真的能用且成本只要幾分之一。比起之前在 Anthropic 一不小心 15 分鐘燒掉 25 美元的經歷,現在可以放心亂試。
#4 Hacker News 用戶 hodgehog11 ▲ 187
DeepSeek 的數學模型其實這一年來一直是業界最強的,只是大部分人不知道。