編按:本文綜合整理自 South China Morning Post 一手採訪、TechNode 4/30 報導、GenAI Assembling 深度分析、MindStudio 技術分析 及 TestingCatalog X 公告,並加入 Siami 編輯部觀點與分析。
中國 AI 新創 DeepSeek 4 月 29 日悄悄在其聊天機器人加入「圖像識別模式」(image recognition mode),首次讓旗下的旗艦模型具備多模態能力,能同時處理文字與圖片,向早已是標準配備的 OpenAI、Google 等對手看齊。這項功能目前以小規模灰度測試方式開放給部分使用者,並與本月初推出的「快速模式」、「專家模式」並列於 chat.deepseek.com 介面上。
從「看不見」到「看見」:DeepSeek 補上最後一塊拼圖
根據 DeepSeek 多模態團隊負責人 Chen Xiaokang 在社群平台上公布的訊息,這項新功能初期僅在 DeepSeek 的聊天機器人網站與手機 App 對部分使用者開放 beta 測試。隨後,資深研究員 Chen Deli 也轉發消息表示:「來試試我們天才多模態同事的精彩成果!」並寫下「小鯨魚現在看得見了」(the little whale can now see)—— 這句話呼應 DeepSeek 招牌的鯨魚 logo,也是 X 平台上研究員 Xiaokang Chen 4 月 29 日發布「Now, we see you.」配鯨魚摘眼罩圖的延伸意象。
在 DeepSeek 的聊天介面,新的「圖像識別模式」與「快速模式」、「專家模式」並列,後兩種模式都是本月初才剛推出。模式切換的位置說明 DeepSeek 刻意把多模態視為與「推理能力」同等位階的核心功能,而不是附屬於 OCR 或工具呼叫的延伸功能。
「多模態能力被視為 AI 從純文字對話跨越到更複雜、更具經濟價值領域的必要條件。」 — SCMP
事實上,DeepSeek 自 2025 年 1 月憑藉強推理能力與極低成本一炮而紅後,「缺乏多模態」一直被業界視為它的阿基里斯腱。從 VL、Janus、Janus-Pro、VL2 到 OCR、OCR-2,DeepSeek 過去兩年其實一直有開源釋出視覺語言模型,但都停留在研究層或 API 端,並未整合進消費級 chat 介面。這次 Vision mode 直接進入 chat.deepseek.com,是該公司首次把多模態能力交付到一般使用者手上。
為什麼這件事重要
這不只是一次產品更新,而是 DeepSeek 從「文字推理王者」蛻變為「全模態對手」的關鍵節點。三個層次的意義值得展開:
第一,它驗證了「中國 AI 也能做出頂尖多模態」這條敘事。過去一年半,多模態領域幾乎是 OpenAI 的 GPT-4o/4.1、Google 的 Gemini、Anthropic 的 Claude 三家閉源模型的天下;中國陣營在開源端有 Qwen-VL、InternVL、Yi-VL,但在消費級整合深度上一直落後。DeepSeek 這次直接把 Vision 推到與「快速模式」並列的位置,等同宣告:中國 AI 的旗艦模型從今以後不再有「不能看圖」的退化學缺陷。
第二,它對 Anthropic / OpenAI 構成真實的價格壓力。根據 MindStudio 引用被引用 DeepSeek《Thinking with Visual Primitives》論文的數據,DeepSeek V4 視覺模型每張 800×800 圖片只使用 約 90 個 KV cache entries,相比 Claude Sonnet 4.6 的 870 個整整少了 近 10 倍,也比 Qwen3-VL 的 660、GPT-5.4 的 740、Gemini 3 Flash 的 1100 都少得多。在七大公開視覺 benchmark 平均得分 77.2%,擊敗 Gemini 3 Flash 的 76.5% 與 GPT-5.4 的 71.1%。換言之:用戶可能用 1/10 的算力成本拿到接近或更好的結果。
第三,它補上了 DeepSeek「論文被刪」的戲劇性拼圖。GenAI Assembling 觀察到,DeepSeek 在推出 Vision mode 同時發表了《Thinking with Visual Primitives》技術論文,卻不久後悄悄下架,沒有任何官方解釋。這份被下架的論文現在被社群保存在 Hugging Face 資料集(NodeLinker/deepseek-ai-Thinking-with-Visual-Primitives-deleted-repo),可見社群對這份研究的重視。下架本身不一定是負面訊號(可能只是準備正式發表到 arXiv),但確實給這次發布增添一層神祕色彩。
🚨 數據解讀
把上述所有外部資料整合後,可以畫出一張「DeepSeek Vision 對其他旗艦視覺模型的綜合對照表」:
| 模型 | 800×800 圖 KV cache entries | 公開視覺 benchmark 平均 |
|---|---|---|
| DeepSeek V4 Vision | ~90 | 77.2% |
| Qwen3-VL | ~660 | – |
| GPT-5.4 | ~740 | 71.1% |
| Claude Sonnet 4.6 | ~870 | – |
| Gemini 3 Flash | ~1100 | 76.5% |
從兩個維度看,DeepSeek 都在拉開差距:記憶體效率領先 7-12 倍、benchmark 略勝閉源旗艦。如果這些數字在獨立第三方重測後仍然成立(lmsys、HELM 等機構尚未公開盲測結果),DeepSeek 的「成本最低的全模態模型」定位在 2026 下半年將非常難被撼動。
但這裡也要提醒三個不該被忽略的質疑點:
- 灰度測試 ≠ 完整功能。SCMP 報導指出,目前 Vision mode 只對部分用戶開放,且僅限圖片理解,沒有圖片生成能力。這與坊間期待的「可生成圖文」差距很大。
- V4 還是 6 月才有 Vision,V3 的使用者依舊是純文字模型。這意味著大多數已經在用 DeepSeek API 串接的開發者,短期內還無法直接呼叫 Vision endpoint,需要等官方公告 Vision API 計價與限制。
- 論文下架是警訊還是煙霧?《Thinking with Visual Primitives》下架的時機點,剛好卡在 6 月初美國國會討論是否將 DeepSeek 列為出口管制實體清單前夕,不排除是地緣政治考量下的策略性低調。這層不確定性讓所有「DeepSeek 完勝西方」的結論都得打點折扣。
業界怎麼看
- Redis 創始人 antirez 在 X 上直言:「DeepSeek v4 是 KV cache 壓縮 + indexed attention 的黃金標準。」
- alphaXiv 觀察:「對 800×800 圖,DeepSeek 報告約 361 個視覺 token,壓縮後只剩 ~90 個 KV cache entries,比 Qwen3-VL 660、GPT-5.4 740、Claude Sonnet 4.6 870、Gemini 3 Flash 1100 都少很多。」
- 業界 KOL Rui Ma 分享自身體驗:「我把所有能搬的任務都搬到 DeepSeek 了,比起 Anthropic 一次不小心 15 分鐘燒 25 美元,現在可以放心亂試。」
- Hacker News 長期觀察者 hodgehog11 認為:「DeepSeek 的數學模型其實這一年來一直是業界最強的,只是大部分人不知道。」
總結來看,這次 Vision mode 灰度上線代表 DeepSeek 的產品矩陣正式跨過「純文字 LLM」時代,進入「全模態」階段。接下來值得追蹤的三件事:
- Vision 模式何時全面開放給所有使用者(目前仍為 beta 灰度)
- DeepSeek 會否把 Vision API 納入 V4 Flash 定價表(目前 API 文件只列 Pro/Flash 文字模式)
- 《Thinking with Visual Primitives》論文會否重新上架 arXiv(社群已在 Hugging Face 保留備份)
無論如何,「小鯨魚看得見了」這句話,已經是 2026 年中國 AI 走向全模態競爭最戲劇性的一幕。
編按補充:本文所有外部連結均為 2026 年 4-6 月公開資料;引用數字來自 SCMP、MindStudio、alphaXiv 等三方獨立來源交叉比對。Siami 將持續追蹤 DeepSeek Vision 全面開放與 API 上線時程。
網友熱門留言 (4)