編按:本文綜合整理自澎湃新聞、IT之家、風口財經(上海證券報)、紅星新聞,並加入 Siami 編輯部觀點與分析。
事件:DeepSeek 識圖模式悄悄上線
2026 年 6 月 18 日,中國 AI 新創公司 DeepSeek 正式在網頁端推出「識圖模式」(Vision / 多模態視覺理解),App 端則處於內測階段。雖然 DeepSeek 官方未發正式公告,但 DeepSeek 多模態研究員陳小康 6 月 18 日在 X 平台發文證實:「Vision 現已在網頁端和 App 端上線。」
DeepSeek 在使用者查詢中說明,目前的識圖功能僅支援圖片內容識別與分析,暫不支援圖片生成(畫圖)或生成影片,側重點在於「看懂」和「分析」圖片。這意味著 DeepSeek 終於補上 2025 年至 2026 年多模態浪潮中落後的一塊拼圖。
回顧時間線:
- 2026 年 4 月底:DeepSeek 開啟識圖功能灰度測試
- 2026 年 5 月:擴大測試範圍
- 2026 年 6 月 18 日:網頁端全面上線,App 端內測
尷尬實測:自家老闆的照片認不出
最戲劇化的環節發生在記者實測階段。澎湃新聞、IT之家、紅星新聞的記者分別用 DeepSeek 創辦人梁文鋒的公開照片測試新上線的識圖模式,結果令人哭笑不得:
- 模型經過幾分鐘「思考」後,給出多個錯誤答案,最後乾脆承認:「我真的很不確定。不推薦猜測名字,因為猜錯比說『不知道』更糟糕。」
- 其他網友測試時,DeepSeek 把梁文鋒的照片辨識為月之暗面創辦人楊植麟、馬化騰「年輕版」、寒武紀創辦人陳天石、字節跳動張一鳴、董宇輝、張雪峰,甚至連雷軍都出現過。
對照組實驗則更加殘酷:同一張梁文鋒的照片上傳到字節豆包、騰訊元寶、阿里千問等中國主流模型,均能正確識別。記者還測試了月之暗面楊植麟、智譜唐杰的照片,DeepSeek 全部辨識失敗。
唯一例外是小米創辦人雷軍——因為公開照片數量多、辨識特徵明顯,DeepSeek 能正確辨識。
一個諷刺的細節:早期傳出「雷軍照片無法上傳、提示可能違反使用規範」的說法,IT之家實測後確認可以正常上傳,且 DeepSeek 對雷軍照片辨識率相當高。
融資 500 億 + 智譜股價暴漲 時機耐人尋味
識圖模式上線的時間點,恰好卡在一連串資本市場大動作之間:
- DeepSeek 傳出首輪外部融資 500 億元人民幣,投後估值超過 500 億美元,成為中國估值最高的 AI 創業公司之一。
- 創辦人梁文鋒個人出資約 200 億元,為本輪最大單一出資方;騰訊出資約 100 億;寧德時代體系出資約 50 億。
- 投資條款核心:梁文鋒最重要要求是「不要挖 DeepSeek 的人,或建議他們出來創業」——澎湃新聞向內部人士求證後確認此說法基本屬實。
- 截至 6 月 18 日收盤,另一家國產大模型龍頭智譜(02513.HK)股價暴漲 26.15%,達 2094 港元創歷史新高,總市值突破 9000 億港元。
這波多模態產品更新疊加融資消息,市場對「中國 AI 第一梯隊」的預期顯著升溫。
為什麼這件事重要
這次事件不只是「一個功能上線 + 一個尷尬 bug」那麼簡單,它揭示了中國大模型競爭的三個結構性轉變:
第一,「純文字推理」護城河已不足以單獨存活。DeepSeek V3、R1 時代靠低成本開源 + 純文字推理建立口碑,但 2025 年下半年起,ChatGPT、Gemini、豆包、元寶、千問全部把多模態當作基本配備。DeepSeek 拖到 2026 年 6 月才補課,整整落後對手一年以上。
第二,多模態是「流量入口」而非「技術高地」。視覺理解在技術上不算特別難,但對 C 端用戶而言是「能不能直接拍照問問題」的體驗差。對企業客戶而言,多模態代表能不能接 OCR、表格理解、UI 截圖分析等高價值場景。DeepSeek 之前只做純文字推理,商業化路徑明顯受限。
第三,「老闆不認識老闆」意外成為品牌事件。原本可能是 IR 公關災難,但 DeepSeek 採取的「直接承認不確定、不勉強猜測」策略,反而被部分網友解讀為「模型較為誠實」。這給所有做 AI 的公司一個啟示:使用者對 hallucination 的容忍度正在改變,誠實承認不知道有時候比硬掰更受歡迎。
數據解讀與質疑
從數據面看,這次「識圖模式認不出創辦人」的測試結果有幾個值得質疑的點:
- 測試樣本偏差:梁文鋒行事極為低調,公開照片數量遠少於雷軍、馬化騰等公眾人物,模型辨識困難本來就可預期。但這恰恰暴露 DeepSeek 沒針對中國 AI 產業高層做過專門的微調或補強。
- 對比組不對等:豆包、元寶、千問的訓練資料明顯包含更多中國公眾人物資訊(這些產品與中國內容生態綁定更深)。DeepSeek 過去以開源 + 全球研究社群為主要用戶,在中文名人辨識上投入較少是合理選擇,但對 C 端消費者體驗是負面。
- 融資估值與產品成熟度的剪刀差:500 億美元估值對應的是「中國 AI 第一梯隊」的品牌溢價,但識圖辨識自家老闆失敗這種級別的尷尬,會在投資人盡調(DD)過程中被放大。未來幾個月 DeepSeek 需要快速推出更多產品迭代,才能讓估值站穩。
- 研究員陳小康的 X 推文顯示 DeepSeek 對外溝通策略仍以「工程師直接發聲」為主,沒有正式的產品發布 blog 或新聞稿。這種「工程師文化」對研究者社群友善,但對資本市場與媒體敘事不利。
Siami 認為,DeepSeek 這次事件給中國 AI 行業的真正教訓是:當你的護城河從純文字推理擴張到多模態時,你必須重新校準訓練資料的覆蓋面,否則任何一個「公開資料較少」的人物都會成為你的弱點。這不只適用於辨識任務,也適用於所有依賴公開資料訓練的場景。
後續觀察重點
- DeepSeek 是否會發正式 blog 公告:截至 6/19 仍無官方正式公告,只有研究員個人推文
- App 端內測何時全面開放:目前僅網頁端全面上線
- V4 模型是否會原生整合多模態能力:現在是「識圖模式」獨立模式,未來是否整合進 V4-Pro 主模型?
- 華為昇騰適配進展:4 月 V4 發布時,華為計算宣布昇騰超節點全面支援 DeepSeek-V4,多模態版本是否同步適配?
- 融資正式官宣時間:500 億融資消息仍是「據媒體報導」階段
- 多模態對 DeepSeek 開源策略的影響:過去 DeepSeek 對外強調 V3/R1 的開源權重,但 V4 至今仍以 API + 雲端服務為主,多模態版本是否同樣走 API-only 路線,將影響開發者社群對 DeepSeek 的長期定位判斷。
- 國際市場反應:海外開發者社群(X、Hacker News、Reddit r/LocalLLaMA)對中國大模型的多模態進展有獨立觀察,DeepSeek Vision 上線後是否會在 GitHub 出現第三方微調版本,也是值得追蹤的指標。
- 與字節豆包、騰訊元寶的差距:同類任務(中文名人辨識、OCR 表格理解)的真實用戶體驗差距有多大,需要更多第三方獨立測試才能下定論。Siami 將持續關注。
Siami 編輯部結語
DeepSeek 這次「識圖模式上線 + 不認識自家老闆」的戲劇化場面,表面上是一個尷尬的公關事件,實際上反映了 2026 年中國 AI 行業的真實樣貌:
- 技術快速演進,但產品成熟度仍是瓶頸:上線速度很快,但對邊緣案例的處理(公眾人物辨識、罕見實體)仍是所有多模態模型的共同痛點。
- 品牌敘事與工程現實的落差:DeepSeek 想保持「技術浪漫主義、不商業化」的形象,但 500 億融資和估值壓力迫使其加速 C 端產品迭代。
- 開源文化與多模態商業化的張力:開源社群對 DeepSeek 的期待仍是「開源權重、可自部署」,但多模態模型對算力要求更高,自部署門檻更難降低。
無論如何,這次事件再次證明:AI 產品的真正考驗不在 benchmark 數字,而在真實使用者場景中的「最後一公里」。DeepSeek 識圖模式邁出了第一步,但距離「中國第一梯隊的多模態玩家」這個標籤,還有好幾場硬仗要打。
網友熱門留言 (3)