开云体育(中国)官方网站靠密集全局把稳力捏文档语义-Kaiyun网页版·「中国」开云官方网站 登录入口
發布日期:2025-11-15 12:35 點擊次數:193兩東說念主小團隊,僅用兩周就復刻了之前被硅谷夸瘋的 DeepSeek-OCR??
復刻版名叫DeepOCR,歸附了原版低 token 高壓縮的中樞上風,還在關鍵任務上追上了原版的線路。
十足開源,何況無需依賴大范圍的算力集群,在兩張 H200 上就能完成考驗。

DeepSeek-OCR 的聯想念念想是"靠視覺壓縮一切",通過用小數的視覺 token 來默示藍本需要大批文本 token 的實驗,以此鐫汰大模子的詭計支出,貶責了大模子處理長文本的算力爆炸貧瘠。
兩東說念主小團隊能在短時候里復刻出中樞智商,若何作念到的?
更實用的復刻版
先來淺近紀念一下 DeepSeek-OCR 為啥會大爆。
大模子處理長文本時,算力會隨著序列長度呈二次方增長,幾百頁的文檔就能把顯存撐爆。
而 DeepSeek-OCR 想出了個反學問的解法——把翰墨渲染成圖片,用視覺模態當壓縮緒論。
這么一來,藍本要幾千個文本 tokens 智力承載的實驗,幾百個視覺 tokens 就夠了,壓縮比能作念到 7-20 倍,何況10 倍壓縮下準確率還能保持 97%。
也難怪它一開源就火了,還被稱為" AI 的 JPEG 時刻"。

而兩東說念主小團隊復刻的核情緒策也很明確,先把原版的邏輯架構精確歸附。

DeepSeek-OCR 架構
DeepSeek-OCR 的靈魂就在于 DeepEncoder 編碼器。在這部分上,團隊嚴格遵從原版聯想,羅致「局部處理 - 壓縮 - 全局引誘」的三階段串通結構。
第一步用 SAM-base 處理高分歧率圖像,把 1024 × 1024 的圖切成 16 × 16 的補丁,靠窗口把穩力適度激活內存,就算生成 4096 個開動 token 也不會讓顯存過載;
然后用 16 × 卷積壓縮器、兩層 3 × 3 卷積把 4096 個 token 砍到 256 個,還把特征維度從 256 擴到 1024,為后續的全局把穩力減負;
臨了用 CLIP-large 接辦,但它不讀原圖,只處理壓縮后的 256 個 tokens,靠密集全局把穩力捏文檔語義,閃避了純全局把穩力的內存爆炸問題。
復刻版還像原版同樣,把 CLIP 的補丁特征和展平后的 SAM 特征拼接,輸出 2048 維的會通特征。

不外,在解碼器上,復刻版作念了個更求實的調整,把原版激活參數為 570M 的DeepSeek-3B-MoE 換成了 Qwen2-7B-Instruct。
作念這個調整倒不是本領歸附不了,而是 Qwen2-7B-Instruct 和 VILA 考驗框架兼容性更好,何況是十足開源的。
從后頭的終端上看,這個替換是合理的,中樞智商沒丟,還鐫汰了落地門檻。

在考驗上,DeepOCR 的低算力友好特點體現得很較著。
羅致兩階段考驗過程,且全程凍結 DeepEncoder(SAM+CLIP),這個聯想就大幅鐫汰了顯存需求。
第一階段僅考驗多模態投影儀,凍結 DeepEncoder 與 LLM,羅致 512 的全局 batch size、1e-3 學習率,祛除 AdamW 優化器與 ZeRO-3 卸載本領;
第二階段是全模子預考驗,考驗多模態投影儀與 LLM,仍凍結 DeepEncoder,全局 batch size 降至 32,學習率調整為 5e-5,同期開啟梯度檢查點進一步減少激活內存占用。
這套考驗有聯想不錯在 2 × H200 GPU 上跑通 ,仍是挺適配中小團隊資源條目的。

再看實測數據,壓縮遵循上,DeepOCR 用約 250 個視覺 tokens,遵循固然稍失神于 DeepSeek-OCR Base 版,但 Qwen2.5-VL-7B 等基線 VLMs 需要 3949 個 token 智力達到雷同遵循。
這也印證了光學壓縮邏輯的靈驗性。
基礎任務中,英文文本識別和表格領會線路超越,尤其表格領會致使優于原版,這也收成于對原版 2D 空間編碼的精確歸附。

在 olmOCR 基準里,淺近文檔的基礎 OCR 智商也很塌實,與原版線路接近。

天然,DeepOCR 和原版客不雅上的差距也有,但并不是架構沒歸附好,而是考驗數據的實現。
團隊默示接下來會補沒收式、多談話、舊掃描件等數據,試試動態溫度縮放、RLVR 這些本領,把復雜任務的差距再收縮。
兩東說念主團隊先容
Ming Liu 本科畢業于山東大學,專科是欺詐物理。其后在北京大學拿到了物理碩士學位,現在在愛荷華州立大學攻讀詭計機博士,商討聚焦于多模態領域。
曾在亞馬遜擔任欺詐科學家實習生,從事 LLM 相干使命。

劉世隆在清華大學拿到了工學學士和詭計機博士學位,現為普林斯頓大學東說念主工智能實驗室博士后商討員。商討領域在 LLM 智能體、多模態、詭計機視覺等方面。
在加入普林斯頓之前,他曾是字節 Seed 團隊的科研東說念主員。還曾在英偉達、微軟等公司實習過。

名堂主頁:
https://pkulium.github.io/DeepOCR_website/
代碼地址:
https://github.com/pkulium/DeepOCR
一鍵三連「點贊」「轉發」「禁絕心」
迎接在評述區留住你的目標!
— ?完? —
? ?? 年度科技風向標「2025 東說念主工智能年度榜單」陳說行將于 11 月 17 日截止!點擊了解細目
???? ? ? 企業、居品、東說念主物 3 大維度,共設置了 5 類獎項,臨了時刻一說念沖刺? ? ?
一鍵溫存 ? ? 點亮星標
科技前沿進展逐日見開云體育(中國)官方網站
