百度這波簡直逆天!500M 小模型把 235B 頂流全按在地上摩擦,OCR 要變天了?

2026-06-24 1

家人們,今天 AI 圈出大事了,百度這波操作簡直是「悄悄努力,然後驚豔所有人」!

就在剛剛,百度開源了一個叫 Unlimited OCR 的新模型。總參數 3B,實際運行時激活的參數居然只有 500M。500M 是什麼概念?在大模型動輒幾十 B、上百 B 的時代,這點參數連個零頭都算不上,簡直像個「網頁小插件」。

然而,就是這個小到不可思議的「小蝦米」,在 OmniDocBench 的權威跑分榜上,直接把一眾巨頭給乾沉默了:

  • Unlimited OCR(500M)93.23分
  • Qwen3-VL(235B):89.15分
  • Qwen2.5-VL(72B):87.02分
  • Gemini-2.5 Pro(未公開):88.03分

發現盲點了沒有?一個體量只有別人幾百分之一的小模型,反手就把市面上最強的幾位「頂流大哥」全給秒了。這已經不是彎道超車了,這是直接開著五菱宏光把法拉利給超了啊!

為什麼以前的 AI 讀書,總是「讀了後面忘前面」?

平常有在用 AI 處理長文檔的朋友,一定遇到過這種高血壓名場面:給它一份幾十頁的 PDF,它讀到第 10 頁,就把第 1 頁的內容忘得精光。

這是因為傳統的 AI 在處理長文本時,記憶體(KV Cache)會像滾雪球一樣瘋狂暴漲,電腦根本吃不消。所以之前的工程師只能玩「拼圖」,讓 AI 跑個循環,看完整一頁就把記憶清空,再看下一頁。能用是能用,但本質上就是個「人工智障」。

但我們人類抄書、讀書可不是這樣的。我們手在寫這一行,眼睛看著下一行,餘光瞄著上一行,至於前天抄了什麼,大腦早就「該忘就忘」了。這種能力在心理學上叫「軟遺忘」(Soft Forgetting)。

百度這波簡直逆天!500M 小模型把 235B 頂流全按在地上摩擦,OCR 要變天了?

百度把「抄書的祕密」寫進了代碼

這次百度最厲害的地方,就是把人類這種「大局觀拉滿、但只留近期記憶」的騷操作,塞進了模型裡。他們研發了一項核心黑科技:參考滑動窗口注意力機制(R-SWA)

聽不懂沒關係,你只需要知道,它讓模型在看文檔時:

  1. 全局可見:整張圖片和提示詞永遠烙在腦子裡,不會看錯行。
  2. 記憶控量:輸出端永遠只保留最近的 128 個字。

這麼一搞,內存佔用直接鎖死!無論你是讓它讀 20 頁還是 40 頁,它的速度和內存都穩如老狗,從頭到尾一條平線,再也不會因為「記憶過載」而降速或胡言亂語。配合上DeepSeek同款的 DeepEncoder 壓縮大法,一次推理讀完幾十頁,完全不復讀、不降速!

瓜民最愛:作者名單裡的「神秘代號」

除了技術牛逼,這篇論文最讓老司機興奮的,其實是八卦。

看過 DeepSeek 報告的人,讀到這篇論文的行文風格都會有一種強烈的熟悉感。再翻到作者名單一看,核心貢獻者裡,前兩位都用了真名,唯獨技術總監這一欄,神祕地掛了個縮寫:「YY」

圈內人順藤摸瓜,結合 GitHub 致謝名單前兩位高高掛著的 DeepSeek-OCR,答案呼之欲出——這大概率就是今年 4 月剛從 DeepSeek 離職的 OCR 靈魂人物、 GOT-OCR2.0 的主導者魏浩然

不得不說,百度這次是真下血本了。今年把人才計劃升級、薪酬不設上限,硬生生把這位前沿大牛給挖了過來。有魏浩然的前沿研究品味,加上百度原本就稱霸國內產業底座的 PaddleOCR,這兩者結合,簡直是強強聯手。

老司機心裡話

以前大家都覺得百度做 AI 偏實用主義、有點傳統,但這次 Unlimited OCR 用實力證明了,百度要是認真玩起前沿科技,依然是那個能打的「大廠一哥」。目前代碼和模型都已經在 GitHub 和 HuggingFace 全面開源,感興趣的極客朋友們,趕緊去衝一波代碼吧!

🙋‍♂️ 常見問題解答(FAQ)

  1. 問:參數只有 500M 的模型,為什麼能打贏 235B 的 Qwen3-VL?

    答:這就是「術業有專攻」。Qwen3-VL 是全能型的多模態大模型,什麼都要學;而 Unlimited OCR 是專門為文檔解析和 OCR 任務量身定制的 MoE 小模型。再加上百度這次魔改了注意力機制(R-SWA),讓它在解析特定文檔時的效率和精準度實現了降維打擊。

  2. 問:什麼是 R-SWA 技術?它解決了什麼痛點?

    答:R-SWA 全稱是「參考滑動窗口注意力機制」。它解決了傳統 AI 處理長文檔時「內存隨字數暴漲、導致模型降速和失憶」的痛點。它讓模型一邊保持對整張圖的視覺感知,一邊把輸出的記憶體固定成一個隊列(只記最近128個 token),從而實現超長文本解析不降速、不崩潰。

  3. 問:Unlimited OCR 現在可以免費使用嗎?在哪裡找?

    答:是的!百度這次非常大氣,已經把模型和代碼全部開源了。開發者和 AI 愛好者可以直接在 GitHub 和 HuggingFace 上搜索「Unlimited-OCR」免費下載並部署體驗。

相关文章

Instagram上赚钱真的可行吗? 究竟如何才能靠Instagram赚钱?
如何让钱生钱?又该如何实现财富增长?
Ishowspeed靠打赏能赚多少钱?捐款收入究竟有多少?
比特幣重返63000美元!牛市真的回來了?老玩家卻開始盯著這幾個訊號
QQLink跨链转账操作指南,一步步教你安全转移多链资产
互联网上如何赚钱?有哪些方法能实现网上盈利?