百度近日公布并开源了3B参数规模的端到端OCR模子—— Unlimited OCR ,专为书籍、论文等长文档解析场景打制。该项目上线后火速登顶GitHub取HuggingFace四项趋背榜,开源仅5天GitHub Star即破万。

手艺上, Unlimited OCR 推理时激活参数约570M,并初度引入Reference Sliding Window Attention(R-SWA)机制。该机制突破了传统“逐页解析+拼接”的限制,实现数十页文档的一次性连绝解析;同时,它将解码阶段的KV Cache控制正在恒定例模,使隐存占用和计较本钱不再随输出长度删加而暴涨。

正在OmniDocBench v1.6基准测试中,该模子以93.92%的成绩刷新记载。实正在场景下,其推理速度较DeepSeek OCR汲引约12.7%,正在6000Tokens输出长度下速度劣势扩年夜至35%,为海量文档数字化和年夜模子长程记忆办理供给了全新途径。

