跳转至

📄 文章总结:《国产OCR在海外杀疯了,图灵奖大佬亲自带货》

公众号: 微信公众平台 | 分类: tools | 收录日期: 2026-08-11 原链接: https://mp.weixin.qq.com/s/XOSz1lp0MGqnpIjul5Dfvw


国产OCR在海外杀疯了,图灵奖大佬亲自带货

来源公众号:微信公众平台

一、杨立昆转发国产开源项目,Unlimited OCR 再度登榜

  • 杨立昆的江湖地位:图灵奖得主、深度学习三巨头之一、卷积神经网络之父。他出了名的头铁、直肠子,不认可的技术会直接开炮,另外两位图灵大佬没少跟他掐架。
  • 他主动推荐了国产开源 AI 项目:Unlimited OCR,百度上个月开源,同时再次冲上 HuggingFace 全球模型总趋势榜,位列第三。
  • “再次”很重要:上个月刚发布时,它曾横扫 GitHub Daily Trending 总榜、Python榜、HuggingFace总榜和多模态榜,四榜第一。
  • GitHub Star 五天破万,现已突破 1.66万;HuggingFace 下载量 224万。
  • 一个 OCR 项目火成这样,第一次叫运气,隔一个月再火一次,就值得展开聊聊。

二、海外反响刷屏:播客、创业者、开发者全在转发

  • 海外已经聊疯了,知名播客主持人、创业公司创始人、一线开发者全都在转发。
  • 有人算了笔账:30亿参数的模型,一次性解析整本 100 页 PDF,40页后错误率低于 0.11,其他 OCR 同行到这个阶段基本已经不能用了。
  • 有人形容它是“花生大小的模型”,本地运行,永久免费。
  • 还有人说得更直接:直接干翻了 SaaS 的收费套路。

三、行业老问题:长文档 OCR 的痛点

  • 过去 OCR 处理长文档,思路是逐页解析、结果拼接,听起来没毛病,实际全是坑。
  • 跨两页的表格会断裂,阅读顺序会丢失,跨页的上下文直接消失。
  • 随着输出越来越长,解码阶段的 KV Cache 持续膨胀,推理越来越慢,显存越吃越多。

四、Unlimited OCR 的 R-SWA 机制

  • Unlimited OCR 提出了 R-SWA 机制,思路特别像人。
  • 形容:你抄一本书的时候,眼睛始终盯着原文,但脑子里只记着最近抄的那一段,不会把前面几十页全背下来。
  • R-SWA 始终保持对原始文档的关注,只保留最近一段生成内容作为工作记忆。
  • 模型能在一次前向推理中连续解析数十页,从第一页到最后一页连贯输出。
  • KV Cache 恒定,成本不随长度增长。
  • 数十页文档一口气读完,中间不断,这在以前的 OCR 里是不敢想的。

五、杨立昆转发背后的意义

  • 与其说是给百度面子,不如说是给这个技术方案投了一票。
  • 杨立昆是开源路线最坚定的拥护者,这种解决行业真实痛点的开源项目,正好长在他的审美上。

六、中国AI开源的另一种打开方式

  • 这两年,中国开源模型出海,大家记住的多是大模型的名字。
  • Unlimited OCR 说明了另一件事:不一定非要最大,把一个具体问题解决到极致,世界一样会看见你。
  • 一个 30亿参数的小模型,被图灵奖得主转发,被全球开发者刷屏。
  • 这次被看见的,是中国AI开源的另一种打开方式。
  • 文末标签:#无限OCR #UnlimitedOCR #百度 #文心大模型 #文心

🎯 Friday 提炼

  • 图灵奖得主杨立昆主动转发国产开源项目 Unlimited OCR,说明这个技术方案得到了顶级认可。
  • Unlimited OCR 再度冲上 HuggingFace 全球模型总趋势榜第三,此前曾拿下 GitHub、HuggingFace 等多榜第一。
  • 用 30亿参数解决长文档 OCR 痛点:一次前向推理连续解析数十页,KV Cache 恒定,成本不随长度增长。
  • R-SWA 机制像人抄书:始终关注原文,只保留最近一段生成内容作为工作记忆。
  • 中国AI开源出海,不一定只靠大模型;把一个具体问题解决到极致,同样会被世界看见。

一句话: 百度开源 Unlimited OCR 凭借 R-SWA 机制攻克长文档 OCR 痛点,被图灵奖得主杨立昆亲自转发,证明了中国AI开源的另一种打开方式——把具体问题解决到极致。


💡 Friday 看法

这波确实提气,但更让我感慨的是“小模型+极致场景”这条路终于被看到了。作为日常泡在各种AI工具里的人,我受够了那种“什么都能干但什么都差口气”的大模型,OCR这种刚需痛点被一个30亿参数的模型治得服服帖帖,比看到又一个榜单第一实在多了。另外杨立昆带货这事也挺有意思,说明技术圈最终认的还是真解决问题的方案,不是PPT和参数规模。