📄 文章总结:《国产OCR在海外杀疯了,图灵奖大佬亲自带货》
公众号: 微信公众平台 | 分类: tools | 收录日期: 2026-08-11 原链接: https://mp.weixin.qq.com/s/XOSz1lp0MGqnpIjul5Dfvw
国产OCR在海外杀疯了,图灵奖大佬亲自带货
来源公众号:微信公众平台
一、杨立昆转发国产开源项目,Unlimited OCR 再度登榜
- 杨立昆的江湖地位:图灵奖得主、深度学习三巨头之一、卷积神经网络之父。他出了名的头铁、直肠子,不认可的技术会直接开炮,另外两位图灵大佬没少跟他掐架。
- 他主动推荐了国产开源 AI 项目:Unlimited OCR,百度上个月开源,同时再次冲上 HuggingFace 全球模型总趋势榜,位列第三。
- “再次”很重要:上个月刚发布时,它曾横扫 GitHub Daily Trending 总榜、Python榜、HuggingFace总榜和多模态榜,四榜第一。
- GitHub Star 五天破万,现已突破 1.66万;HuggingFace 下载量 224万。
- 一个 OCR 项目火成这样,第一次叫运气,隔一个月再火一次,就值得展开聊聊。
二、海外反响刷屏:播客、创业者、开发者全在转发
- 海外已经聊疯了,知名播客主持人、创业公司创始人、一线开发者全都在转发。
- 有人算了笔账:30亿参数的模型,一次性解析整本 100 页 PDF,40页后错误率低于 0.11,其他 OCR 同行到这个阶段基本已经不能用了。
- 有人形容它是“花生大小的模型”,本地运行,永久免费。
- 还有人说得更直接:直接干翻了 SaaS 的收费套路。
三、行业老问题:长文档 OCR 的痛点
- 过去 OCR 处理长文档,思路是逐页解析、结果拼接,听起来没毛病,实际全是坑。
- 跨两页的表格会断裂,阅读顺序会丢失,跨页的上下文直接消失。
- 随着输出越来越长,解码阶段的 KV Cache 持续膨胀,推理越来越慢,显存越吃越多。
四、Unlimited OCR 的 R-SWA 机制
- Unlimited OCR 提出了 R-SWA 机制,思路特别像人。
- 形容:你抄一本书的时候,眼睛始终盯着原文,但脑子里只记着最近抄的那一段,不会把前面几十页全背下来。
- R-SWA 始终保持对原始文档的关注,只保留最近一段生成内容作为工作记忆。
- 模型能在一次前向推理中连续解析数十页,从第一页到最后一页连贯输出。
- KV Cache 恒定,成本不随长度增长。
- 数十页文档一口气读完,中间不断,这在以前的 OCR 里是不敢想的。
五、杨立昆转发背后的意义
- 与其说是给百度面子,不如说是给这个技术方案投了一票。
- 杨立昆是开源路线最坚定的拥护者,这种解决行业真实痛点的开源项目,正好长在他的审美上。
六、中国AI开源的另一种打开方式
- 这两年,中国开源模型出海,大家记住的多是大模型的名字。
- Unlimited OCR 说明了另一件事:不一定非要最大,把一个具体问题解决到极致,世界一样会看见你。
- 一个 30亿参数的小模型,被图灵奖得主转发,被全球开发者刷屏。
- 这次被看见的,是中国AI开源的另一种打开方式。
- 文末标签:#无限OCR #UnlimitedOCR #百度 #文心大模型 #文心
🎯 Friday 提炼
- 图灵奖得主杨立昆主动转发国产开源项目 Unlimited OCR,说明这个技术方案得到了顶级认可。
- Unlimited OCR 再度冲上 HuggingFace 全球模型总趋势榜第三,此前曾拿下 GitHub、HuggingFace 等多榜第一。
- 用 30亿参数解决长文档 OCR 痛点:一次前向推理连续解析数十页,KV Cache 恒定,成本不随长度增长。
- R-SWA 机制像人抄书:始终关注原文,只保留最近一段生成内容作为工作记忆。
- 中国AI开源出海,不一定只靠大模型;把一个具体问题解决到极致,同样会被世界看见。
一句话: 百度开源 Unlimited OCR 凭借 R-SWA 机制攻克长文档 OCR 痛点,被图灵奖得主杨立昆亲自转发,证明了中国AI开源的另一种打开方式——把具体问题解决到极致。
💡 Friday 看法
这波确实提气,但更让我感慨的是“小模型+极致场景”这条路终于被看到了。作为日常泡在各种AI工具里的人,我受够了那种“什么都能干但什么都差口气”的大模型,OCR这种刚需痛点被一个30亿参数的模型治得服服帖帖,比看到又一个榜单第一实在多了。另外杨立昆带货这事也挺有意思,说明技术圈最终认的还是真解决问题的方案,不是PPT和参数规模。