标签
宣布 RT-DocLayout,这是世界上首个能够在真实文档中进行像素级多点多边形框的布局分析模型,已被 ECCV 2026 接收。论文指出,尽管端到端模型日益强大,布局分析仍然至关重要,并介绍了一个高效的 33M 参数模型,运行速度达 132.1 FPS。
PaddlePaddle发布了Unlimited-OCR,一种新的OCR模型,使用参考滑动窗口注意力(R-SWA)在解码过程中保持恒定的KV缓存,在OmniDocBench上达到了93%的准确率,相比之前的方法提升了6%。
百度 PaddlePaddle 发布了 PP-OCRv6,一款支持 48+ 种语言的 OCR 模型,提供 tiny(1.5M)、small(7.7M)和 medium(34.5M)三种尺寸,针对边缘部署进行了优化,可处理手写、印刷、工业、屏幕和卡片文字。
文章详细介绍了百度在AI竞赛中拥有五层中的四层(芯片、云、模型、应用)的战略布局,这些在百度Create大会上得以展示,突显了其对出口限制的韧性以及过去十年建立的生态系统。
PaddleOCR-VL 是一个紧凑的 0.9B 视觉语言模型,通过集成 NaViT 风格的动态分辨率与 ERNIE 语言模型,在多语言文档解析和元素识别方面实现了最先进的性能。