#OCR
共 6 篇相关文章
OpenDocRouter发布:统一API聚合130+文档解析模型
·5 分钟
OpenDocRouter发布:统一API聚合130+文档解析模型
OpenDocRouter 发布,提供统一的文档解析 API,聚合 130+ 前沿与开源 OCR/VLM 模型,支持成本价调用、速率限制管理、边界框版面服务及自动路由,解决文档解析模型选型难题。
阅读全文 →

·5 分钟
文档定位新方案:PDF几何+OCR+视觉证据实现72.6% Word F1
一位开发者公开了基于PDF几何坐标、OCR空间信息、格式匹配与视觉证据的文档定位方案,实现72.6% Word Grounding F1,并深入分析了密集布局、标注约定等失败案例。
阅读全文 →

·5 分钟
GAD-RL:用门控蒸馏提升OCR转录的忠实度
arXiv新论文提出GAD-RL方法,通过门控与衰减的在线策略蒸馏提升OCR转录忠实度,解决视觉语言模型擅自改写图像异常文本的问题,在CHAOS-Bench和OmniDocBench基准上显著超越GRPO基线。
阅读全文 →

·4 分钟
韩语发票OCR模型:深度学习+图像预处理实现87%F1值
一篇arXiv研究提出面向韩语发票的OCR模型,通过深度学习与图像预处理结合,在真实发票数据集上实现87%的F1值且处理耗时极低,为多语言文档信息抽取提供了实用思路。
阅读全文 →

·3 分钟
表格空白单元格如何拖垮AI Agent的决策准确性
表格中的空白单元格会导致OCR数值错位,进而破坏AI Agent的决策准确性。本文解析这一隐蔽陷阱的成因、下游影响及应对方法,并介绍LlamaParse等复杂文档解析工具的价值。
阅读全文 →
产品体验·6 分钟
localOCR:本地部署的开源OCR方案,支持Gemma-4等视觉模型
localOCR是一款基于Gemma-4、Llama 3.2等视觉语言模型的本地OCR开源工具,支持离线运行,保障数据隐私。本文详解其技术架构、多模型支持、适用场景及相比传统OCR的核心优势。
阅读全文 →