共 21 篇相关文章

详解本地OCR识别准确率从60%提升至99%的完整优化过程,涵盖图像预处理、版面分析、后处理纠错等关键步骤,帮助开发者构建生产级本地OCR流水线。

Termy是一款桌面语言学习工具,通过屏幕识别技术将游戏、视频和网站中的生词即时捕捉并情境化记忆。支持Windows和macOS,覆盖30种语言,让你在娱乐中自然习得外语。

VLM.run将DeepSeek-OCR-2、GLM-OCR、dots.mocr等开源OCR模型统一封装为OpenAI兼容API,10万页文档解析成本仅60美元。支持JSON结构化输出、MCP服务器集成,助力企业低成本实现大规模文档解析。

探索一种不依赖截图的屏幕记忆新方案:直接提取屏幕文本并保存为Markdown格式,在存储效率、隐私保护和AI检索能力上实现突破,为开发者和写作者提供更轻量的个人记忆工具选择。

Hugging Face机器学习工程师Niels分享如何用AI Agent自动化Community Science Team的核心工作,从确定性Workflow到自主Agent的架构演进,涵盖技术栈选择、部署方案与真实成效。

Deepmark是一款基于AI语义搜索的书签管理工具,支持聚合浏览器书签、X收藏、Instagram保存等多平台内容,通过多模态解析实现按内容而非标题搜索。本文详细解析其工作原理、性能表现及MCP智能体集成能力。

t0md是一款免费免注册的在线文档转Markdown工具,支持PDF、Word、PPT、HTML、JSON格式转换。内置MCP Server可直接接入Claude、Cursor等AI Agent工作流,让AI自动消化非结构化文档。

SubtitleYC是一款开源硬字幕提取工具,整合yt-dlp视频下载、PaddleOCR字幕识别、帧级预览与SRT编辑导出功能,支持GPU加速,为视频翻译者和字幕组提供一站式工作流。

详解如何构建本地化文档智能系统,替代Azure Document Intelligence实现离线文档解析。涵盖版面分析、OCR引擎选型、多模态大模型部署及混合方案设计,助力企业在保障数据隐私的前提下获得云端级文档处理能力。

Space OCR是一款会自我校验答案的智能OCR工具,支持收据、发票、表单的结构化数据提取,具备数据溯源和自动验证能力。本文详细解析其核心功能、应用场景及产品策略。

深入分析用嵌入模型(如bge-m3)做PDF文档分类的局限性,包括标签描述敏感、长文档语义稀释等问题,并提供LLM直接分类、监督学习分类器、多模态特征融合三种更可靠的技术路径。
反AI字体:人能读懂、机器识别不了的对抗性设计
反AI字体通过对抗性字形设计,利用人类视觉与机器视觉的感知鸿沟,阻挡OCR与大模型自动抓取。本文解析其技术原理、现实局限与数据主权意义。

简历写满RAG、Agent却频繁挂面?问题在于只会跑Demo,讲不清生产环境的工程难题。本文系统拆解数据清洗、混合检索、幻觉防护、Agent死循环熔断等核心考点,帮你完成从调包侠到架构师的认知升级。

企业如何用AI处理50+种发票格式?本文深度解析视觉文档理解技术路线,涵盖多模态大模型、OCR+LLM组合、混合架构三大方案,并给出非技术AI负责人的关键决策建议,助你高效落地发票折扣自动比对系统。

PP-OCRv6是飞桨推出的SOTA级OCR模型,本文记录Docker部署全流程、发票识别实测效果,并深度剖析"整块区域漏识"的根本原因——字体缺失问题,助你快速避坑,结合N8n搭建自动化识别工作流。

一款开源PDF解析引擎,20毫秒完成文档分类,纯Rust实现比顶级方案快3倍。通过智能分流策略,文本型PDF本地直转Markdown,扫描件才走OCR,大幅降低RAG系统与知识库构建的计算成本。

A Giant Shot 是一款内置 MCP Server 的桌面截图工具,提供11种标注工具、智能OCR、AI对话及桌面自动化操控功能,支持一键接入 Cursor 和 Claude Desktop,让 AI 真正看到并操控你的屏幕。

开发者用GPT-5.5替代传统OCR流水线,完成ChinaRxiv超2.3万篇中文学术论文的英文翻译并免费开放。本文解析技术路径转变、翻译质量提升及对学术开放获取的深远影响。