程序员茄子
全部
编程
代码
资讯
案例
综合
联系我们
OCR 相关技术文章
php
mysql
shell
go
vue
css
api接口对接
支付接口对接
pdf-inspector 开源:Firecrawl 的 PDF 交通警察,200 份文档 0.47 秒分类提取
编程
pdf-inspector 开源:Firecrawl 的 PDF 交通警察,200 份文档 0.47 秒分类提取
2026-09-12 09:56:54
pdf-inspector 是 Firecrawl 开源的 PDF 智能分类与提取库:先判断 PDF 是文本型、扫描件、图片型还是混合型再决定处理方式,分类只要 10-50ms,文本型本地处理 200ms 内,200 份文档基准 0.47 秒比 PyMuPDF4LLM 快 30 多倍;提取带 X/Y 坐标与字体信息并自动还原多栏阅读顺序,双模式表格检测得分 0.814 领先,支持 Python/Node/Rust/浏览器 WASM。
pdf-inspector
PDF解析
OCR
RAG
Firecrawl
LiteParse 开源:LlamaIndex 出品的本地 PDF 解析器,Rust 实现快准还带 OCR
编程
LiteParse 开源:LlamaIndex 出品的本地 PDF 解析器,Rust 实现快准还带 OCR
2026-09-12 09:52:31
LiteParse 是 LlamaIndex 团队用 Rust 从零重写的本地 PDF 解析工具:基于 Chrome 同款 PDFium 引擎做字符级文本提取,内置 Tesseract OCR 开箱即用且智能判断仅对扫描页触发;保留空间布局输出边界框,支持 Word/Excel/PPT/图片等格式与批量解析、页面截图,提供 Rust/Python/Node/WASM 四语言绑定。
LiteParse
PDF解析
OCR
LlamaIndex
Rust
LifeTrace:自动截屏 + OCR 的本地数字记忆库,让电脑替你记住一切
资讯
LifeTrace:自动截屏 + OCR 的本地数字记忆库,让电脑替你记住一切
2026-09-12 09:46:56
LifeTrace 是运行在本地的全自动生活记录与检索系统:定时截屏 + OCR 提取文字 + 向量存储,支持自然语言语义检索过去看到的内容,自动聚合智能事件并生成 24 小时时间分配图表,所有数据本地存储、断网可用。
LifeTrace
OCR
向量检索
数字记忆
本地优先
不用越狱,iPhone屏幕上的字靠OCR找坐标:macOS镜像窗口里跑通了Agent控制真机
编程
不用越狱,iPhone屏幕上的字靠OCR找坐标:macOS镜像窗口里跑通了Agent控制真机
2026-09-05 19:22:27
介绍 phone-harness 这个开源项目:利用macOS的iPhone Mirroring镜像窗口,通过Vision Framework做OCR识别文字坐标、CGEvents模拟点击输入,让Claude和Codex等Agent无需越狱即可操作真实iPhone,GitHub已获2.3K Star。
phone-harness
iPhone自动化
Agent控制手机
iPhone Mirroring
OCR
Unlimited-OCR:百度开源长文档OCR模型,3B参数刷新端到端SOTA
编程
Unlimited-OCR:百度开源长文档OCR模型,3B参数刷新端到端SOTA
2026-09-05 19:02:41
介绍百度开源的Unlimited-OCR文档解析模型:总参数3B、实际激活仅500M,通过R-SWA参考滑动窗口注意力和DeepEncoder实现40多页文档一次性解析不丢内容不减速,在OmniDocBench v1.6上达93.92%,支持Transformers和SGLang两种推理方式。
Unlimited-OCR
文档解析
OCR
百度开源
长文档
Docling:IBM 开源的文档解析与转换工具
代码
Docling:IBM 开源的文档解析与转换工具
2026-09-05 01:25:18
介绍 IBM 开源的 Python 文档解析工具 Docling:支持 PDF/DOCX/PPTX/图片/音频等格式,可输出 Markdown/HTML/JSON,集成 LangChain 等 AI 生态,含安装、Python 与命令行用法。
Docling
文档解析
Python
开源
PDF
OCR
PDF24 免费 PDF 工具箱:30+ 功能覆盖编辑/转换/OCR,支持在线与桌面端
编程
PDF24 免费 PDF 工具箱:30+ 功能覆盖编辑/转换/OCR,支持在线与桌面端
2026-09-05 00:50:20
介绍免费 PDF 处理工具 PDF24:30+ 功能覆盖编辑、合并拆分、格式互转、OCR、压缩加密加水印,支持在线版与桌面版,并给出官方使用与下载地址。
PDF24
PDF
OCR
工具
小旺AI截图:接入 DeepSeek 的 Windows/macOS 截图工具
编程
小旺AI截图:接入 DeepSeek 的 Windows/macOS 截图工具
2026-09-04 23:15:21
小旺AI截图是一款接入 DeepSeek 的免费截图工具,支持截图、贴图、长截图、带壳截图、录屏、标注、OCR、AI 翻译与 AI 解释,覆盖 Windows 和 macOS 平台。
截图工具
OCR
DeepSeek
Windows
macOS
MinerU-Popo:4B 后处理模型把跨页 OCR 拼回文档树,TEDS 53.7→90.6
编程
MinerU-Popo:4B 后处理模型把跨页 OCR 拼回文档树,TEDS 53.7→90.6
2026-09-03 18:45:07
MinerU 团队开源的 MinerU-Popo 是 4B 参数的 OCR 后处理模型,负责把跨页被切碎的表格、段落、标题层级和图文关系重新拼成文档树,五家主流 OCR 的标题层级 TEDS 从 50-60 分冲到 80 分以上。本文拆解它的数据引擎、动态分块与文档富化三招原理及成本账。
MinerU-Popo
OCR
文档解析
RAG
大模型
把 OCR 塞进浏览器:onnxruntime-web + PP-OCRv6 tiny 实战笔记
编程
把 OCR 塞进浏览器:onnxruntime-web + PP-OCRv6 tiny 实战笔记
2026-09-01 18:27:29
本文介绍如何用onnxruntime-web将PP-OCRv6 tiny模型部署到浏览器,实现纯前端OCR识别。无需后端服务,图片不出本机。详细讲解模型下载、文本检测DBNet后处理、CTC解码等完整流程,适合内部工具与离线环境。注意这是demo级方案,需权衡设备性能。
OCR
前端
AI推理
WebGPU
PP-OCRv6
AI 阅卷这套流程,"知卷"跑通了,但选型前先确认这几件事
编程
AI 阅卷这套流程,"知卷"跑通了,但选型前先确认这几件事
2026-08-31 07:33:32
调研 AI 阅卷/试卷批改方向的开源与商用方案时,看到"知卷"跑通了从试卷识别到错题分析的全链路。这篇文章讲清楚它的功能边界、适用场景和选型前要确认的几个关键点。
AI阅卷
试卷批改
OCR
知卷
开源项目
微软 MarkItDown 深度拆解:一个依赖吃掉所有文档格式,RAG 预处理层的事实标配是怎样炼成的
编程
微软 MarkItDown 深度拆解:一个依赖吃掉所有文档格式,RAG 预处理层的事实标配是怎样炼成的
2026-07-30 03:13:05
深度拆解微软开源的 MarkItDown:统一入口把 PDF/Word/PPT/Excel/音频/ZIP 转成结构保留的 Markdown,含转换器注册架构、RAG 流水线实战、插件开发、三档云端后端选型与生产性能安全清单。
MarkItDown
Microsoft
RAG
文档转换
Markdown
LLM
Python
OCR
开源
文档预处理
编程
MarkItDown 深度拆解:当微软把文档预处理做到极致——161K Star 的 LLM 预处理层工程全貌(2026·完整版)
2026-07-20 11:50:12
2026年深度拆解微软开源项目 MarkItDown:161K Star 的文档转 Markdown 神器,从插件化架构、20+格式处理机制到生产级 RAG 流水线集成的完整工程指南,配可运行代码示例。
MarkItDown
Python
LLM
RAG
文档处理
微软
开源
Markdown
PDF
Word
Excel
OCR
向量化
百度Unlimited-OCR深度解析:R-SWA常量KV缓存如何让OCR一口气吃下几十页文档——从单图解析到多页PDF的完整实战指南
编程
百度Unlimited-OCR深度解析:R-SWA常量KV缓存如何让OCR一口气吃下几十页文档——从单图解析到多页PDF的完整实战指南
2026-07-06 11:16:05
深度解析百度开源Unlimited-OCR:13K+ Stars,R-SWA常量KV缓存让端到端OCR模型在32K上下文下一次性转录几十页文档。从架构设计到vLLM/SGLang生产部署完整实战指南。
Unlimited-OCR
百度
R-SWA
OCR
KV缓存
文档解析
长文档
vLLM
百度 Unlimited OCR 深度解析:端到端架构、R-SWA 常数量化 KV Cache,以及让 AI 像人一样抄书的工程革命
编程
百度 Unlimited OCR 深度解析:端到端架构、R-SWA 常数量化 KV Cache,以及让 AI 像人一样抄书的工程革命
2026-07-05 05:41:29
深度解析百度2026年开源的Unlimited OCR模型:端到端架构、R-SWA常数量化KV Cache机制、MoE解码器设计,以及让AI像人一样连续解析长文档的工程革命。含完整代码实战。
OCR
百度
端到端OCR
R-SWA
KV Cache
文档识别
多模态
百度 Unlimited OCR 深度技术解析:端到端多模态OCR模型架构与R-SWA注意力机制详解
编程
百度 Unlimited OCR 深度技术解析:端到端多模态OCR模型架构与R-SWA注意力机制详解
2026-07-05 02:43:03
深入解析百度Unlimited OCR的核心技术:R-SWA注意力机制如何将KV Cache压成常数,DeepEncoder+MoE解码器架构,以及长文档OCR的完整解决方案。
OCR
百度
深度学习
Transformer
KV Cache
端到端
多模态
文档解析
百度 Unlimited OCR 深度解析:端到端长文档 OCR 的新范式——从 R-SWA 机制到 3B 参数模型、从 KV Cache 压缩到生产级部署的完整技术指南(2026)
编程
百度 Unlimited OCR 深度解析:端到端长文档 OCR 的新范式——从 R-SWA 机制到 3B 参数模型、从 KV Cache 压缩到生产级部署的完整技术指南(2026)
2026-07-04 03:13:57
2026年6月百度开源Unlimited OCR,5天GitHub Star破1万。深度解析R-SWA机制、3B参数模型架构、KV Cache压缩原理,含完整部署代码与生产级应用案例。
百度
Unlimited OCR
OCR
R-SWA
KV Cache
长文档识别
端到端OCR
多模态模型
万字深度解析百度 Unlimited OCR:当长文档解析遇见 R-SWA 革命——从常数级 KV Cache 到 40 页一次性识别的完整技术指南(2026)
编程
万字深度解析百度 Unlimited OCR:当长文档解析遇见 R-SWA 革命——从常数级 KV Cache 到 40 页一次性识别的完整技术指南(2026)
2026-07-02 18:16:20
深度解析百度 Unlimited OCR 的 R-SWA 参考滑动窗口注意力机制,将 KV Cache 从线性增长压至常数级;3B MoE 解码器架构、DeepEncoder 视觉编码器;完整本地部署代码、KV Cache 监控脚本与 SGLang 生产推理优化指南。OmniDocBench v1.6 综合得分 93.92%,端到端 OCR 新 SOTA。
OCR
R-SWA
KV Cache
MoE
百度
长文档解析
Transformer
深度学习
Python
性能优化
R-SWA如何让OCR「过目不忘」:百度Unlimited-OCR的KV缓存革命与40页长文档解析实战(2026)
编程
R-SWA如何让OCR「过目不忘」:百度Unlimited-OCR的KV缓存革命与40页长文档解析实战(2026)
2026-07-02 10:47:12
深度解析百度2026年开源的Unlimited-OCR模型:3B参数的端到端OCR系统,R-SWA机制实现常数级KV缓存,OmniDocBench 93.92% SOTA评分,可一口气解析40页文档
Unlimited-OCR
百度
OCR
R-SWA
MoE
CLIP
端到端
长文档处理
深度学习
多模态
万字深度解析百度 Unlimited-OCR:当端到端OCR遇见R-SWA革命,从逐页失忆到40页文档一口气解析(2026)
编程
万字深度解析百度 Unlimited-OCR:当端到端OCR遇见R-SWA革命,从逐页失忆到40页文档一口气解析(2026)
2026-07-02 10:46:07
深度解析百度2026年开源的Unlimited-OCR模型:3B参数的端到端OCR系统,R-SWA机制实现常数级KV缓存,OmniDocBench 93.92% SOTA评分,可一口气解析40页文档
Unlimited-OCR
百度
OCR
R-SWA
MoE
CLIP
端到端
长文档处理
深度学习
多模态
万字深度解析 MinerU:当文档解析遇见「视觉语言模型」——从 PDF 到结构化 Markdown 的端到端工程化实践(2026)
编程
万字深度解析 MinerU:当文档解析遇见「视觉语言模型」——从 PDF 到结构化 Markdown 的端到端工程化实践(2026)
2026-07-02 01:13:03
深度解析MinerU开源项目:72.3K GitHub Star的文档解析引擎,VLM+OCR双引擎,1.2B参数达到95.69分(OmniDocBench),支持PDF/DOCX/PPTX/XLSX解析,原生集成LangChain/Dify/RAGFlow等六大框架,含15+可运行代码示例。
MinerU
PDF解析
文档解析
RAG
LLM
VLM
OCR
LangChain
Dify
MCP
编程
万字深度解析 Microsoft MarkItDown:当文档解析遇见 LLM 预处理——从 15 种格式支持到 RAG 生产级实战的完整指南(2026)
2026-07-01 08:46:35
万字深度解析微软 MarkItDown:15种格式一键转Markdown,单月新增34K Star登顶GitHub飙星榜。涵盖技术架构、核心算法、代码实战、性能优化与生产部署完整指南。
MarkItDown
文档转换
Markdown
LLM
RAG
PDF
Word
OCR
微软
开源项目
万字深度解析百度 Unlimited OCR:当 R-SWA 遇见 MoE——3B 参数如何碾压端到端 OCR 全场(2026)
编程
万字深度解析百度 Unlimited OCR:当 R-SWA 遇见 MoE——3B 参数如何碾压端到端 OCR 全场(2026)
2026-07-01 03:42:17
2026年6月百度开源Unlimited OCR,5天GitHub Star破万。深度解析R-SWA注意力机制、MoE架构、16倍视觉Token压缩,以及为何能将KV Cache从线性增长压成常数。
Unlimited OCR
OCR
R-SWA
MoE
百度
深度学习
计算机视觉
文档识别
KV Cache
百度Unlimited OCR技术深度解析:R-SWA机制如何把KV Cache压成常数,3B模型刷新长文档OCR王座
编程
百度Unlimited OCR技术深度解析:R-SWA机制如何把KV Cache压成常数,3B模型刷新长文档OCR王座
2026-06-30 02:13:31
百度Unlimited OCR技术深度解析:R-SWA机制如何把KV Cache压成常数,3B模型刷新长文档OCR王座
OCR
百度
深度学习
文档解析
R-SWA
大家都在搜索什么?
devops
易支付
一个官网+多少钱
统一接受回调
统一回调
python
sub
node
宝塔日志
mysql
shell
ElasticSearch
css
vue
api接口对接
2025
支付接口对接
go
php
php回调
上一页
1
2
下一页
共 2 页
到第
页
确定