方案1:Gitee国内仓库(浏览器直接点Raw下载,推荐)
仓库地址:https://gitee.com/hnkf_panda/chi_sim.traineddata
- 打开页面 → 点
chi_sim.traineddata - 点 Raw,右键另存为,文件名保持
chi_sim.traineddata,不要自动加上.txt后缀
方案2:国外稳定直链(电脑浏览器下载,国内访问尚可)
简体中文:https://downloads.soliddocuments.com/solidframework/tessdata/chi_sim.traineddata 英文包(建议一起下):https://downloads.soliddocuments.com/solidframework/tessdata/eng.traineddata
这个是静态文件CDN,不需要进GitHub仓库,打开链接直接弹出下载。
方案3:群晖SSH直接wget拉取(不用经过电脑,直接存到NAS tessdata目录)
wget [https://downloads.soliddocuments.com/solidframework/tessdata/chi_sim.traineddata](https://downloads.soliddocuments.com/solidframework/tessdata/chi_sim.traineddata) -P /volume1/docker/stirling-pdf/tessdata/
wget [https://downloads.soliddocuments.com/solidframework/tessdata/eng.traineddata](https://downloads.soliddocuments.com/solidframework/tessdata/eng.traineddata) -P /volume1/docker/stirling-pdf/tessdata/
下载完成之后操作步骤
- File Station 确认文件在
/volume1/docker/stirling-pdf/tessdata/ - 进入Container Manager,重启 stirling-pdf 容器
- 登录网页,打开OCR工具,语言下拉框出现
chi_sim,代表加载成功。
补充说明:这个语言包虽然提交时间比较早,Tesseract5(StirlingPDF内置版本)完全兼容,识别效果正常,官方tessdata仓库本身就很久没有更新训练模型文件,不是版本老旧失效。
小坑提醒
Windows浏览器另存的时候,经常自动把文件名保存成 chi_sim.traineddata.txt,这种文件Tesseract不认。
File Station看属性,文件名必须严格:chi_sim.traineddata
eng.traineddata(英文语言包)
CDN直链,点开直接下载: https://downloads.soliddocuments.com/solidframework/tessdata/eng.traineddata
方案A:电脑浏览器下载 → 上传群晖
- 打开上面链接,浏览器自动下载
eng.traineddata - 上传到
/volume1/docker/stirling-pdf/tessdata,和chi_sim.traineddata放在同一个文件夹
方案B:群晖SSH一键下载(直接落盘,不用电脑中转)
wget [https://downloads.soliddocuments.com/solidframework/tessdata/eng.traineddata](https://downloads.soliddocuments.com/solidframework/tessdata/eng.traineddata) -P /volume1/docker/stirling-pdf/tessdata/
操作收尾
- 两个文件都到位后,重启 stirling-pdf 容器
- OCR工具里下拉框会同时出现
chi_sim、eng中英文混合扫描PDF,语言同时勾选
chi_sim + eng,识别准确率最高。
补充
- eng包大小约10MB
- 文件名不要改动,不能加
.txt后缀
Stirling-PDF 能力总结
✅ 强项(稳定好用,是它的核心定位)
- PDF合并、拆分、页面提取/删除、旋转页面、重新排序:这个是它最稳的功能,几乎不会报错,批量处理很方便。
- PDF压缩、转图片、图片转PDF:批量图片打包成PDF,压缩PDF体积,实用性很强。
- 加密/解密PDF、添加水印、页码:给PDF加水印、移除密码保护。
- OCR扫描件PDF(图片PDF增加文字层):就是你刚才测试的功能。
⚠️OCR属于附加功能,依赖Tesseract语言包配置,配置不对就会报服务器错误;OCR不是它最强项,合并拆分这类是原生内置,稳定性远高于OCR。
❌ 不是强项
- 不是专业PDF在线文字编辑:不能直接像Word一样,点文字修改原文。
所谓“在线编辑”,只能做:裁剪页面、添加图片/水印、涂黑遮盖敏感信息。
它没法直接修改PDF里已经存在的文字内容。
一句话概括
Stirling-PDF 主打PDF文档处理工具箱:合并、拆分、页面管理、压缩、加水印、OCR加文字层。 不是PDF编辑器,不能直接修改PDF内原有文字。
对应你刚才的OCR功能
OCR做完之后:
- ✅ 文字可以复制、搜索
- ❌ 不能在Stirling-PDF里直接修改识别出来的文字 如果需要修改识别后的文字,要导出文字到Word再编辑