方案1:Gitee国内仓库(浏览器直接点Raw下载,推荐)

仓库地址:https://gitee.com/hnkf_panda/chi_sim.traineddata

  1. 打开页面 → 点 chi_sim.traineddata
  2. 点 Raw,右键另存为,文件名保持 chi_sim.traineddata,不要自动加上.txt后缀

方案2:国外稳定直链(电脑浏览器下载,国内访问尚可)

简体中文:https://downloads.soliddocuments.com/solidframework/tessdata/chi_sim.traineddata 英文包(建议一起下):https://downloads.soliddocuments.com/solidframework/tessdata/eng.traineddata

这个是静态文件CDN,不需要进GitHub仓库,打开链接直接弹出下载。

方案3:群晖SSH直接wget拉取(不用经过电脑,直接存到NAS tessdata目录)

wget [https://downloads.soliddocuments.com/solidframework/tessdata/chi_sim.traineddata](https://downloads.soliddocuments.com/solidframework/tessdata/chi_sim.traineddata) -P /volume1/docker/stirling-pdf/tessdata/
wget [https://downloads.soliddocuments.com/solidframework/tessdata/eng.traineddata](https://downloads.soliddocuments.com/solidframework/tessdata/eng.traineddata) -P /volume1/docker/stirling-pdf/tessdata/

下载完成之后操作步骤

  1. File Station 确认文件在 /volume1/docker/stirling-pdf/tessdata/
  2. 进入Container Manager,重启 stirling-pdf 容器
  3. 登录网页,打开OCR工具,语言下拉框出现 chi_sim,代表加载成功。

补充说明:这个语言包虽然提交时间比较早,Tesseract5(StirlingPDF内置版本)完全兼容,识别效果正常,官方tessdata仓库本身就很久没有更新训练模型文件,不是版本老旧失效。

小坑提醒

Windows浏览器另存的时候,经常自动把文件名保存成 chi_sim.traineddata.txt,这种文件Tesseract不认。 File Station看属性,文件名必须严格:chi_sim.traineddata

eng.traineddata(英文语言包)

CDN直链,点开直接下载: https://downloads.soliddocuments.com/solidframework/tessdata/eng.traineddata

方案A:电脑浏览器下载 → 上传群晖

  1. 打开上面链接,浏览器自动下载 eng.traineddata
  2. 上传到 /volume1/docker/stirling-pdf/tessdata,和 chi_sim.traineddata 放在同一个文件夹

方案B:群晖SSH一键下载(直接落盘,不用电脑中转)

wget [https://downloads.soliddocuments.com/solidframework/tessdata/eng.traineddata](https://downloads.soliddocuments.com/solidframework/tessdata/eng.traineddata) -P /volume1/docker/stirling-pdf/tessdata/

操作收尾

  1. 两个文件都到位后,重启 stirling-pdf 容器
  2. OCR工具里下拉框会同时出现 chi_sim、eng

    中英文混合扫描PDF,语言同时勾选 chi_sim + eng,识别准确率最高。

补充

  • eng包大小约10MB
  • 文件名不要改动,不能加 .txt 后缀

Stirling-PDF 能力总结

✅ 强项(稳定好用,是它的核心定位)

  1. PDF合并、拆分、页面提取/删除、旋转页面、重新排序:这个是它最稳的功能,几乎不会报错,批量处理很方便。
  2. PDF压缩、转图片、图片转PDF:批量图片打包成PDF,压缩PDF体积,实用性很强。
  3. 加密/解密PDF、添加水印、页码:给PDF加水印、移除密码保护。
  4. OCR扫描件PDF(图片PDF增加文字层):就是你刚才测试的功能。

    ⚠️OCR属于附加功能,依赖Tesseract语言包配置,配置不对就会报服务器错误;OCR不是它最强项,合并拆分这类是原生内置,稳定性远高于OCR。

❌ 不是强项

  • 不是专业PDF在线文字编辑:不能直接像Word一样,点文字修改原文。 所谓“在线编辑”,只能做:裁剪页面、添加图片/水印、涂黑遮盖敏感信息。

    它没法直接修改PDF里已经存在的文字内容。

一句话概括

Stirling-PDF 主打PDF文档处理工具箱:合并、拆分、页面管理、压缩、加水印、OCR加文字层。 不是PDF编辑器,不能直接修改PDF内原有文字。

对应你刚才的OCR功能

OCR做完之后:

  • ✅ 文字可以复制、搜索
  • ❌ 不能在Stirling-PDF里直接修改识别出来的文字 如果需要修改识别后的文字,要导出文字到Word再编辑