NoteExpress

 找回密码
 立即注册
搜索
热搜: NE3 NE 3 已解决
查看: 125|回复: 5

建议

[复制链接]

2

主题

7

帖子

24

积分

新手上路

Rank: 1

积分
24
发表于 2026-7-13 10:13:43 | 显示全部楼层 |阅读模式
这篇文献使用全文翻译功能会乱码,麻烦改进一下

Seasonal characteristics of nitric oxide emission from a typical Chinese rice-wh.pdf

414.16 KB, 下载次数: 11

回复

使用道具 举报

42

主题

1436

帖子

4772

积分

论坛元老

Rank: 8Rank: 8

积分
4772
发表于 2026-7-13 11:25:43 | 显示全部楼层
谢谢,我们尽快查看原因!
回复 支持 反对

使用道具 举报

241

主题

1万

帖子

3万

积分

管理员

Rank: 9Rank: 9Rank: 9

积分
36645
发表于 2026-7-13 12:37:09 | 显示全部楼层
这篇文献的 PDF 存在加密/特殊编码(您可以尝试复制PDF内容,会出现乱码符号),这类文件会干扰系统对文字内容的识别,导致翻译功能暂时无法正常工作。

我已经反馈给开发人员,看看是否能解决此类问题。

为感谢您的反馈,可以提供NE 的 用户ID,我会赠送您500万token 使用。
回复 支持 反对

使用道具 举报

42

主题

1436

帖子

4772

积分

论坛元老

Rank: 8Rank: 8

积分
4772
发表于 2026-7-13 16:05:11 来自手机 | 显示全部楼层
“ 解决方案:修复嵌入Type1字体PDF的翻译/乱码问题 根据您提供的截图和描述(WPS/翻译工具无法正常处理,出现乱码,提示“嵌入式 Type1 字体 + ToUnicode 映射缺失”),这是一个常见的旧式PDF字体问题(尤其是扫描或早期生成的学术论文PDF)。PDF本身可正常打开,但文本层无法正确映射,导致翻译工具(如WPS AI、Google Translate等)失败。 1. 最快速有效方案:OCR 重新生成可翻译PDF(推荐)         •        使用工具:         ◦        Adobe Acrobat(专业版最佳):打开PDF → “工具” → “扫描和OCR” → “增强扫描”或“可搜索PDF”。它会自动识别文本并修复字体映射。         ◦        免费替代:         ▪        ABBYY FineReader 或 PDFelement(支持批量OCR)。         ▪        在线工具(小心隐私):Smallpdf、iLovePDF 或 ILoveOCR 的“PDF to searchable PDF”功能。         ▪        开源:使用 ocrmypdf 命令行工具(安装后:ocrmypdf input.pdf output.pdf)。 这会生成一个新的可搜索PDF,文本层正常,翻译工具就能正常工作。 2. 手动提取文本 + 翻译         •        如果OCR不可用:         1        在Adobe Reader或WPS中打开PDF,尝试“复制”可见文本(即使乱码,也可能部分可用)。         2        使用Google Lens(手机摄像头对准屏幕)或Microsoft Lens拍照识别文本。         3        上传PDF到 Google Drive → 右键“用Google文档打开” → 它会自动OCR并转为可编辑文档。         4        然后复制到翻译工具(DeepL、ChatGPT、Google Translate)。 3. 服务端/开发端改进(对应您邮件中的“安排大坤”部分)         •        添加字体/编码检测逻辑:
# 示例:使用Python (pypdf + font分析)         •        from pypdf import PdfReader         •        reader = PdfReader("your_file.pdf")         •        for page in reader.pages:         •            for font in page.get_fonts():  # 或检查 /ToUnicode         •                if "Type1" in str(font) and not has_ToUnicode(font):         •                    print("检测到问题字体,建议OCR")         •                 •        用户提示:在翻译前弹出“检测到旧式Type1字体PDF,推荐使用OCR模式或导出为图像后处理”。         •        后备方案:自动将PDF转为图像页(pdftoppm),然后批量OCR。 4. 预防类似问题         •        生成PDF时:避免旧Type1字体,使用TrueType/OpenType字体 + 嵌入完整子集,并确保生成ToUnicode CMap(大多数现代工具如LaTeX新版、Word导出默认支持)。         •        学术PDF常见:很多老论文(如您截图中的 Global Change Biology 2003年论文)都有此问题,优先用Sci-Hub/官方来源下载新版,或联系作者索要Word源文件。 当前文档处理 我已尝试直接处理附件(截图中的PDF内容),但由于它是图像截图而非标准PDF文件,无法直接文本提取。如果您能提供原PDF文件(而非截图),我可以进一步尝试OCR提取全文并翻译成中文/英文。 需要我帮您提取/翻译具体部分吗? 请上传原PDF或描述具体需求(如“提取Abstract并翻译”),我可以继续协助! 如果是大批量处理,推荐部署 ocrmypdf + Tesseract作为自动化方案。”
回复 支持 反对

使用道具 举报

2

主题

7

帖子

24

积分

新手上路

Rank: 1

积分
24
 楼主| 发表于 2026-7-13 19:14:34 | 显示全部楼层
谢谢解答,感谢
ID2228350
回复 支持 反对

使用道具 举报

241

主题

1万

帖子

3万

积分

管理员

Rank: 9Rank: 9Rank: 9

积分
36645
发表于 2026-7-13 22:04:13 | 显示全部楼层
Mr_Zhou888 发表于 2026-7-13 19:14
谢谢解答,感谢
ID2228350

token已赠送。
回复 支持 反对

使用道具 举报

*滑块验证:
您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

小黑屋|NoteExpress

GMT+8, 2026-7-31 01:18 , Processed in 0.140172 second(s), 24 queries .

Powered by Discuz! X3.4

Copyright © 2001-2021, Tencent Cloud.

快速回复 返回顶部 返回列表