NoteGenNOTEGEN.

图像识别

在本地 OCR 与在线视觉模型之间选择,并了解平台差异。

开启图像识别后,扫描和图片记录可以自动提取文字或生成描述。

桌面端图像识别设置

OCR

OCR 适合清晰的印刷文字,速度快、可离线运行且不产生模型费用。

  • 桌面环境可能使用 Tesseract 和可下载语言包。
  • macOS、iOS 和 Android 构建可使用系统原生识别能力,具体效果由系统版本决定。
  • 多个 Tesseract 语言使用逗号分隔,例如 chi_sim,eng
  • 首次新增语言可能需要联网下载数据文件。

VLM

VLM 适合复杂布局、表格、手写内容和需要理解图片语义的场景。选择支持视觉输入的聊天模型;图片会发送给所选模型服务。

如何选择

场景推荐
清晰截图、扫描文档、批量文字提取OCR
表格、海报、手写、复杂排版VLM
敏感或离线图片本地 OCR
需要描述画面而非只提取文字VLM

识别结果会保存到记录中,整理前建议检查人名、数字和专业术语。

On this page