图像识别
在本地 OCR 与在线视觉模型之间选择,并了解平台差异。
开启图像识别后,扫描和图片记录可以自动提取文字或生成描述。
OCR
OCR 适合清晰的印刷文字,速度快、可离线运行且不产生模型费用。
- 桌面环境可能使用 Tesseract 和可下载语言包。
- macOS、iOS 和 Android 构建可使用系统原生识别能力,具体效果由系统版本决定。
- 多个 Tesseract 语言使用逗号分隔,例如
chi_sim,eng。 - 首次新增语言可能需要联网下载数据文件。
VLM
VLM 适合复杂布局、表格、手写内容和需要理解图片语义的场景。选择支持视觉输入的聊天模型;图片会发送给所选模型服务。
如何选择
| 场景 | 推荐 |
|---|---|
| 清晰截图、扫描文档、批量文字提取 | OCR |
| 表格、海报、手写、复杂排版 | VLM |
| 敏感或离线图片 | 本地 OCR |
| 需要描述画面而非只提取文字 | VLM |
识别结果会保存到记录中,整理前建议检查人名、数字和专业术语。