Skip to main content

这是什么

「文字识别」是技能库里的官方 OCR 能力。用户在应用中上传证件、发票、表格或商品图片后,系统会提取文字,并在对应品类支持时返回可用于填表和后续流程的结构化字段。 OCR 是同步调用:一次请求处理一张图片,返回文字汇总和品类对应的结构化明细,不需要像视频生成那样创建异步任务并轮询。

支持类型

  • 通用文字、手写文字
  • 身份证、银行卡
  • 行驶证、驾驶证
  • 护照、营业执照
  • 增值税发票、混贴票据
  • 车牌、表格

核心能力


入口位置

  1. 进入任意项目。
  2. 顶部切换到 「研发」 Tab。
  3. 左侧导航选择 「技能库」。
  4. 在卡片列表中找到 「文字识别」。

怎么启用

1

点击使用

在技能库中打开「文字识别」,或在对话中说明应用需要证件、发票或图片文字识别。
2

由 superun 准备依赖

superun 自动启用 OCR、项目文件存储和所需云服务,并把 OCR 调用凭证配置在项目服务端。
3

接入应用流程

在应用中上传一张图片,由服务端发起识别并同步展示结果。
OCR 是给你生成的应用使用的能力,不是对话里的普通图片理解工具。浏览器不能直接获取或使用 OCR 密钥。

图片与返回结果要求

  • 每次识别一张图片,常见格式包括 JPG、PNG、BMP、GIF、TIFF 和 WebP。
  • 本地图片先上传到项目文件存储,再由服务端使用可访问的 HTTP(S) 地址调用;浏览器本地路径和 blob: 地址无法使用。
  • 厂商 URL 参数最长为 2048 字节。签名地址过长时,应使用更短的存储或 CDN 地址。
  • 返回结果包含文字汇总和品类对应的结构化明细;不同类型返回字段不同。
  • OCR 密钥只保存在服务端环境变量中,不能写入前端代码、数据库、日志或接口响应。

计费

  • 识别成功后按次计费;厂商识别失败不会按成功调用扣费。
  • 消费记录映射到 「文字识别」 类型。
  • 具体单价以当前产品账单为准,文档不写死单价。

隐私与合规

  • 证件和发票可能包含敏感个人信息。
  • OCR 处理链路不保存原图和识别结果,也不会把图片地址或识别内容写入日志。
  • 如果应用先把原图上传到项目文件存储,文件保留时间由应用自己的保存和删除规则决定。
  • 处理他人证件或其他敏感材料前,必须确认已获得当事人授权。

常见问题

不会按成功调用扣费。用量在识别成功后才上报。
OCR 处理链路不保存图片和识别结果。应用上传到项目文件存储的原图仍按应用自己的保存和删除规则管理。
本地路径和 blob: 地址只在当前浏览器中有效。请先上传到项目文件存储,再由服务端使用可访问的图片地址发起识别。