Apinoa Docs

纯 OCR

检测并识别商品图片中的文字。返回带有多边形、外接矩形、文字内容与置信度的区域 — 不修复图像,不翻译,不渲染。

查看原始 .mdx

接口

POST /v1/image-translate/ocr

只执行完整流水线中的 OCR 步骤。返回带几何信息和置信度的识别区域。图像不会被修改,不会进行翻译,也不会生成最终图。当你只需要文字坐标和内容时使用 — 例如对图片做预筛选,或驱动自定义后续流程。

单次调用比 /translate 更便宜。

请求格式

接口仅接受 HTTP body 中的原始图片字节。不接受 JSON + base64。

头部必填说明
Content-Typeimage/jpegimage/pngimage/webpapplication/octet-stream
x-api-keyAPI 密钥

其余参数全部通过查询字符串传递:

参数类型必填默认说明
source_languagestring取自 chzhzh-CNzh-TWchinese_chtjajapanenauto

响应

{
  "success": true,
  "requestId": "550e8400e29b41d4a716446655440000",
  "data": {
    "regions": [
      {
        "polygon": [[10, 20], [210, 20], [210, 60], [10, 60]],
        "bbox": { "x": 10, "y": 20, "w": 200, "h": 40 },
        "text": "免费送货",
        "confidence": 0.98
      }
    ],
    "src_w": 790,
    "src_h": 1158,
    "regions_found": 1
  }
}
字段类型说明
regions[].polygonnumber[][]原图坐标系下的 4 点多边形
regions[].bboxobject原图坐标系下的轴对齐外接矩形 {x, y, w, h}
regions[].textstring识别出的文字
regions[].confidencenumber识别置信度,0–1
src_w, src_hinteger原图宽高(像素)
regions_foundinteger返回的区域数

示例

cURL

curl -X POST "https://gateway.apinoa.com/v1/image-translate/ocr?source_language=zh-CN" \
  -H "x-api-key: $APINOA_API_KEY" \
  -H "Content-Type: image/jpeg" \
  --data-binary @product.jpg

Python

import requests

with open("product.jpg", "rb") as f:
    img_bytes = f.read()

r = requests.post(
    "https://gateway.apinoa.com/v1/image-translate/ocr",
    headers={
        "x-api-key": "YOUR_API_KEY",
        "Content-Type": "image/jpeg",
    },
    params={"source_language": "zh-CN"},
    data=img_bytes,
    timeout=60,
)
r.raise_for_status()
for region in r.json()["data"]["regions"]:
    print(region["text"], region["confidence"])

限制

项目
最大尺寸8192 × 8192 px
最大请求体20 MB
图片格式JPEG、PNG、WebP

错误

代码HTTP触发条件
BAD_REQUEST400空 body 或参数无效
UNAUTHORIZED401API key 缺失或无效
UNSUPPORTED_MEDIA_TYPE415Content-Type 不是二进制图片类型
PAYLOAD_TOO_LARGE413body > 20 MB
INSUFFICIENT_BALANCE402余额不足以支付本次调用
UPSTREAM_ERROR502识别服务临时不可用

价格

每次调用按价格页面上的 image-translate 费率从您的余额中扣除。

本页内容