[AI60]创建OCR识别任务
该接口专注于为科技情报行业的图片或PDF文件(如专利文献、期刊论文、政策法规、新闻等)创建OCR识别任务,获取下载OCR识别任务的job_id,通过job_id 去 [AI60]下载OCR识别结果。 OCR识别支持识别图片或扫描的PDF等文件中的数字、文字信息、表格内容等,且能对版面进行分析,输出跟原文档结构高度接近的多种格式的OCR识别结果。
1、OCR的文件文字语言默认中英文和数字;
2、OCR识别结果支持doc/html/xls/ppt/txt版本下载;
3、OCR识别结果均实时下载,多页文档OCR识别结果下载时间为1~2小时
请求参数
此 API 接口支持的参数列表
| 名称 | 类型 | 示例 | 描述 |
|---|---|---|---|
必填 | string | https://static-open.zhihuiya.com/sample/common_demo.png | 需要进行OCR识别的图片或者扫描的PDF等文件 |
必填 | string | png | 需要进行OCR识别的文件的类型,包括:pdf,png,jpg |
必填 | string | doc | 查询OCR识别结果的文件格式doc/html/xls/ppt/txt |
| array | [
"简体中文",
"数字",
"英语"
] | 需要进行OCR识别的文件中文字的语言,可支持多选,例如:
简体中文
英语
日语
数字
俄语
乌克兰语
乌兹别克语(拉丁)
繁体中文
荷兰语
西班牙语
阿拉伯语(沙特阿拉伯)
韩国语(韩文字母)
印度尼西亚语
意大利语
德语
瑞典语
希腊语
......
注:默认为“简体中文;数字;英语” |
响应结构
API 响应数据的结构说明
| 字段名 | 类型 | 示例 | 描述 |
|---|---|---|---|
data | object | - | 响应数据 |
job_id | string | b4bdae6b4a65432d91f25b5c52bdfd80 | 导出OCR识别结果任务id |
status必填 | boolean | false | 状态 |
error_msg | string | The request parameter format is incorrect! | 错误信息 |
error_code必填 | integer | 0 | 错误代码 |
成功响应示例
成功调用 API 的响应示例
JSON
{
"data": {
"job_id": "b4bdae6b4a65432d91f25b5c52bdfd80"
},
"status": true,
"error_code": 0
}错误码
此接口可能返回的错误码列表
业务错误码
| 错误码 | 描述 |
|---|---|
68300004 | 请求参数异常! |
68300005 | 查询Api失败! |
68300006 | 解析基本存取错误! |
68300007 | 存在错误的请求! |
68300008 | 服务中断异常,请稍后再试! |
68300010 | 文件不符合上传规范! |
平台错误码
| 错误码 | 描述 |
|---|---|
67200000 | API整体限流错误! |
67200001 | API整体限流错误! |
67200002 | 当前调用速率过快,超过当前配置限制QPS! |
67200003 | 申请token的key和secret传参不正确或者客户端已被禁用! |
67200004 | 请求的接口无权限请联系我们的支持人员! |
67200005 | 账户余额/调用次数不足! |
67200006 | 客户端超过开通有效期! |
67200007 | 当前调用超过当天配置使用额度! |
67200008 | 请检查query参数中必填的apikey是否传输! |
67200009 | apikey与所传的bearerToken不匹配,请检查是否使用在有效期内的token! |
67200012 | 请求不合法! |
67200100 | 当前服务器状态正忙,请求响应超时! |
67200101 | 当前请求的Api不存在请检查请求Path! |
HTTP 状态码
| 状态码 | 描述 |
|---|---|
0 | 请求成功 |
201 | Created |
401 | Unauthorized |
403 | Forbidden |
404 | Not Found |
性能指标
此接口的预期性能特征
正常响应时间
5000 ms
最大响应时间
10000 ms