DEVELOPER API REFERENCE

MarkifyDoc 开发者接口文档

基于标准化 RESTful 协议与 Webhook 事件驱动架构,专为大模型知识库 (RAG)、批量文档清洗与金融研报自动化系统打造。

文档目录导航

概览与基础规范

MarkifyDoc 提供了与现代云原生生态紧密集成的 RESTful 接口。通过 API,您可以实现百页研报与学术论文的秒级结构化提取,输出干净的 Markdown、KaTeX 公式及切片图表。

Base URLhttps://api.markifydoc.com
数据交换格式application/json
传输协议HTTPS (TLS 1.3 强制加密传输)

身份认证与 API Key

所有向 /api/v1/* 发起的开发者请求必须在 HTTP Header 中携带 Bearer API Key。您可以在控制台中免费生成并管理专属密钥。

请求头规范
Authorization: Bearer mkd_xxxxxxxxxxxxxxxxxxxxxxxx
安全保管提示

API Key 拥有您账户下钱包点数的全部调用权限。请将其保存在服务端环境变量(如 .env)中,严禁暴露在客户端前端代码或公开 GitHub 仓库。

调用速率与队列优先级

系统根据您的账户等级实施自适应速率限制(Rate Limiting)与 GPU 调度队列优先级管控:

账户等级每分钟请求限制 (RPM)最大并发解析数GPU 算力队列优先级
免费体验用户 (Free)10 RPM1 任务Normal 队列 (云端算力)
按量加油包用户 (PAYG)60 RPM3 任务Normal 队列 (免冷启动)
Pro 会员 / API 专属300 RPM10+ 任务High 极速优先级 (自建 GPU 集群)

核心解析工作流

为保障超长文档与大体积 PDF 的传输稳定性,MarkifyDoc 采用直传与异步调度模式:

1. 申请临时上传凭证

客户端向 /api/v1/upload-url 提交文件名与大小,获得专属的 S3/R2 预签名直传链接及 task_id。

2. 客户端直接上传源文件

客户端使用 PUT 方法直接将 PDF 二进制数据流上传至对象存储,不消耗应用网关出口带宽。

3. 触发多模态解析任务

调用 /api/v1/parse 提交解析,冻结对应页数点数,指定可选的 callback_url 回调地址。

4. 异步获取结果或接收 Webhook

通过 GET /api/v1/tasks/{id} 轮询进度,或者等待系统通过 Webhook 主动下发包含 Markdown 与 ZIP 下载地址的通知。

API REFERENCE

REST API 核心端点规范

POST/api/v1/upload-url

为待解析的 PDF 文档申请一个有时效性的安全直传 URL(有效期 15 分钟)。

请求体 Body
字段名称类型必填说明
filenamestring必填
待上传的 PDF 文件全名(例如 nature_paper.pdf,必须以 .pdf 结尾)
file_sizeinteger选填
文件字节大小,用于阶梯前置容量校验(最大限制 50MB)
获取直传预签名 URL 示例
curl -X POST https://api.markifydoc.com/api/v1/upload-url \
  -H "Authorization: Bearer mkd_live_xxxxxxxxxxxxxxxxxxxxxxxx" \
  -H "Content-Type: application/json" \
  -d '{
    "filename": "quantum_physics_paper.pdf",
    "file_size": 3145728
  }'
客户端直接上传源文件(PUT 请求)
PUT 直传文件
# 客户端使用 PUT 方法直接上传原始 PDF 二进制流
curl -X PUT "<upload_url>" \
  -H "Content-Type: application/pdf" \
  --data-binary "@./quantum_physics_paper.pdf"
POST/api/v1/parse

将直传完成的 PDF 提交至 AI 视觉多模态集群执行深度解析与结构化抽取。

请求体 Body
字段名称类型必填说明
r2_source_keystring必填
第一步获取到的 R2 存储路径(例如 uploads/task_uuid/source.pdf)
original_filenamestring必填
文档原始名称
pages_estimatedinteger必填
预估解析页数,用于预扣点数校验(1 点/页,多扣失败页自动退还)
默认值: 1
callback_urlstring选填
解析完毕后的 Webhook 异步回调地址
optionsobject选填
解析可选配置:enable_formula (默认 true), enable_table (默认 true)
提交多模态解析任务
curl -X POST https://api.markifydoc.com/api/v1/parse \
  -H "Authorization: Bearer mkd_live_xxxxxxxxxxxxxxxxxxxxxxxx" \
  -H "Content-Type: application/json" \
  -d '{
    "r2_source_key": "uploads/0c1d2e3f-4567/source.pdf",
    "original_filename": "quantum_physics_paper.pdf",
    "pages_estimated": 12,
    "callback_url": "https://api.yourdomain.com/webhook/pdf-parsed",
    "options": {
      "enable_formula": true,
      "enable_table": true
    }
  }'
GET/api/v1/tasks/{task_id}

获取指定任务的实时状态、页数统计、失败明细、点数结算信息及临时下载链接。

路径参数 Path Params
字段名称类型必填说明
task_idstring (UUID)必填
提交任务时系统生成的唯一任务标识
查询单个任务状态与产物
curl -X GET https://api.markifydoc.com/api/v1/tasks/0c1d2e3f-4567 \
  -H "Authorization: Bearer mkd_live_xxxxxxxxxxxxxxxxxxxxxxxx"
GET/api/v1/tasks

获取当前账户名下提交的所有解析任务列表,支持状态过滤与分页。

查询参数 Query Params
字段名称类型必填说明
pageinteger选填
页码编号
默认值: 1
page_sizeinteger选填
每页任务数量(最大 100)
默认值: 20
statusstring选填
按状态过滤:QUEUED, PROCESSING, SUCCESS, PARTIAL_SUCCESS, FAILED
分页获取历史任务
curl -X GET "https://api.markifydoc.com/api/v1/tasks?page=1&page_size=10&status=SUCCESS" \
  -H "Authorization: Bearer mkd_live_xxxxxxxxxxxxxxxxxxxxxxxx"
POST/api/v1/tasks/{task_id}/retry

对状态为 FAILED 或 PARTIAL_SUCCESS 的任务重新发起调度解析,无需重新上传源文件。

路径参数 Path Params
字段名称类型必填说明
task_idstring (UUID)必填
需重试的目标任务 ID
重试失败任务
curl -X POST https://api.markifydoc.com/api/v1/tasks/0c1d2e3f-4567/retry \
  -H "Authorization: Bearer mkd_live_xxxxxxxxxxxxxxxxxxxxxxxx"

Webhook 异步回调机制

通过在提交任务时配置 callback_url,可在任务处理结束的第一时间收到标准 HTTP POST 广播,免去客户端轮询开销。

触发条件

当任务状态转变为 SUCCESS(全部解析成功)、PARTIAL_SUCCESS(部分页解析成功)或 FAILED(解析失败)时,系统自动触发推送。

Webhook HTTP POST JSON Payload
{
  "event": "document.parsed",
  "task_id": "0c1d2e3f-4567",
  "status": "SUCCESS",
  "timestamp": 1788100875,
  "data": {
    "markdown": "https://r2.markifydoc.com/artifacts/0c1d2e3f-4567/output.md?expires=...",
    "zip": "https://r2.markifydoc.com/artifacts/0c1d2e3f-4567/bundle.zip?expires=...",
    "docx": "https://r2.markifydoc.com/artifacts/0c1d2e3f-4567/output.docx?expires=...",
    "latex": "https://r2.markifydoc.com/artifacts/0c1d2e3f-4567/latex_bundle.zip?expires=..."
  }
}

高可用重试策略

若您的接收端返回非 2xx 响应或超时,系统将以指数退避策略自动重试最多 3 次(间隔分别为 5 秒、30 秒和 300 秒)。

RAG 知识库批量清洗最佳实践

将 MarkifyDoc 与 LangChain、LlamaIndex 或自定义 ETL 脚本集成,实现全自动的学术论文与企业研报向量化入库流水线。

Python 端到端 RAG 批量解析流水线脚本
import os
import time
import requests

MARKIFY_API_KEY = os.getenv("MARKIFY_API_KEY", "mkd_live_xxxxxx")
BASE_URL = "https://api.markifydoc.com/api/v1"
HEADERS = {"Authorization": f"Bearer {MARKIFY_API_KEY}"}

def parse_and_ingest_pdf(file_path: str):
    file_size = os.path.getsize(file_path)
    file_name = os.path.basename(file_path)

    # 1. 申请 S3/R2 直传临时链接
    presign_res = requests.post(
        f"{BASE_URL}/upload-url",
        headers={**HEADERS, "Content-Type": "application/json"},
        json={"filename": file_name, "file_size": file_size}
    ).json()["data"]

    # 2. 客户端直接流式上传
    with open(file_path, "rb") as f:
        requests.put(presign_res["upload_url"], data=f, headers={"Content-Type": "application/pdf"})

    # 3. 提交多模态视觉解析任务
    task_res = requests.post(
        f"{BASE_URL}/parse",
        headers={**HEADERS, "Content-Type": "application/json"},
        json={
            "r2_source_key": presign_res["r2_source_key"],
            "original_filename": file_name,
            "pages_estimated": 10,
        }
    ).json()["data"]
    task_id = task_res["task_id"]

    # 4. 轮询状态(或由 Webhook 异步唤醒)
    while True:
        status_res = requests.get(f"{BASE_URL}/tasks/{task_id}", headers=HEADERS).json()["data"]
        status = status_res["status"]
        if status == "SUCCESS":
            md_url = status_res["download_urls"]["markdown"]
            raw_markdown = requests.get(md_url).text
            print(f"Parsed {len(raw_markdown)} characters of Markdown with KaTeX formulas.")
            return raw_markdown
        elif status == "FAILED":
            raise RuntimeError(f"Parse failed: {status_res.get('failed_pages_detail')}")
        time.sleep(3)

if __name__ == "__main__":
    markdown = parse_and_ingest_pdf("./nature_paper.pdf")
    # 下游直接对接 LangChain / LlamaIndex:
    # chunks = RecursiveCharacterTextSplitter().split_text(markdown)
    # vectorstore.add_texts(chunks)

状态码与错误排查指南

所有响应均遵循统一定义的 code 编码体系。非 0 状态码代表请求未完成,包含可读的 message 描述。

Code 码HTTP 状态含义说明推荐排查方案
0200 OK成功完成请求执行成功,数据已下发
40001400 Bad Request缺少关键入参检查请求体中是否遗漏 r2_source_key 或 filename
40002400 Bad Request文件格式不支持仅支持 PDF 格式文档解析,检查文件扩展名
40003400 Bad Request文件体积超限单文件上限 50MB,超过需先进行切分压缩
40101401 UnauthorizedAPI Key 无效或已停用检查请求头 Authorization: Bearer mkd_... 是否正确或在控制台中被禁用
40301403 Forbidden账户点数余额不足前往工作台充值加油包或订阅 Pro 会员
40304403 Forbidden超出游客解析页数限制注册账号即可立领 50 点完整解析额度
40401404 Not Found任务不存在确认传入的 task_id 是否有效,任务满 24 小时后会被自动物理擦除
42901429 Too Many Requests请求频次超限触发每分钟调用上限 (RPM),按 Retry-After 标头等待后重试
50000500 Internal Error服务端内部异常服务器处理遇到临时问题,若已扣点会自动全额退还