DEVELOPER API REFERENCE

MarkifyDoc 開發者介面文檔

基於標準化 RESTful 協定與 Webhook 事件驅動架構,專為大模型知識庫 (RAG)、批量文檔清洗與金融研報自動化系統打造。

文档目录导航

概覽與基礎規範

MarkifyDoc 提供了與現代雲原生生態緊密集成的 RESTful 介面。透過 API,您可實現百頁研報與學術論文的秒級結構化提取,輸出乾淨的 Markdown、KaTeX 公式及切片圖表。

Base URLhttps://api.markifydoc.com
資料交換格式application/json
傳輸協定HTTPS (TLS 1.3 強制加密傳輸)

身份認證與 API Key

所有向 /api/v1/* 發起的開發者請求必須在 HTTP Header 中攜帶 Bearer API Key。您可以在控制台中免費生成並管理專屬密鑰。

請求頭規範
Authorization: Bearer mkd_xxxxxxxxxxxxxxxxxxxxxxxx
安全保管提示

API Key 擁有您帳戶下錢包點數的全部調用權限。請將其保存在伺服器端環境變數(如 .env)中,嚴禁暴露在客戶端前端程式碼或公開 GitHub 倉庫。

調用速率與隊列優先級

系統根據您的帳戶等級實施自適應速率限制(Rate Limiting)與 GPU 調度隊列優先級管控:

帳戶等級每分鐘請求限制 (RPM)最大併發解析數GPU 算力隊列優先級
免費體驗用戶 (Free)10 RPM1 任務Normal 隊列 (雲端算力)
按量加油包用戶 (PAYG)60 RPM3 任務Normal 隊列 (免冷啟動)
Pro 會員 / API 專屬300 RPM10+ 任務High 極速優先級 (自建 GPU 集群)

核心解析工作流

為保障超長文檔與大體積 PDF 的傳輸穩定性,MarkifyDoc 採用直傳與非同步調度模式:

1. 申請臨時上傳憑證

客戶端向 /api/v1/upload-url 提交檔名與大小,獲得專屬的 S3/R2 預簽名直傳連結及 task_id。

2. 客戶端直接上傳源文件

客戶端使用 PUT 方法直接將 PDF 二進制數據流上傳至對象儲存,不消耗應用網關出口頻寬。

3. 觸發多模態解析任務

調用 /api/v1/parse 提交解析,凍結對應頁數點數,指定可選的 callback_url 回調地址。

4. 非同步獲取結果或接收 Webhook

透過 GET /api/v1/tasks/{id} 輪詢進度,或者等待系統透過 Webhook 主動下發包含 Markdown 與 ZIP 下載地址的通知。

API REFERENCE

REST API 核心端点规范

POST/api/v1/upload-url

為待解析的 PDF 文檔申請一個有時效性的安全直傳 URL(有效期 15 分鐘)。

請求體 Body
欄位名稱型別必填說明
filenamestring必填
待上传的 PDF 文件全名(例如 nature_paper.pdf,必须以 .pdf 结尾)
file_sizeinteger選填
文件字节大小,用于阶梯前置容量校验(最大限制 50MB)
获取直传预签名 URL 示例
curl -X POST https://api.markifydoc.com/api/v1/upload-url \
  -H "Authorization: Bearer mkd_live_xxxxxxxxxxxxxxxxxxxxxxxx" \
  -H "Content-Type: application/json" \
  -d '{
    "filename": "quantum_physics_paper.pdf",
    "file_size": 3145728
  }'
客户端直接上传源文件(PUT 请求)
PUT 直传文件
# 客户端使用 PUT 方法直接上传原始 PDF 二进制流
curl -X PUT "<upload_url>" \
  -H "Content-Type: application/pdf" \
  --data-binary "@./quantum_physics_paper.pdf"
POST/api/v1/parse

將直傳完成的 PDF 提交至 AI 視覺多模態集群執行深度解析與結構化抽取。

請求體 Body
欄位名稱型別必填說明
r2_source_keystring必填
第一步获取到的 R2 存储路径(例如 uploads/task_uuid/source.pdf)
original_filenamestring必填
文档原始名称
pages_estimatedinteger必填
预估解析页数,用于预扣点数校验(1 点/页,多扣失败页自动退还)
默认值: 1
callback_urlstring選填
解析完毕后的 Webhook 异步回调地址
optionsobject選填
解析可选配置:enable_formula (默认 true), enable_table (默认 true)
提交多模态解析任务
curl -X POST https://api.markifydoc.com/api/v1/parse \
  -H "Authorization: Bearer mkd_live_xxxxxxxxxxxxxxxxxxxxxxxx" \
  -H "Content-Type: application/json" \
  -d '{
    "r2_source_key": "uploads/0c1d2e3f-4567/source.pdf",
    "original_filename": "quantum_physics_paper.pdf",
    "pages_estimated": 12,
    "callback_url": "https://api.yourdomain.com/webhook/pdf-parsed",
    "options": {
      "enable_formula": true,
      "enable_table": true
    }
  }'
GET/api/v1/tasks/{task_id}

獲取指定任務的即時狀態、頁數統計、失敗明細、點數結算資訊及臨時下載連結。

路徑參數 Path Params
欄位名稱型別必填說明
task_idstring (UUID)必填
提交任务时系统生成的唯一任务标识
查询单个任务状态与产物
curl -X GET https://api.markifydoc.com/api/v1/tasks/0c1d2e3f-4567 \
  -H "Authorization: Bearer mkd_live_xxxxxxxxxxxxxxxxxxxxxxxx"
GET/api/v1/tasks

獲取當前帳戶名下提交的所有解析任務列表,支援狀態過濾與分頁。

查詢參數 Query Params
欄位名稱型別必填說明
pageinteger選填
页码编号
默认值: 1
page_sizeinteger選填
每页任务数量(最大 100)
默认值: 20
statusstring選填
按状态过滤:QUEUED, PROCESSING, SUCCESS, PARTIAL_SUCCESS, FAILED
分页获取历史任务
curl -X GET "https://api.markifydoc.com/api/v1/tasks?page=1&page_size=10&status=SUCCESS" \
  -H "Authorization: Bearer mkd_live_xxxxxxxxxxxxxxxxxxxxxxxx"
POST/api/v1/tasks/{task_id}/retry

對狀態為 FAILED 或 PARTIAL_SUCCESS 的任務重新發起調度解析,無需重新上傳源文件。

路徑參數 Path Params
欄位名稱型別必填說明
task_idstring (UUID)必填
需重试的目标任务 ID
重试失败任务
curl -X POST https://api.markifydoc.com/api/v1/tasks/0c1d2e3f-4567/retry \
  -H "Authorization: Bearer mkd_live_xxxxxxxxxxxxxxxxxxxxxxxx"

Webhook 非同步回調機制

透過在提交任務時配置 callback_url,可在任務處理結束的第一時間收到標準 HTTP POST 廣播,免去客戶端輪詢開銷。

觸發條件

當任務狀態轉變為 SUCCESS、PARTIAL_SUCCESS 或 FAILED 時,系統自動觸發推送。

Webhook HTTP POST JSON Payload
{
  "event": "document.parsed",
  "task_id": "0c1d2e3f-4567",
  "status": "SUCCESS",
  "timestamp": 1788100875,
  "data": {
    "markdown": "https://r2.markifydoc.com/artifacts/0c1d2e3f-4567/output.md?expires=...",
    "zip": "https://r2.markifydoc.com/artifacts/0c1d2e3f-4567/bundle.zip?expires=...",
    "docx": "https://r2.markifydoc.com/artifacts/0c1d2e3f-4567/output.docx?expires=...",
    "latex": "https://r2.markifydoc.com/artifacts/0c1d2e3f-4567/latex_bundle.zip?expires=..."
  }
}

高可用重試策略

若您的接收端返回非 2xx 回應或超時,系統將以指數退避策略自動重試最多 3 次(間隔分別為 5 秒、30 秒和 300 秒)。

RAG 知識庫批量清洗最佳實踐

將 MarkifyDoc 與 LangChain、LlamaIndex 或自定義 ETL 腳本整合,實現全自動的學術論文與企業研報向量化入庫管道。

Python 端到端 RAG 批量解析流水线脚本
import os
import time
import requests

MARKIFY_API_KEY = os.getenv("MARKIFY_API_KEY", "mkd_live_xxxxxx")
BASE_URL = "https://api.markifydoc.com/api/v1"
HEADERS = {"Authorization": f"Bearer {MARKIFY_API_KEY}"}

def parse_and_ingest_pdf(file_path: str):
    file_size = os.path.getsize(file_path)
    file_name = os.path.basename(file_path)

    # 1. 申请 S3/R2 直传临时链接
    presign_res = requests.post(
        f"{BASE_URL}/upload-url",
        headers={**HEADERS, "Content-Type": "application/json"},
        json={"filename": file_name, "file_size": file_size}
    ).json()["data"]

    # 2. 客户端直接流式上传
    with open(file_path, "rb") as f:
        requests.put(presign_res["upload_url"], data=f, headers={"Content-Type": "application/pdf"})

    # 3. 提交多模态视觉解析任务
    task_res = requests.post(
        f"{BASE_URL}/parse",
        headers={**HEADERS, "Content-Type": "application/json"},
        json={
            "r2_source_key": presign_res["r2_source_key"],
            "original_filename": file_name,
            "pages_estimated": 10,
        }
    ).json()["data"]
    task_id = task_res["task_id"]

    # 4. 轮询状态(或由 Webhook 异步唤醒)
    while True:
        status_res = requests.get(f"{BASE_URL}/tasks/{task_id}", headers=HEADERS).json()["data"]
        status = status_res["status"]
        if status == "SUCCESS":
            md_url = status_res["download_urls"]["markdown"]
            raw_markdown = requests.get(md_url).text
            print(f"Parsed {len(raw_markdown)} characters of Markdown with KaTeX formulas.")
            return raw_markdown
        elif status == "FAILED":
            raise RuntimeError(f"Parse failed: {status_res.get('failed_pages_detail')}")
        time.sleep(3)

if __name__ == "__main__":
    markdown = parse_and_ingest_pdf("./nature_paper.pdf")
    # 下游直接对接 LangChain / LlamaIndex:
    # chunks = RecursiveCharacterTextSplitter().split_text(markdown)
    # vectorstore.add_texts(chunks)

狀態碼與錯誤排查指南

所有回應均遵循統一定義的 code 編碼體系。非 0 狀態碼代表請求未完成,包含可讀的 message 描述。

Code 碼HTTP 狀態含義說明推薦排查方案
0200 OK成功完成请求执行成功,数据已下发
40001400 Bad Request缺少关键入参检查请求体中是否遗漏 r2_source_key 或 filename
40002400 Bad Request文件格式不支持仅支持 PDF 格式文档解析,检查文件扩展名
40003400 Bad Request文件体积超限单文件上限 50MB,超过需先进行切分压缩
40101401 UnauthorizedAPI Key 无效或已停用检查请求头 Authorization: Bearer mkd_... 是否正确或在控制台中被禁用
40301403 Forbidden账户点数余额不足前往工作台充值加油包或订阅 Pro 会员
40304403 Forbidden超出游客解析页数限制注册账号即可立领 50 点完整解析额度
40401404 Not Found任务不存在确认传入的 task_id 是否有效,任务满 24 小时后会被自动物理擦除
42901429 Too Many Requests请求频次超限触发每分钟调用上限 (RPM),按 Retry-After 标头等待后重试
50000500 Internal Error服务端内部异常服务器处理遇到临时问题,若已扣点会自动全额退还