MarkifyDoc 开发者接口文档
基于标准化 RESTful 协议与 Webhook 事件驱动架构,专为大模型知识库 (RAG)、批量文档清洗与金融研报自动化系统打造。
概览与基础规范
MarkifyDoc 提供了与现代云原生生态紧密集成的 RESTful 接口。通过 API,您可以实现百页研报与学术论文的秒级结构化提取,输出干净的 Markdown、KaTeX 公式及切片图表。
https://api.markifydoc.com身份认证与 API Key
所有向 /api/v1/* 发起的开发者请求必须在 HTTP Header 中携带 Bearer API Key。您可以在控制台中免费生成并管理专属密钥。
Authorization: Bearer mkd_xxxxxxxxxxxxxxxxxxxxxxxx
API Key 拥有您账户下钱包点数的全部调用权限。请将其保存在服务端环境变量(如 .env)中,严禁暴露在客户端前端代码或公开 GitHub 仓库。
调用速率与队列优先级
系统根据您的账户等级实施自适应速率限制(Rate Limiting)与 GPU 调度队列优先级管控:
| 账户等级 | 每分钟请求限制 (RPM) | 最大并发解析数 | GPU 算力队列优先级 |
|---|---|---|---|
| 免费体验用户 (Free) | 10 RPM | 1 任务 | Normal 队列 (云端算力) |
| 按量加油包用户 (PAYG) | 60 RPM | 3 任务 | Normal 队列 (免冷启动) |
| Pro 会员 / API 专属 | 300 RPM | 10+ 任务 | High 极速优先级 (自建 GPU 集群) |
核心解析工作流
为保障超长文档与大体积 PDF 的传输稳定性,MarkifyDoc 采用直传与异步调度模式:
1. 申请临时上传凭证
客户端向 /api/v1/upload-url 提交文件名与大小,获得专属的 S3/R2 预签名直传链接及 task_id。
2. 客户端直接上传源文件
客户端使用 PUT 方法直接将 PDF 二进制数据流上传至对象存储,不消耗应用网关出口带宽。
3. 触发多模态解析任务
调用 /api/v1/parse 提交解析,冻结对应页数点数,指定可选的 callback_url 回调地址。
4. 异步获取结果或接收 Webhook
通过 GET /api/v1/tasks/{id} 轮询进度,或者等待系统通过 Webhook 主动下发包含 Markdown 与 ZIP 下载地址的通知。
REST API 核心端点规范
/api/v1/upload-url为待解析的 PDF 文档申请一个有时效性的安全直传 URL(有效期 15 分钟)。
请求体 Body
| 字段名称 | 类型 | 必填 | 说明 |
|---|---|---|---|
| filename | string | 必填 | 待上传的 PDF 文件全名(例如 nature_paper.pdf,必须以 .pdf 结尾) |
| file_size | integer | 选填 | 文件字节大小,用于阶梯前置容量校验(最大限制 50MB) |
curl -X POST https://api.markifydoc.com/api/v1/upload-url \
-H "Authorization: Bearer mkd_live_xxxxxxxxxxxxxxxxxxxxxxxx" \
-H "Content-Type: application/json" \
-d '{
"filename": "quantum_physics_paper.pdf",
"file_size": 3145728
}'客户端直接上传源文件(PUT 请求)
# 客户端使用 PUT 方法直接上传原始 PDF 二进制流 curl -X PUT "<upload_url>" \ -H "Content-Type: application/pdf" \ --data-binary "@./quantum_physics_paper.pdf"
/api/v1/parse将直传完成的 PDF 提交至 AI 视觉多模态集群执行深度解析与结构化抽取。
请求体 Body
| 字段名称 | 类型 | 必填 | 说明 |
|---|---|---|---|
| r2_source_key | string | 必填 | 第一步获取到的 R2 存储路径(例如 uploads/task_uuid/source.pdf) |
| original_filename | string | 必填 | 文档原始名称 |
| pages_estimated | integer | 必填 | 预估解析页数,用于预扣点数校验(1 点/页,多扣失败页自动退还) 默认值: 1 |
| callback_url | string | 选填 | 解析完毕后的 Webhook 异步回调地址 |
| options | object | 选填 | 解析可选配置:enable_formula (默认 true), enable_table (默认 true) |
curl -X POST https://api.markifydoc.com/api/v1/parse \
-H "Authorization: Bearer mkd_live_xxxxxxxxxxxxxxxxxxxxxxxx" \
-H "Content-Type: application/json" \
-d '{
"r2_source_key": "uploads/0c1d2e3f-4567/source.pdf",
"original_filename": "quantum_physics_paper.pdf",
"pages_estimated": 12,
"callback_url": "https://api.yourdomain.com/webhook/pdf-parsed",
"options": {
"enable_formula": true,
"enable_table": true
}
}'/api/v1/tasks/{task_id}获取指定任务的实时状态、页数统计、失败明细、点数结算信息及临时下载链接。
路径参数 Path Params
| 字段名称 | 类型 | 必填 | 说明 |
|---|---|---|---|
| task_id | string (UUID) | 必填 | 提交任务时系统生成的唯一任务标识 |
curl -X GET https://api.markifydoc.com/api/v1/tasks/0c1d2e3f-4567 \ -H "Authorization: Bearer mkd_live_xxxxxxxxxxxxxxxxxxxxxxxx"
/api/v1/tasks获取当前账户名下提交的所有解析任务列表,支持状态过滤与分页。
查询参数 Query Params
| 字段名称 | 类型 | 必填 | 说明 |
|---|---|---|---|
| page | integer | 选填 | 页码编号 默认值: 1 |
| page_size | integer | 选填 | 每页任务数量(最大 100) 默认值: 20 |
| status | string | 选填 | 按状态过滤:QUEUED, PROCESSING, SUCCESS, PARTIAL_SUCCESS, FAILED |
curl -X GET "https://api.markifydoc.com/api/v1/tasks?page=1&page_size=10&status=SUCCESS" \ -H "Authorization: Bearer mkd_live_xxxxxxxxxxxxxxxxxxxxxxxx"
/api/v1/tasks/{task_id}/retry对状态为 FAILED 或 PARTIAL_SUCCESS 的任务重新发起调度解析,无需重新上传源文件。
路径参数 Path Params
| 字段名称 | 类型 | 必填 | 说明 |
|---|---|---|---|
| task_id | string (UUID) | 必填 | 需重试的目标任务 ID |
curl -X POST https://api.markifydoc.com/api/v1/tasks/0c1d2e3f-4567/retry \ -H "Authorization: Bearer mkd_live_xxxxxxxxxxxxxxxxxxxxxxxx"
Webhook 异步回调机制
通过在提交任务时配置 callback_url,可在任务处理结束的第一时间收到标准 HTTP POST 广播,免去客户端轮询开销。
触发条件
当任务状态转变为 SUCCESS(全部解析成功)、PARTIAL_SUCCESS(部分页解析成功)或 FAILED(解析失败)时,系统自动触发推送。
{
"event": "document.parsed",
"task_id": "0c1d2e3f-4567",
"status": "SUCCESS",
"timestamp": 1788100875,
"data": {
"markdown": "https://r2.markifydoc.com/artifacts/0c1d2e3f-4567/output.md?expires=...",
"zip": "https://r2.markifydoc.com/artifacts/0c1d2e3f-4567/bundle.zip?expires=...",
"docx": "https://r2.markifydoc.com/artifacts/0c1d2e3f-4567/output.docx?expires=...",
"latex": "https://r2.markifydoc.com/artifacts/0c1d2e3f-4567/latex_bundle.zip?expires=..."
}
}高可用重试策略
若您的接收端返回非 2xx 响应或超时,系统将以指数退避策略自动重试最多 3 次(间隔分别为 5 秒、30 秒和 300 秒)。
RAG 知识库批量清洗最佳实践
将 MarkifyDoc 与 LangChain、LlamaIndex 或自定义 ETL 脚本集成,实现全自动的学术论文与企业研报向量化入库流水线。
import os
import time
import requests
MARKIFY_API_KEY = os.getenv("MARKIFY_API_KEY", "mkd_live_xxxxxx")
BASE_URL = "https://api.markifydoc.com/api/v1"
HEADERS = {"Authorization": f"Bearer {MARKIFY_API_KEY}"}
def parse_and_ingest_pdf(file_path: str):
file_size = os.path.getsize(file_path)
file_name = os.path.basename(file_path)
# 1. 申请 S3/R2 直传临时链接
presign_res = requests.post(
f"{BASE_URL}/upload-url",
headers={**HEADERS, "Content-Type": "application/json"},
json={"filename": file_name, "file_size": file_size}
).json()["data"]
# 2. 客户端直接流式上传
with open(file_path, "rb") as f:
requests.put(presign_res["upload_url"], data=f, headers={"Content-Type": "application/pdf"})
# 3. 提交多模态视觉解析任务
task_res = requests.post(
f"{BASE_URL}/parse",
headers={**HEADERS, "Content-Type": "application/json"},
json={
"r2_source_key": presign_res["r2_source_key"],
"original_filename": file_name,
"pages_estimated": 10,
}
).json()["data"]
task_id = task_res["task_id"]
# 4. 轮询状态(或由 Webhook 异步唤醒)
while True:
status_res = requests.get(f"{BASE_URL}/tasks/{task_id}", headers=HEADERS).json()["data"]
status = status_res["status"]
if status == "SUCCESS":
md_url = status_res["download_urls"]["markdown"]
raw_markdown = requests.get(md_url).text
print(f"Parsed {len(raw_markdown)} characters of Markdown with KaTeX formulas.")
return raw_markdown
elif status == "FAILED":
raise RuntimeError(f"Parse failed: {status_res.get('failed_pages_detail')}")
time.sleep(3)
if __name__ == "__main__":
markdown = parse_and_ingest_pdf("./nature_paper.pdf")
# 下游直接对接 LangChain / LlamaIndex:
# chunks = RecursiveCharacterTextSplitter().split_text(markdown)
# vectorstore.add_texts(chunks)状态码与错误排查指南
所有响应均遵循统一定义的 code 编码体系。非 0 状态码代表请求未完成,包含可读的 message 描述。
| Code 码 | HTTP 状态 | 含义说明 | 推荐排查方案 |
|---|---|---|---|
| 0 | 200 OK | 成功完成 | 请求执行成功,数据已下发 |
| 40001 | 400 Bad Request | 缺少关键入参 | 检查请求体中是否遗漏 r2_source_key 或 filename |
| 40002 | 400 Bad Request | 文件格式不支持 | 仅支持 PDF 格式文档解析,检查文件扩展名 |
| 40003 | 400 Bad Request | 文件体积超限 | 单文件上限 50MB,超过需先进行切分压缩 |
| 40101 | 401 Unauthorized | API Key 无效或已停用 | 检查请求头 Authorization: Bearer mkd_... 是否正确或在控制台中被禁用 |
| 40301 | 403 Forbidden | 账户点数余额不足 | 前往工作台充值加油包或订阅 Pro 会员 |
| 40304 | 403 Forbidden | 超出游客解析页数限制 | 注册账号即可立领 50 点完整解析额度 |
| 40401 | 404 Not Found | 任务不存在 | 确认传入的 task_id 是否有效,任务满 24 小时后会被自动物理擦除 |
| 42901 | 429 Too Many Requests | 请求频次超限 | 触发每分钟调用上限 (RPM),按 Retry-After 标头等待后重试 |
| 50000 | 500 Internal Error | 服务端内部异常 | 服务器处理遇到临时问题,若已扣点会自动全额退还 |