Skip to content

About

No description, website, or topics provided.

Resources

Stars

4 stars

Watchers

0 watching

Forks

Repository files navigation

UniParser-VL OSS

基于 UniParser-VL 的 PDF 文档解析服务,面向科研文献与专利,支持正文、表格、公式、图示和化学结构。输入完整 PDF,输出 Markdown 和结构化 JSON。

模型权重与模型卡:UniParser/UniParser-VL-OSS。

模型由 vLLM 提供推理服务;文档准备、结果处理和 HTTP API 在 CPU 上运行。两者可以同机或分开部署。

快速开始

使用 Python 3.11,按部署说明下载模型并启动名为 UniParser-VL 的模型服务,然后安装本项目:

python -m venv .venv
source .venv/bin/activate
pip install -c deploy/constraints.txt .
export UNIPARSER_VL_ENDPOINT=http://127.0.0.1:8000/v1
uniparser-vl-oss parse paper.pdf -o output/paper

命令默认处理全部页面,生成 output/paper.md 和 output/paper.json。也可以启动 HTTP 服务:

uniparser-vl-oss serve --port 8080
curl -F file=@paper.pdf http://127.0.0.1:8080/v1/parse

安装与配置见 部署说明,请求参数见 API。

功能

  • 输出具有阅读顺序和相对坐标的内容块。
  • 默认进行页面栅格化、文本层诊断、输出修复、保守去重和页眉页脚处理。
  • 异常页按需重试或使用文本层恢复,并通过页级状态报告失败、不完整和回落结果。
  • 化学识别第二遍、图片裁剪和分子 SVG 分别通过 --chemistry、--images、--draw-molecules 开启,默认关闭。

安装 pip install -c deploy/constraints.txt ".[chem]" 可启用分子规范化和绘图;原始 E-SMILES 输出不依赖该扩展。详见 设计 与 输出格式。

示例与性能

样例清单 包含 13 篇完整科研文献与专利,共 121 页。样例说明 提供生成离线展示与双后端对比的方法。第三方 PDF 需按原始来源条款获取。

单卡 RTX 4090 D 上,典型 PDF 文件的整篇 HTTP 参考吞吐为 15.51 页/分钟。配置、计时范围与复现方法见 性能测量。

开发

pip install -c deploy/constraints.txt ".[dev]"
pytest
ruff check .

许可证与致谢

本项目代码采用 Apache-2.0。模型独立分发,第三方依赖和样例文档保留各自许可,见 NOTICE 与 第三方说明。

UniParser-VL 基于 Infinity-Parser2-Flash 全参数微调,并继承更上游 Qwen3.5 的多模态架构、分词器和处理约定。

About

No description, website, or topics provided.

Resources

Stars

4 stars

Watchers

0 watching

Forks

Releases

Packages

Contributors

Languages