README_CN.md

August 31, 2026 · View on GitHub

Paper2Any Logo

Nexus Office

Paper2Any 的新一代 AI Office 工作台

把目标、文件和约束交给 Agent,在同一个 Workspace 里拿到可编辑的 PPT、Excel、Word 和图片产物。

Online License Stars

中文 | English


打开 Nexus Office 在线工作台

点击上方动图即可进入 Nexus Office。 在线生成和继续编辑 PPTX、XLSX、DOCX 与 AI 图片。

Important

仓库状态:历史开源版快照。 本仓库保留原 Paper2Any 的 Apache 2.0 开源代码,但不再同步新功能和新架构。当前持续开发的产品是基于全新技术栈重做的 Nexus Office,以托管服务形式提供;其完整商业版实现不在本仓库中开源。

一眼看懂:Nexus Office 能做什么

Nexus Office 是 Paper2Any 面向新一代 Office 场景的完整重做。你不需要学习复杂工作流,只要上传现有材料并说清楚目标,Agent 就会继续完成内容理解、文件生成、结构检查、视觉验收和后续修改。

面向 PowerPoint、Excel、Word 和 AI 图片的新版 Nexus Office 首页
新版首页只保留 PowerPoint、Excel、Word 和 AI 图片四个核心入口,打开后即可开始工作。

📊 PowerPoint:从内容到成稿

可以输入:一句话主题、PDF、Word、旧 PPT、内容稿 PPT 和公司模板 PPT。

可以完成:从零生成、长文档转 PPT、内容提炼、模板套版、整套美化、指定页修改、原生图表重建和后续多轮编辑。

最终交付:可在网页中直接打开和继续修改的原生 .pptx,不是一组不可编辑的截图。

📈 Excel:从原始数据到分析看板

可以输入:CSV、Excel、业务明细、跨表数据和自然语言分析要求。

可以完成:数据清洗、字段整理、多表汇总、公式生成、指标计算、趋势分析、排名对比、图表和管理层摘要。

最终交付:保留 Sheet、公式、单元格和图表结构的可编辑 .xlsx。

📝 Word:把零散材料变成正式文档

可以输入:会议记录、口语草稿、多个参考文档、数据表和排版要求。

可以完成:材料合并、内容改写、层级梳理、正式排版、表格整理、行动项提取、执行摘要和规范化归档。

最终交付:结构完整、可在线继续编辑的 .docx。

🎨 AI 图片画布:生成、编辑、抠取和融合

可以输入:文字、参考图、文档、Workspace 文件、Mask 选区和素材箱里的科研素材。

可以完成:文生图、单图编辑、局部重绘、本地智能抠图、透明素材保存、精确引用、多图融合和结果继续迭代。

最终交付:高质量图片、透明 PNG 素材和可持续恢复的画布场景。

精选 Showcase:看输入,也看真实输出

下面全部来自真实端到端任务,不是静态设计稿。每个 Office 文件都经过结构检查、实际渲染,并在网页工作台中真实打开。

Case 01 · 一句话生成整套可编辑 PPT

输入:主题、受众、页数和风格要求。
输出:结构完整、版式各异、可继续编辑的原生 PPTX。

Nexus Office 工作台中打开的可编辑 PowerPoint
6 页可编辑 PPT 已在 Nexus Office 中直接打开。

Case 02 · 内容 PPT 一键套用公司模板

输入:一份内容稿 PPT + 一份模板 PPT。
输出:保留事实与页序、统一品牌视觉的可编辑成稿。

使用创意薄荷模板重建的 6 页可编辑 PPT
6 页、168 个原生对象、154 个文本对象、2 张原生可编辑图表。

Case 03 · 7,585 行数据变成 Excel 看板

输入:公开业务明细 + 指标与分析要求。
输出:4 个联动 Sheet、228 个公式、KPI、趋势图、排名图和洞察摘要。

Nexus Office 中的可编辑 Excel 可再生能源看板
数据、公式、图表和 Sheet 全部保留,可继续分析和修改。

Case 04 · 会议记录变成正式 Word 报告

输入:口语化会议记录和零散业务信息。
输出:结论、指标、议题、负责人、行动项和风险完整归档的 4 页 DOCX。

Nexus Office 生成的四页产品经营周会正式报告
不是简单摘要,而是一份可以直接流转和继续编辑的正式文档。

Case 05 · 浏览器本地智能抠图

输入:画布中的任意图片 + 一个目标点。
输出:自动识别主体边缘并保存为透明 PNG,可继续复用或融合。

Nexus Office 画布中的本地智能抠图
抠图在浏览器本地完成,不消耗图片生成额度。

Case 06 · 多张素材重新融合成一张图

输入:DNA、透明数字地球、显微镜等多个独立素材。
输出:构图、透视、边缘和光照统一的科研主视觉。

Nexus Office 多图融合生成的科研主视觉
在提示词中精确引用画布元素,Agent 知道每一张图分别承担什么作用。

Case 07 · 结果回到原画布,继续修改而不是重新开始

输入:上一次生成结果 + 原始素材 + 新的修改要求。 输出:保留任务历史和源素材的下一版本。

多图融合结果回到 Nexus Office 持久化画布工作区
融合结果会回到原 Workspace,任务历史和源素材仍然保留,可以继续追问和修改。

一个 Workspace,一条连续的 Agent 工作流

目标 + 源文件
        -> Agent 自主选择 Office 和图片工具
        -> 可编辑 PPTX / XLSX / DOCX / PNG
        -> 结构检查和视觉验收
        -> 在同一 Workspace 里打开、修改和继续追问

同一个 Workspace 会保留对话、执行轨迹、源文件、交付物和后续修改。用户不需要先理解每个 Skill 的名字,直接说清楚想要什么即可开始。

Nexus Office 项目文件与个人文件空间
项目文件跟随具体任务保存;模板、参考资料和可复用图片可以长期放在个人文件空间中。

开源仓库与托管版 Nexus Office

本开源仓库Nexus Office
定位原 Paper2Any 论文工作流代码AI Native Office 工作台
范围历史论文、科研绘图、流程图和 PPT 工作流PowerPoint、Excel、Word 和 AI 图片创作/编辑
开发状态历史快照,不再同步新架构和新功能持续开发的托管产品
源码本仓库内的 Apache 2.0 开源代码托管/商业版实现不在此开源
入口继续阅读下方折叠的历史文档打开 Nexus Office

Note

Apache License 2.0 仅适用于本仓库分发的代码和素材,不适用于托管版 Nexus Office 的完整实现。

API 赞助商

ZCloudAPI Logo

ZCloudAPI

感谢 ZCloudAPI 为 Nexus Office 的在线演示与能力评测提供 API 资源赞助。

访问 ZCloudAPI 控制台 ->

Paper2Any 历史开源文档

为了保留可复现性和历史信息,原有部署教程、功能目录、截图、Roadmap 和贡献说明仍完整保留在下方。这些内容描述的是历史开源实现,不是当前的托管版 Nexus Office。

展开完整的 Paper2Any 历史开源文档

📑 目录


🔥 News

Important

🆕 2026-06-13 · Paper to Any Studio / Nexus 新版本升级
线上版本正在升级为全新的 Paper to Any Studio 形态,新增统一 Studio 工作台、个人/项目/团队文件空间、应用实验室、Office 在线预览、Credits 消耗提示和更清晰的长任务体验。
🌐 新版公网入口:https://paper2any-studio.cpolar.cn/
💻 Mac 桌面端下载:Paper2Any-Desktop-Releases · 该公开仓库仅放 DMG 编译产物,商业版源码不在此开源。
⚠️ 该公网入口展示的是托管版 Studio / Nexus 体验,和本开源仓库代码不完全一致;完整商业版 Studio 实现并未在此仓库开源。
📢 完整更新通知:Paper to Any Studio 新版本更新通知

Tip

🆕 2026-05-30 · 可编辑版 PPT 工作流整合
最新的 前端可编辑 PPT 工作流已经整合进 Paper2Any,打通了大纲辅助生成、画布编辑、多页画廊审阅,以及 论文图片 / AI 图片插入 到可编辑 deck 的链路。
基于 HTML 的可编辑 PPTX 导出 与 ONLYOFFICE 在线编辑 仍然作为可选能力保留在主可编辑导出链路之上。

Tip

🆕 2026-04-24 · 生图模型体验页升级
新增独立的 生图模型体验 页面,可直接调用平台托管的 Nano Banana 2 / Nano Banana Pro / Image 2 / Image 2 All。
现在支持图中文字语言控制、模型专属参数、批量生图(1 / 2 / 4 / 8 / 16)、压缩缩略图预览,以及一键打包下载。

Tip

🆕 2026-04-15 · 2026 论文进展
两篇与 Paper2Any 相关的论文已进入 2026 会议信息流:
Paper2SysArch: Structure-Constrained System Architecture Generation from Scientific Papers · CVPR 2026 Findings
SciFlow-Bench: Evaluating Structure-Aware Scientific Diagram Generation via Inverse Parsing · ACL 2026 Main

BibTeX
@article{guo2025paper2sysarch,
  title   = {Paper2SysArch: Structure-Constrained System Architecture Generation from Scientific Papers},
  author  = {Guo, Ziyi and Liu, Zhou and Zhang, Wentao},
  journal = {arXiv preprint arXiv:2511.18036},
  year    = {2025},
  note    = {CVPR 2026 Findings}
}

@article{zhang2026sciflowbench,
  title   = {SciFlow-Bench: Evaluating Structure-Aware Scientific Diagram Generation via Inverse Parsing},
  author  = {Zhang, Tong and Lin, Honglin and Liu, Zhou and Chen, Chong and Zhang, Wentao},
  journal = {arXiv preprint arXiv:2602.09809},
  year    = {2026},
  note    = {ACL 2026 Main}
}

Tip

🆕 2026-03-28 · 可编辑版 PPT 展示更新
新增两张 可编辑版 PPT 工作流展示图:
一张用于展示多页生成后的 deck 总览,一张用于展示带主题锁定与画布编辑的编辑工作区。

往期更新

Tip

🆕 2026-03-26 · 工作流展示更新
新增 Paper2Video、Paper2Poster、Paper2Citation 的展示内容。
README 已补充压缩视频演示,以及中英文两套工作流预览图。

Tip

🆕 2026-02-02 · Paper2Rebuttal 更新
新增反驳意见草拟与修改建议,支持结构化回复与图文要点对齐。

Tip

🆕 2026-01-28 · Drawio 更新
新增 Drawio 支持,用于可视化图示的快速创作与展示输出。
KB 一句话概括:支持多文件 PPT 生成(文档转换/合并 + 图片注入 + 向量检索增强)。

Tip

🆕 2026-01-20 · Bug 修复
修复了实验数据图生成的图片和文本 bug,并解决了历史文件缺失的问题。
🌐 在线体验:https://paper2any-studio.cpolar.cn/

Tip

🆕 2025-12-12 · Paper2Figure 网页端公测上线
支持一键生成多种可编辑科研绘图(模型架构图 / 技术路线图 / 实验数据图)
🌐 在线体验:https://paper2any-studio.cpolar.cn/

  • 2025-10-01 · 发布 0.1.0 首个版本

✨ 核心功能

从论文 PDF / 图片 / 文本出发,一键生成可编辑的科研绘图、演示文稿、视频脚本、学术海报等多模态内容。

Paper2Any 当前包含以下几个子能力:

  • 📊 Paper2Figure - 可编辑科研绘图:模型架构图、技术路线图(PPT + SVG)与实验数据图,输出可编辑 PPTX。
  • 🧩 Paper2Diagram / Image2Drawio - 可编辑流程图:从论文/文本或图片生成 Drawio 图,支持 drawio/png/svg 导出与对话式编辑。
  • 🎬 Paper2PPT - 可编辑演示文稿:论文/文本/主题一键生成,支持超长文档与表格/图表抽取。
  • 📝 Paper2Rebuttal:自动生成结构化反驳草稿与修改建议,辅助审稿意见回复。
  • 🖼️ PDF2PPT - 版式保留转换:精准保留版式的 PDF → 可编辑 PPTX。
  • 🖼️ Image2PPT - 图片转 PPT:将图片或截图快速转换为结构化幻灯片。
  • 🔥 生图模型体验:直接调用后端托管生图模型,支持提示词模板、图中文字语言控制、批量生图、压缩缩略图预览与整批下载。
  • 🎨 PPTPolish 智能美化:基于 AI 的排版优化与风格迁移。
  • 🎬 Paper2Video:生成讲解视频脚本与配音素材。
  • 🖼️ Paper2Poster - 论文转海报:将论文 PDF 自动整理为学术海报,支持版式参数、Logo 注入与导出。
  • 🔎 Paper2Citation - 论文引用追踪:按作者姓名或 DOI / 论文链接追踪引用作者、机构与代表性引用论文。
  • 📚 知识库(KB):文件入库/向量化、语义检索,以及 KB 驱动的 PPT/播客/思维导图生成。

📸 功能展示

🧩 Drawio


✨ 上传论文配图或截图,作为可编辑 DrawIO 的起点

✨ 转换前保留原图结构,便于对照核验

✨ 图片一键转成可编辑 DrawIO 画布


✨ 在 DrawIO 工作台里直接生成模型图 / 系统框架图

✨ 生成后可继续对话式编辑,并导出为展示友好的成品图

📝 Paper2Rebuttal:审稿回复



✨ 审稿回复草拟与修改建议

📊 Paper2Figure: 科研绘图生成



✨ 模型架构图生成

✨ 模型架构图生成




✨ 技术路线图工作台:选择图类型、输入来源、模型配置与模板风格

✨ 生成结果:结构化双栏技术路线图




✨ 实验数据图生成 (多种风格)


🎬 Paper2PPT: 论文转演示文稿


✨ 端到端 PPT 生成演示

✨ 从论文 / 文本 / 主题生成完整演示文稿


✨ 主题锁定下的画布内直接改字与逐页修订

✨ 导出前集中检查多页生成结果


✨ AI 辅助修改入口,支持定向补写与风格调整

✨ 细粒度大纲编辑,可直接调整章节与要点




✨ 超长文档支持(40+ 页) · 智能表格提取与插入 · 历史版本管理与迭代回溯

🎬 Paper2Video:PPT 转视频



✨ PPT / PDF 一键生成讲解视频,支持脚本确认、阿里语音与最终视频导出

🖼️ Paper2Poster:论文转海报



PNG 海报结果

PPT 海报结果

✨ 论文 PDF 自动整理为学术海报,支持版式参数、可编辑海报结果与一键导出

🔎 Paper2Citation:论文引用追踪



✨ 输入作者名或论文 DOI / 链接,查看候选作者、引用线索与机构信息

🎨 PPT 智能美化



✨ 基于 AI 的排版优化

✨ 基于 AI 的排版优化与风格迁移

🖼️ PDF2PPT: 版式保留转换



✨ 智能抠图 & 版式保留

✨ 图片转 PPT

🚀 快速开始

环境要求

Python pip

.env 配置模式

现在有两套配置方式:

  • 粗粒度模式:使用 *.env.simple.example。推荐大多数自部署用户直接用这套。
  • 细粒度模式:使用 *.env.example。只有需要逐个 workflow 覆盖模型和 provider 时再用。

推荐起步:

cp fastapi_app/.env.simple.example fastapi_app/.env
cp frontend-workflow/.env.simple.example frontend-workflow/.env

如果确实需要细粒度覆盖,再改成:

cp fastapi_app/.env.example fastapi_app/.env
cp frontend-workflow/.env.example frontend-workflow/.env
🐳 Docker 快速启动(推荐)— 部署与更新
# 1. 克隆仓库
git clone https://github.com/OpenDCAI/Paper2Any.git
cd Paper2Any

# 2. 配置环境变量
cp fastapi_app/.env.simple.example fastapi_app/.env
cp frontend-workflow/.env.simple.example frontend-workflow/.env
cp deploy/docker.env.example deploy/docker.env

必须修改的配置项:

fastapi_app/.env(后端):

# 内部接口鉴权 key,必须与前端 VITE_API_KEY 一致
BACKEND_API_KEY=your-backend-api-key

# 推荐:由后端统一决定 workflow 使用的模型
APP_BILLING_MODE=free
PAPER2ANY_CONFIG_MODE=simple

# 必填:统一文本入口
SIMPLE_TEXT_API_URL=https://your-text-gateway/v1
SIMPLE_TEXT_API_KEY=your_text_key

# 可选但推荐:统一生图入口
SIMPLE_IMAGE_API_URL=https://your-image-gateway
SIMPLE_IMAGE_API_KEY=your_image_key

# 可选:DrawIO OCR / VLM 服务
SIMPLE_OCR_API_URL=https://dashscope.aliyuncs.com/compatible-mode/v1
SIMPLE_OCR_API_KEY=your_dashscope_key

# 可选:MinerU 官方远端 API
MINERU_API_BASE_URL=https://mineru.net/api/v4
MINERU_API_KEY=your_mineru_api_key

# 可选:给 PDF2PPT / Image2PPT / Image2Drawio 使用的 SAM3 分割服务
# SAM3_SERVER_URLS=http://GPU机器IP:8001
# SAM3_SERVER_URLS=http://GPU1:8021,http://GPU2:8022

# 可选:Supabase(不填则跳过用户认证,核心功能不受影响)
# SUPABASE_URL=https://your-project-id.supabase.co
# SUPABASE_ANON_KEY=your_supabase_anon_key

frontend-workflow/.env(前端):

# 必须与后端 BACKEND_API_KEY 完全一致
VITE_API_KEY=your-backend-api-key

# Docker 下通常保持为空,由 nginx 反代 /api 和 /outputs
VITE_API_BASE_URL=

# 前端只负责展示默认值,不控制后端真实模型
VITE_DEFAULT_LLM_API_URL=https://your-text-gateway/v1
VITE_DEFAULT_LLM_MODEL=gpt-4o

# 可选:Supabase(与后端保持一致)
# VITE_SUPABASE_URL=https://your-project-id.supabase.co
# VITE_SUPABASE_ANON_KEY=your_supabase_anon_key

deploy/docker.env(compose 覆盖项):

BACKEND_PORT=8000
FRONTEND_PORT=3000
DOCKER_APP_WORKERS=1

# 可选:本地 SAM3 容器端口
SAM3_PORT=8021
SAM3_SERVER_URLS=
# 3. 构建并启动
bash deploy/docker-up.sh

访问地址:

可选:启用 ONLYOFFICE 可编辑 PPTX:

Paper2PPT 可以导出基于 HTML 的可编辑 PPTX,并通过 ONLYOFFICE 在线编辑。先启动本地 ONLYOFFICE Document Server:

# 可选:如果部署环境提供了预下载镜像 tar,先导入
docker load -i /path/to/onlyoffice-documentserver-latest.tar

docker run -d --name paper2any-onlyoffice \
  -p 8082:80 \
  --add-host=host.docker.internal:host-gateway \
  -e JWT_ENABLED=false \
  -e ALLOW_PRIVATE_IP_ADDRESS=true \
  onlyoffice/documentserver:latest

然后配置后端环境变量:

ONLYOFFICE_DOCUMENT_SERVER_URL=/onlyoffice
ONLYOFFICE_THINKFLOW_PUBLIC_URL=http://host.docker.internal:8000
ONLYOFFICE_DOCUMENT_DOWNLOAD_BASE_URL=http://host.docker.internal:8000
ONLYOFFICE_SERVER_DOWNLOAD_URL_BASE=http://127.0.0.1:8082
ONLYOFFICE_JWT_SECRET=

本地 Vite 开发时,/onlyoffice 会代理到 http://localhost:8082。如果通过 SSH 端口转发访问前端,需要把 Document Server 的 storage.externalHost 设置成浏览器实际访问的地址,例如 http://localhost:13000/onlyoffice。完整部署、排障和生产注意事项见 ONLYOFFICE 可编辑 PPTX 部署文档。

GPU 服务说明: Docker 默认启动后端 + 前端。

  • Paper2PPT、Paper2Figure、知识库等功能仅依赖 LLM API,Docker 启动后即可使用。
  • PDF2PPT、Image2PPT、Image2Drawio 依赖 SAM3 图像分割。
  • 你可以在 fastapi_app/.env 里配置外部 SAM3_SERVER_URLS=..., 或者直接启用 compose 里的本地 SAM3 profile:
    DOCKER_WITH_SAM3=1 bash deploy/docker-up.sh
    

详见下方「高级配置:本地模型服务负载均衡」部分。

修改与更新:

  • 代码或 .env 变更后重新构建:bash deploy/docker-up.sh
  • 拉取最新代码并重建:
    • git pull
    • bash deploy/docker-up.sh

常用命令:

  • 查看日志:bash deploy/docker-logs.sh
  • 停止服务:bash deploy/docker-down.sh
  • 只构建:bash deploy/docker-build.sh

说明:

  • 首次构建会比较慢(系统依赖 + Python 依赖)。
  • 前端配置在构建期生效,修改 frontend-workflow/.env 或 deploy/docker.env 后需重新 bash deploy/docker-up.sh。
  • 输出和模型目录会挂载到宿主机(./outputs、./models),数据不会丢。

🐧 Linux 安装

建议使用 Conda 创建隔离环境(推荐 Python 3.11)。

1. 创建环境并安装基础依赖

# 0. 创建并激活 conda 环境
conda create -n paper2any python=3.11 -y
conda activate paper2any

# 1. 克隆仓库
git clone https://github.com/OpenDCAI/Paper2Any.git
cd Paper2Any

# 2. 安装基础依赖
pip install -r requirements-base.txt

# 3. 开发模式安装
pip install -e .

2. 安装 Paper2Any 相关依赖(必须)

Paper2Any 涉及 LaTeX 渲染、矢量图处理以及 PPT/PDF 转换,需要额外依赖。

当前依赖边界建议如下:

  • requirements-base.txt:跨平台通用 Python 运行时
  • requirements-paper.txt:论文 / PDF / 科研绘图相关额外 Python 包
  • requirements-cu12.txt:NVIDIA CUDA 12 的 Linux GPU 额外依赖
  • requirements-system-ubuntu.txt:Ubuntu/Debian 系统包,不是 Python 包
# 1. 论文 / PDF / 科研绘图额外 Python 依赖
pip install -r requirements-paper.txt

# 2. NVIDIA GPU 运行时额外依赖(仅 Linux + CUDA 12)
pip install -r requirements-cu12.txt

# 3. LaTeX 引擎 (tectonic) - 推荐用 conda 安装
conda install -c conda-forge tectonic -y

# 4. 解决 doclayout_yolo 依赖冲突(重要)
pip install doclayout_yolo --no-deps

# 5. 系统依赖 (Ubuntu 示例;完整列表见 requirements-system-ubuntu.txt)
sudo apt-get update
sudo apt-get install -y ffmpeg inkscape libreoffice poppler-utils wkhtmltopdf

Important

ffmpeg、libreoffice/soffice、inkscape、poppler-utils、wkhtmltopdf、tectonic 这些都是系统工具,不是 pip 包;deploy/start*.sh 也不会自动安装它们。

3. 配置环境变量

export DF_API_KEY=your_api_key_here
export DF_API_URL=xxx  # 可选:如需使用第三方 API 中转站
export MINERU_DEVICES="0,1,2,3" # 可选:MinerU 任务 GPU 资源池

4. 配置环境文件(可选)

📝 点击展开:详细的 .env 配置指南

Paper2Any 使用两个 .env 文件进行配置。两者都是可选的 - 您可以使用默认设置运行应用程序。

步骤 1:复制示例文件
# 复制后端环境文件
cp fastapi_app/.env.example fastapi_app/.env

# 复制前端环境文件
cp frontend-workflow/.env.example frontend-workflow/.env
步骤 2:后端配置(fastapi_app/.env)

Supabase(可选) - 仅在需要用户认证和云存储时配置:

SUPABASE_URL=https://your-project-id.supabase.co
SUPABASE_ANON_KEY=your_supabase_anon_key

模型配置 - 自定义不同工作流使用的模型:

# 默认 LLM API 地址
DEFAULT_LLM_API_URL=http://123.129.219.111:3000/v1/

# 工作流级别默认值
PAPER2PPT_DEFAULT_MODEL=gpt-5.1
PAPER2PPT_DEFAULT_IMAGE_MODEL=gemini-3-pro-image-preview
PDF2PPT_DEFAULT_MODEL=gpt-4o
# ... 完整列表请查看 .env.example

服务集成配置 - 图片/PDF 工作流相关的模型服务:

# DrawIO OCR / VLM
PAPER2DRAWIO_OCR_API_URL=https://dashscope.aliyuncs.com/compatible-mode/v1
PAPER2DRAWIO_OCR_API_KEY=your_dashscope_key

# MinerU 官方远端 API;若 MINERU_API_KEY 为空,后端会回退到本地 MINERU_PORT
MINERU_API_BASE_URL=https://mineru.net/api/v4
MINERU_API_KEY=your_mineru_api_key
MINERU_API_MODEL_VERSION=vlm

# SAM3 分割服务,供 PDF2PPT / Image2PPT / Image2Drawio 使用
# 单个端点:
SAM3_SERVER_URLS=http://127.0.0.1:8001
# 或多个端点做负载均衡:
# SAM3_SERVER_URLS=http://127.0.0.1:8021,http://127.0.0.1:8022
步骤 3:前端配置(frontend-workflow/.env)

LLM 提供商配置 - 控制 UI 中的 API 端点下拉菜单:

# UI 中显示的默认 API 地址
VITE_DEFAULT_LLM_API_URL=https://api.apiyi.com/v1

# 下拉菜单中的可用 API 地址(逗号分隔)
VITE_LLM_API_URLS=https://api.apiyi.com/v1,http://b.apiyi.com:16888/v1,http://123.129.219.111:3000/v1

修改 VITE_LLM_API_URLS 后的效果:

  • 前端会显示一个下拉菜单,包含您指定的所有 URL
  • 用户可以选择不同的 API 端点,无需手动输入 URL
  • 适用于在 OpenAI、本地模型或自定义 API 网关之间切换

Supabase(可选) - 如需用户认证,取消注释这些行:

VITE_SUPABASE_URL=https://your-project.supabase.co
VITE_SUPABASE_ANON_KEY=your-anon-key
不配置 Supabase 的情况

如果跳过 Supabase 配置:

  • ✅ 所有核心功能正常工作
  • ✅ CLI 脚本不依赖 Supabase
  • ❌ 无用户认证
  • ❌ 无账户积分、兑换码、邀请码、历史文件等账号能力
  • ❌ 无云文件存储

Note

快速开始: 您可以完全跳过 .env 配置,直接使用 CLI 脚本并通过 --api-key 参数传递密钥。详见下方 CLI 脚本 部分。


高级配置:本地模型服务负载均衡

如果是本地部署高并发环境,可以使用 script/start_model_servers.sh 启动本地模型服务集群(MinerU / SAM / OCR)。

脚本位置:/DataFlow-Agent/script/start_model_servers.sh

主要配置项说明:

  • MinerU (PDF 解析)

    • MINERU_MODEL_PATH: 模型路径 (默认 models/MinerU2.5-2509-1.2B)
    • MINERU_GPU_UTIL: 显存占用比例 (默认 0.85)
    • 实例配置: 脚本默认在每个配置 GPU 上各启动 1 个实例,端口范围 8011-8013。
    • Load Balancer: 端口 8010,自动分发请求。
  • SAM3 (Segment Anything Model 3)

    • 实例配置: 默认每个配置 GPU 启动 1 个实例,端口范围 8021-8022。
    • 模型路径: 默认使用 ./models/sam3/sam3.pt 与 ./models/sam3/bpe_simple_vocab_16e6.txt.gz。
    • Load Balancer: 端口 8020。
  • OCR (PaddleOCR)

    • 配置: 运行在 CPU 上,使用 uvicorn 的 worker 机制 (默认 4 workers)。
    • 端口: 8003。

使用前请根据实际 GPU 数量和显存情况修改脚本中的 gpu_id 和实例数量。

如果你要在单张 GPU 上一条命令联调(SAM3 + 后端 + 前端),可执行:

bash script/start_local_sam3_dev.sh

🪟 Windows 安装

Note

目前推荐优先在 Linux / WSL 环境下体验 Paper2Any。 若你需要在 原生 Windows 上部署,请按以下步骤操作。

1. 创建环境并安装基础依赖

# 0. 创建并激活 conda 环境
conda create -n paper2any python=3.12 -y
conda activate paper2any

# 1. 克隆仓库
git clone https://github.com/OpenDCAI/Paper2Any.git
cd Paper2Any

# 2. 安装基础依赖
pip install -r requirements-win-base.txt

# 3. 开发模式安装
pip install -e .

2. 安装 Paper2Any 相关依赖(推荐)

Paper2Any 涉及 LaTeX 渲染与矢量图处理,需要额外依赖:

# Python 依赖
pip install -r requirements-paper.txt

# NVIDIA GPU 运行时额外依赖(仅 Linux,需要时再装)
# pip install -r requirements-cu12.txt

# tectonic:LaTeX 引擎(推荐用 conda 安装)
conda install -c conda-forge tectonic -y

🎨 安装 Inkscape(SVG/矢量图处理|推荐/必装)

  1. 下载并安装(Windows 64-bit MSI):Inkscape Download
  2. 将 Inkscape 可执行文件目录加入系统环境变量 Path(示例):C:\Program Files\Inkscape\bin\

Tip

配置 Path 后建议重新打开终端(或重启 VS Code / PowerShell),确保环境变量生效。

⚡ 安装 Windows 编译版 vLLM(可选|用于本地推理加速)

发布页参考:vllm-windows releases 推荐版本:0.11.0

pip install vllm-0.11.0+cu124-cp312-cp312-win_amd64.whl

Important

请确保 .whl 与当前环境匹配:

  • Python:cp312(Python 3.12)
  • 平台:win_amd64
  • CUDA:cu124(需与你本机 CUDA/驱动适配)

启动应用

Paper2Any - 论文工作流 Web 前端(推荐)

# NVIDIA 机器推荐直接使用一键入口
bash deploy/start_nv.sh

本地默认访问地址:

本地部署常用命令:

  • 推荐启动整套:bash deploy/start_nv.sh
  • 仅启动后端(需先加载 profile): set -a && source deploy/profiles/nv.env && set +a && bash deploy/start.sh
  • 停止后端:./deploy/stop.sh
  • 重启后端:./deploy/restart.sh

说明:

  • deploy/start.sh 会读取 deploy/app_config.sh,但不会自动加载 deploy/profiles/*.env。
  • deploy/start_nv.sh 才是当前最稳妥的一键入口:它会加载 deploy/profiles/nv.env、准备本地模型、启动模型服务,再启动后端和前端。
  • 如果修改了 APP_PORT,也要同步更新 frontend-workflow/vite.config.ts 里的前端代理地址。

配置前端代理

修改 frontend-workflow/vite.config.ts 中的 server.proxy:

export default defineConfig({
  plugins: [react()],
  server: {
    port: 3000,
    open: true,
    allowedHosts: true,
    proxy: {
      '/api': {
        target: 'http://127.0.0.1:8000',  // FastAPI 后端地址
        changeOrigin: true,
      },
      '/outputs': {
        target: 'http://127.0.0.1:8000',
        changeOrigin: true,
      },
    },
  },
})

访问 http://localhost:3000

Windows 加载 MinerU 预训练模型

# PowerShell环境下启动
vllm serve opendatalab/MinerU2.5-2509-1.2B `
  --host 127.0.0.1 `
  --port 8010 `
  --logits-processors mineru_vl_utils:MinerULogitsProcessor `
  --gpu-memory-utilization 0.6 `
  --trust-remote-code `
  --enforce-eager

启动应用

🎨 Web 前端(推荐)

# NVIDIA 机器推荐直接使用一键入口
bash deploy/start_nv.sh

访问 http://localhost:3000。 后端默认健康检查地址为 http://127.0.0.1:8000/health。


🖥️ CLI 脚本(命令行界面)

Paper2Any 提供独立的 CLI 脚本,支持命令行参数输入,可直接执行工作流,无需启动 Web 前后端。

环境变量配置

通过环境变量配置 API 访问(可选):

export DF_API_URL=https://api.openai.com/v1  # LLM API 地址
export DF_API_KEY=sk-xxx                      # API 密钥
export DF_MODEL=gpt-4o                        # 默认模型

可用的 CLI 脚本

1. Paper2Figure CLI - 生成科学图表(3种类型)

# 从 PDF 生成模型架构图
python script/run_paper2figure_cli.py \
  --input paper.pdf \
  --graph-type model_arch \
  --api-key sk-xxx

# 从文本生成技术路线图
python script/run_paper2figure_cli.py \
  --input "Transformer 架构与注意力机制" \
  --input-type TEXT \
  --graph-type tech_route

# 生成实验数据可视化图表
python script/run_paper2figure_cli.py \
  --input paper.pdf \
  --graph-type exp_data

图表类型: model_arch(模型架构图)、tech_route(技术路线图)、exp_data(实验数据图)

2. Paper2PPT CLI - 将论文转换为 PPT 演示文稿

# 基础用法
python script/run_paper2ppt_cli.py \
  --input paper.pdf \
  --api-key sk-xxx \
  --page-count 15

# 自定义风格
python script/run_paper2ppt_cli.py \
  --input paper.pdf \
  --style "学术风格;中文;现代设计" \
  --language zh

3. PDF2PPT CLI - 一键将 PDF 转换为可编辑 PPT

# 基础转换(无 AI 增强)
python script/run_pdf2ppt_cli.py --input slides.pdf

# 启用 AI 增强
python script/run_pdf2ppt_cli.py \
  --input slides.pdf \
  --use-ai-edit \
  --api-key sk-xxx

4. Image2PPT CLI - 将图片转换为可编辑 PPT

# 基础转换
python script/run_image2ppt_cli.py --input screenshot.png

# 启用 AI 增强
python script/run_image2ppt_cli.py \
  --input diagram.jpg \
  --use-ai-edit \
  --api-key sk-xxx

5. PPT2Polish CLI - 美化现有 PPT 文件

# 基础美化
python script/run_ppt2polish_cli.py \
  --input old_presentation.pptx \
  --style "学术风格,简洁大方" \
  --api-key sk-xxx

# 使用参考图片保持风格一致性
python script/run_ppt2polish_cli.py \
  --input old_presentation.pptx \
  --style "现代简约风格" \
  --ref-img reference_style.png \
  --api-key sk-xxx

Note

PPT2Polish 系统要求:

  • LibreOffice: sudo apt-get install libreoffice(Ubuntu/Debian)
  • pdf2image: pip install pdf2image
  • poppler-utils: sudo apt-get install poppler-utils

通用选项

所有 CLI 脚本都支持以下通用选项:

  • --api-url URL - LLM API 地址(默认:从 DF_API_URL 环境变量读取)
  • --api-key KEY - API 密钥(默认:从 DF_API_KEY 环境变量读取)
  • --model NAME - 文本模型名称(默认:各脚本不同)
  • --output-dir DIR - 自定义输出目录(默认:outputs/cli/{脚本名称}/{时间戳})
  • --help - 显示详细帮助信息

查看完整参数文档,可运行任意脚本并添加 --help 参数:

python script/run_paper2figure_cli.py --help

📂 项目结构

Paper2Any/
├── dataflow_agent/          # 核心代码库
│   ├── agentroles/         # Agent 定义
│   │   └── paper2any_agents/ # Paper2Any 专用 Agent
│   ├── workflow/           # Workflow 定义
│   ├── promptstemplates/   # Prompt 模板
│   └── toolkits/           # 工具集(绘图、PPT生成等)
├── fastapi_app/            # 后端 API 服务
├── frontend-workflow/      # 前端 Web 界面
├── static/                 # 静态资源
├── script/                 # 脚本工具
└── tests/                  # 测试用例

🗺️ 开发计划

功能 状态 子功能
📊 Paper2Figure
可编辑科研绘图
85% 完成
完成
完成
完成
🧩 Paper2Diagram
Drawio 绘图
80% 完成
完成
完成
完成
🎬 Paper2PPT
可编辑演示文稿
70% 完成
完成
完成
完成
完成
完成
🖼️ PDF2PPT
版式保留转换
90% 完成
完成
完成
🖼️ Image2PPT
图片转 PPT
85% 完成
完成
🎨 PPTPolish
智能美化
60% 完成
进行中
进行中
📚 知识库(KB)
KB 工作流
75% 完成
完成
完成
🎬 Paper2Video
视频脚本生成
40% 进行中
进行中

🤝 贡献

这里保留的是历史开源版贡献说明。新产品功能和新架构已不再同步到本仓库,目前也没有继续审核新功能 PR 的计划。现有 Issue 和 Discussion 作为社区历史记录保留。

Issues Discussions


📄 License

本项目采用 Apache License 2.0 开源协议。


如果这个项目对你有帮助,请给我们一个 ⭐️ Star!

GitHub stars GitHub forks


DataFlow-Agent 社区微信群
扫码加入社区微信群

❤️ Made with by OpenDCAI Team