PaperBanana-CN 学术配图助手 🍌

July 23, 2026 · View on GitHub

AI 驱动的学术论文配图生成工具 — 粘贴论文方法章节,自动生成高质量学术配图。

基于开源项目 PaperBanana论文)改造,全中文界面,国内可直接使用。

示例效果


功能介绍

📊 生成候选配图

粘贴论文的方法章节图注,自动生成多个候选配图供你挑选。

生成界面

背后是 5 个 AI Agent 协作的流水线:

检索器 → 规划器 → 风格化器 → 可视化器 → 评审器
  │         │          │           │          │
从参考库  将文字转为  优化学术    生成图像   审查图像
找类似图  图表描述    美学风格              提出改进

评审器和可视化器会自动迭代 3 轮,逐步优化图表质量。

  • 支持并行生成 1-20 个候选方案
  • 支持 21:9 / 16:9 / 3:2 等宽高比
  • 每个候选可查看演化时间线(每个阶段的中间结果)
  • 单张下载 / ZIP 批量下载 / JSON 完整结果导出

生成结果

✨ 图片精修

上传已生成的配图或任意图片,描述修改需求,生成 2K/4K 高分辨率版本。

精修界面

  • 支持 image-to-image 编辑(基于原图修改)
  • 支持纯文字描述重新生成
  • 支持放大到 2K / 4K 分辨率

精修结果

💰 智能检索,省 96% API 费用

原版 PaperBanana 的参考图检索会把 200 篇论文全文塞进 prompt,单次消耗 ~80 万 tokens。我们优化为默认仅发送图注,降至 ~3 万 tokens,效果基本不变。

检索模式Token 消耗/候选说明
auto~3 万LLM 智能匹配参考图,仅发送图注 (推荐)
auto-full~80 万发送完整论文文本,高精度但费用高
random0随机选 10 个参考,不调 API
none0不使用参考图

默认配置(5 候选 + auto)比原版省 96% 检索费用,界面上每种模式都有费用提示,不会踩坑。

🔧 多 API 支持

内置两种 API 提供商,开箱即用:

模式说明网络要求
Evolink(默认)国内 API 代理,直连可用无需翻墙
Google GeminiGoogle 官方 API需要科学上网

在界面侧边栏一键切换,模型名称自动更新。

说明:本工具与 Evolink 无任何商业关联,仅作为内置的国内可用 API 方案提供。项目采用 Provider 抽象架构(见 providers/ 目录),你可以自行集成任何兼容 OpenAI 接口的 API 服务商(如智谱 AI、通义千问、硅基流动、火山引擎等),只需参照 providers/base.py 的接口实现一个新的 Provider 即可。


快速开始

第一步:获取 API Key

推荐 Evolink(国内直连):前往 https://evolink.ai/dashboard/keys 注册获取

也可以用 Google Gemini:前往 https://aistudio.google.com/apikey 获取(需翻墙)

第二步:启动程序

macOS 用户:双击 mac-start.command

Windows 用户:双击 win-start.bat

⚠️ macOS 首次打开被拦截? 如果双击弹出「未打开 mac-start.command / Apple 无法验证……」,这是 macOS 对下载文件的安全拦截(Gatekeeper),并非文件有问题。任选一种方式放行(只需一次):

  • 右键放行(推荐):在访达里 右键(或按住 Control 点击) mac-start.command → 选「打开」→ 弹窗里再点「打开」。之后双击即可正常运行。
  • 终端命令:执行 xattr -c -r "项目文件夹路径"(把解压出来的文件夹拖进终端可自动填路径),再双击启动。
  • 系统设置:若右键没有「打开」按钮,打开 系统设置 → 隐私与安全性,下拉找到被拦截提示,点「仍要打开」。

💡 用 git clone 下载的仓库不会被拦截,只有下载 ZIP 解压才会遇到此提示。

Windows 提示:如果本地没有安装 Python,建议先打开 Microsoft Store 搜索 "Python 3.12" 安装,再运行脚本,避免自动安装耗时过长。

首次启动会自动完成以下操作(约 2-3 分钟):

  1. 检测或自动安装 Python(>= 3.10)
  2. 创建虚拟环境
  3. 安装所有依赖
  4. 启动程序并自动打开浏览器

之后每次启动只需几秒。

(可选)下载参考数据集

程序内置了「检索 Agent」,可以从参考图库中找到相似的学术配图作为生成参考,提升生成质量。如需此功能,请下载数据集:

  1. 前往 PaperBananaBench 下载数据集
  2. 将下载的内容放到项目的 data/PaperBananaBench/ 目录下,结构如下:
data/
└── PaperBananaBench/
    ├── diagram/
    │   ├── images/        ← 论文配图图片
    │   ├── ref.json       ← 参考数据
    │   └── test.json
    └── plot/
        ├── images/        ← 论文图表图片
        ├── ref.json
        └── test.json

不下载也能正常使用,只需在侧边栏将「检索设置」改为 none,此时跳过参考图检索,不影响其他功能。

第三步:使用

  1. 在左侧边栏选择 API 提供商,填入 API Key
  2. 切换到「生成候选方案」标签页
  3. 粘贴论文方法章节内容 + 图注
  4. 点击「生成候选方案」,等待几分钟
  5. 从生成的多个候选图中挑选满意的下载

侧边栏设置说明

设置项说明
API ProviderEvolink(国内直连)或 Gemini(需翻墙)
API Key对应提供商的密钥
文本模型用于规划/评审的模型(默认 gemini-2.5-flash),可直接修改
图像模型用于生成图片的模型(默认 nano-banana-2-beta),可直接修改
流水线模式demo_planner_critic(快速)或 demo_full(含风格化,更美观)
检索设置auto / auto-full / random / none,详见上方 检索费用对比
候选方案数量1-20,建议 3-5 个
宽高比21:9 / 16:9 / 3:2
最大评审轮次1-5,默认 3 轮

手动安装(可选)

如果一键脚本有问题,可以手动安装:

# 1. 确保已安装 Python 3.10+
python3 --version

# 2. 创建虚拟环境
python3 -m venv .venv
source .venv/bin/activate   # macOS/Linux
# .venv\Scripts\activate    # Windows

# 3. 安装依赖
pip install -r requirements.txt

# 4. 启动
streamlit run demo.py --server.port 8501

浏览器打开 http://localhost:8501 即可使用。


常见问题

Q: 启动时报错找不到 Python? A: 一键脚本会自动下载便携版 Python,请确保网络通畅。也可以手动安装 Python 3.10+ 后重试。

Q: Evolink 和 Gemini 有什么区别? A: 功能完全一样。Evolink 是国内代理,不需要翻墙;Gemini 是 Google 官方接口,需要科学上网。

Q: 生成一次大概花多少钱? A: 取决于候选数量和检索模式。默认配置(5 候选 + auto 检索)约消耗 15 万文本 tokens + 5 次图像生成。比原版省 96% 检索费用。具体价格请查看 API 服务商的定价页面。

Q: 生成需要多久? A: 5 个候选方案通常需要 10-15 分钟。单个候选约 2-3 分钟。

Q: 可以不用参考数据集吗? A: 可以。将检索设置改为 none 即可,此时不需要 data/ 目录中的数据集。

Q: 可以在界面上换模型吗? A: 可以。侧边栏的「文本模型」和「图像模型」输入框可以直接编辑,输入任何兼容的模型名称即可生效。切换 API Provider 时模型名会自动重置为对应默认值。

Q: Windows 上报错 module 'time' has no attribute 'tzset' A: 已修复。请拉取最新代码(git pull)即可解决。

Q: macOS 双击 mac-start.command 提示「Apple 无法验证……未打开」? A: 这是 macOS 对下载文件的安全拦截(Gatekeeper),文件本身没问题。右键点击该文件 →「打开」→ 弹窗再点「打开」即可放行(只需一次);或在终端执行 xattr -c -r "项目文件夹路径" 后再双击。详见上方启动程序的说明。用 git clone 下载则不会遇到此提示。

Q: 如何停止程序? A: macOS 在终端按 Ctrl+C;Windows 关闭命令行窗口即可。

Q: 如何集成其他 API 服务商? A: 参照 providers/base.py 定义的接口,实现 generate_text()generate_image() 两个方法即可。可以参考 providers/evolink.py 的实现。


致谢

本项目基于 PaperBanana 开源项目改造。原始论文:

Zhu, Dawei, et al. "PaperBanana: Automating Academic Illustration for AI Scientists."
arXiv preprint arXiv:2601.23265 (2026).

许可证:Apache-2.0