数据分析插件:使用与概念说明
August 18, 2026 · View on GitHub
这份文档给第一次接触这个插件的人看。它只讲两件事:插件装好后能做什么,以及插件内部大致由哪些部分组成。
装好后能做什么
用户只需要把一个表格文件交给插件,再用一句话说明想分析什么。插件会自动完成:
- 读取表格文件。
- 清洗重复值、缺失值和类型错误。
- 做一次快速的探索分析。
- 让用户选择可视化分析或机器学习建模。
- 生成图表和报告。
- 尝试导出 PDF。
如果用户一开始就说“全自动”,中间的确认步骤会被跳过。
五个主要部分
| 部分 | 它负责什么 |
|---|---|
| Python 运行环境 | 让模型能在一个独立的 Python 环境里写数据处理代码 |
| 数据分析工具 | 提供读取文件、选择路线、保存图表、保存报告、导出 PDF 等功能 |
| 操作说明 | 告诉模型每一步应该怎么清洗、探索、画图和建模 |
| 安装组合包 | 把前面几个部分按正确顺序组装起来 |
| 网页展示层 | 把图表和报告用更好看的方式显示出来 |
这五个部分现在都在使用。图表和报告由网页展示层渲染成可交互图表卡片和报告卡片。
一次分析具体怎么走
- 用户给出文件路径,例如
D:\data\sales.csv。 - 插件读取这个文件,自动判断编码和分隔符,并保存成标准格式供后面重复使用。
- 插件清洗数据,并把清洗后的结果保存成文件。
- 插件询问用户是否继续;如果是全自动模式,就跳过。
- 用户选择"可视化分析"或"机器学习建模"。
- 插件做探索分析,然后画图或训练模型。
- 插件保存图表和报告。
- 插件尝试导出 PDF;如果环境不支持,就生成 HTML 报告。
模型能看到哪些工具
虽然用户不用直接操作这些工具,但了解它们能帮助你理解插件的行为:
| 工具 | 工具名(英文) | 作用 |
|---|---|---|
| 读取表格 | load_table | 登记文件,并告诉模型文件格式和是否全自动 |
| 选择路线 | set_route | 固定这次分析走可视化还是机器学习 |
| 保存图表 | save_chart | 保存一张图表 |
| 保存报告 | save_report | 保存最终报告 |
| 导出 PDF | export_pdf | 把报告导出成 PDF,或退回 HTML |
常见名词怎么理解
- 模型:这里指 DeepSeek Harness 里的智能体,它负责决定每一步做什么。
- 工具:模型可以调用的功能按钮,比如“读取表格”“保存图表”。
- 会话记录:系统对“刚才发生了什么”的完整记录,方便回看和恢复进度。
- 投影:把一堆零散记录,整理成“当前已经做到哪一步”的简单状态。
- 组合包:一组启动时需要加载的插件配置。
如果想修改插件,去哪里找
| 想改什么 | 去哪里看 |
|---|---|
| 分析流程和操作说明 | packages/data-analysis/skill-data-analysis/src/index.ts |
| 读取、保存、导出等工具 | packages/data-analysis/data-analysis/src/index.ts |
| Python 能使用哪些库、安全规则 | packages/code-runtime/code-runtime-python/src/index.ts |
| 启动时加载哪些部分 | packages/data-analysis/bundle-data-analysis/cordis.patch.yml |
| 图表和报告在网页里的样子 | packages/client/ui-data-analysis/src/client/ |