必须记住我们学习的时间有限的。时间有限,不只由于人生短促,更由于人事纷繁。—— 斯宾塞

PPT Master:把文档与主题,交给 AI 变成真正可编辑的 PowerPoint

项目地址:https://github.com/hugohe3/ppt-master

做一份演示文稿,真正消耗时间的往往不是把文字放进页面。

而是阅读资料、筛选重点、安排叙事、确定风格、搜集图像、绘制图表、统一版式、处理视觉细节,再反复调整每一页的节奏。

当内容来自 PDF、DOCX、报告、图片、网页资料或一段尚未整理好的文字时,PPT 制作更像一次从混乱材料中提炼观点、建立结构并完成视觉表达的过程。

PPT Master 想做的,是把这条过程交给 AI 推进,同时保留 PowerPoint 应有的编辑能力。

它是一套能够将文档或主题转化为原生 PowerPoint 演示文稿的 AI 工作流。生成结果不是一张张不可拆分的图片,也不只是套着文本框的静态页面,而是一份拥有原生形状、图表、表格、幻灯片切换、动画、演讲者备注和音频旁白能力的真实 PPTX 文件。

它的重点不只是“可编辑”。

而是尽可能进入 PowerPoint 的原生对象模型之中。

PPT 不只是内容容器

很多自动生成演示文稿的工具,能够把文字排成页面,也能够生成看起来像幻灯片的图像。

但一份真正的 PowerPoint,远不只是视觉截图。

它包含母版、文本层级、形状、连接线、图表、表格、页面切换、对象动画、演讲者备注、音频以及后续修改的可能性。

PPT Master 将这种能力称为原生深度。

它的目标是输出能够继续在 PowerPoint 中被编辑、调整和复用的演示文稿,而不是把内容固定在一张不可分解的平面图里。

因此,生成后的页面可以拥有:

  • 原生幻灯片母版
  • 原生形状与连接器
  • 按需生成的数据驱动图表与表格
  • 原生页面切换效果
  • 可选的元素进入与强调动画
  • 根据演讲者备注生成的旁白音频
  • 对自有 PPTX 模板的支持
  • 可以继续编辑的原生 DrawingML 演示文稿结构

对于真正需要交付、修改、复用和演讲的 PPT 而言,这种原生能力决定了生成结果是否能够继续进入真实工作流。

从资料出发,而不是从空白页面出发

PPT Master 的主要工作方式,是从用户已有材料开始。

用户可以把 PDF、DOCX、图片或其他文件放入项目目录,再直接告诉 AI 使用哪些资料生成演示文稿。

1
Please create a PPT from projects/q3-report/sources/report.pdf

也可以直接将内容粘贴到对话中。

1
Please turn the following into a PPT: paste your content here

当用户没有要求快速生成时,AI 会先确认设计规格。

1
2
3
4
AI:  Sure. Let's confirm the design spec:
Template: Free design
Format: PPT 16:9
Pages: 8-10 pages

在这个过程中,AI 负责处理内容分析、视觉设计、SVG 生成与 PPTX 导出。

如果明确要求快速生成,也可以跳过确认轮次,直接进入制作和导出。

1
Quickly generate a 5-page deck from projects/q3-report/sources/report.pdf — no need to confirm with me

用户已经明确的要求会被遵循,没有明确说明的部分则由 Agent 自行决定,而不是反复追问。

这种方式让 PPT 制作从手动搭建每一页的过程,转向由资料、目标和设计规格共同驱动的生成流程。

让 AI 处理繁琐工作,把最后的判断留给人

PPT Master 对自身的定位并不神秘。

它不是一个能够凭空许愿、一次生成完美成品的工具。

它将自己的角色定义为工作流。

工作流负责把繁琐、重复、耗时的部分推进下去,而模型能力决定最终输出的上限。

一份演示文稿通常仍然需要人的判断。

哪些内容应该被删减,哪些数据应该突出,哪些画面需要替换,哪些表达更符合受众,哪些页面应该更克制,这些事情仍然属于演讲者、创作者和决策者。

PPT Master 的价值,在于先承担大量机械性与组织性的工作。

它帮助把素材变成页面,把页面变成完整叙事,把视觉设计和文件导出推进到可以继续修改的状态。

人不必从空白页面开始。

人可以从一份已经具备结构、内容和原生编辑能力的 PPT 开始打磨。

不是单一模板,而是多种视觉语言

演示文稿的风格不应只有一种。

同样是介绍一个主题,建筑设计项目、数据分析报告、产品展示、文化内容、企业战略与技术说明,所需要的视觉语气并不相同。

PPT Master 的示例覆盖了多种风格方向。

其中包括:

  • 编辑杂志风格
  • 数据新闻风格
  • 瑞士网格风格
  • 玻璃拟态产品展示风格
  • 孟菲斯流行风格
  • 孔版印刷杂志风格

这些示例表达了一个重要事实。

AI 生成 PPT 不一定只能停留在统一配色、统一卡片、统一排版的模板化状态。

它可以根据内容选择不同的设计方向。

有些内容适合克制的文字网格与摄影画面。

有些内容适合深色数据面板与图表叙事。

有些内容适合透明层次、渐变深度和产品界面感。

有些内容则更适合鲜明色彩、几何图案与更具活力的视觉节奏。

PPT Master 不只是把文档切成若干页,也试图把每个主题放进更适合它的视觉语言中。

原生形状、图表与表格,让页面不只是视觉图片

在 PowerPoint 中,图表和表格往往承担着最重要的信息表达任务。

数据趋势、分类比较、时间进度、业务结构、计划安排和关键指标,都需要通过图表或表格被组织起来。

PPT Master 支持按需生成数据驱动的图表和表格。

这意味着数据不只是以图片形式嵌入页面,而能够成为 PPT 中具有原生编辑能力的内容。

原生形状也让页面中的结构关系可以继续调整。

例如,一个流程图中的方框、箭头、分组和标签,不必成为一张无法修改的截图。它们可以保留为 PowerPoint 内部对象,在后续编辑中继续移动、替换、修改文字或调整布局。

这种能力尤其适合需要持续迭代的演示文稿。

一份季度报告可能需要更新数据。

一份项目汇报可能需要补充页面。

一份客户提案可能需要替换品牌元素。

一份培训材料可能需要调整案例。

当生成结果保留原生对象结构时,PPT 就不会在第一次导出后失去继续成长的空间。

幻灯片的时间维度,也可以被生成

一份演示文稿的体验不只来自静态页面。

页面之间如何切换,元素如何进入,重点如何被强调,旁白如何配合内容推进,这些都会影响演讲节奏。

PPT Master 支持原生页面切换效果,也支持可选的元素进入与强调动画。

它还支持根据演讲者备注生成逐页旁白,并将音频嵌入 PPTX 文件中。

这使得演示文稿不只是一份阅读材料,也可以成为带有讲述节奏的演讲载体。

演讲者备注原本是隐藏在页面背后的内容层。

它记录讲解要点、补充信息和口头表达线索。

PPT Master 进一步将这一层与音频旁白连接起来,让备注有机会转化为可播放的逐页讲述。

对于需要异步观看、课程讲解、展示录制和内容分发的场景,旁白能力让演示文稿拥有更完整的表达形式。

模板不是限制,而是可复用的设计资产

很多团队已经拥有自己的模板。

模板里可能有品牌色、页眉页脚、固定版式、封面风格、章节页、数据页、图片页和结尾页。

PPT Master 支持从参考资料中提炼可复用的品牌、风格、布局和演示文稿模板,也支持使用已有 PPTX 文件承接新的内容。

如果用户已经有一份需要复用的演示文稿,可以将这份 PPTX 与新资料一起交给 AI,并要求它把新的内容填入已有结构。

这让已有的演示资产不必被抛弃。

原本的模板可以继续作为品牌与版式的基础,新内容则被放入其中。

对于长期需要维护统一视觉形象的团队而言,模板并不是生成式工作流的障碍,而是最有价值的输入之一。

数据留在本地,工作流运行在机器上

PPT Master 提出三项核心承诺。

第一是透明、可预测的成本。

项目保持免费和开源,使用成本主要来自 AI 模型调用,不额外叠加 PPT 订阅费用。

第二是数据留在本地。

除了与 AI 模型进行通信之外,整个工作流都运行在用户自己的机器上。

第三是不被单一平台锁定。

任何具备 Agent 能力的 AI IDE 或工具,都可以驱动这套工作流。Claude、GPT、Gemini、Kimi 等模型都可以参与其中。

这种设计让 PPT Master 更像一层可被不同 Agent 工具调用的专业工作流,而不是一个只能在特定网页或固定产品环境中使用的封闭服务。

任何具备 Agent 能力的工具,都可以驱动它

PPT Master 不把自己绑定到某一个聊天工具或 IDE。

它运行在具备 Agent 能力的工具中。

这里的 Agent 能力,指的是能够读取和写入文件、执行命令,并持续进行多轮对话的环境。

用户可以选择 IDE 原生 Agent、IDE 插件或扩展、命令行 Agent 等不同类型的工具。

项目特别推荐 Claude Code 作为主要开发和测试环境,但并不限制用户只能使用这一种选择。

对于用户而言,Agent 在这套工作流中的作用很明确。

它就是一个能够读写项目文件、执行 PPT Master 工作流、与用户持续确认需求的 AI 交互窗口。

用户不必先成为 PowerPoint 自动化专家,也不必手动编写每一页的生成脚本。

只需要准备材料、表达目标,并让 Agent 在项目目录中推进流程。

从安装开始,进入生成流程

PPT Master 的安装前提是 Python 3.10 或更高版本。

在 macOS 或 Linux 环境中,可以先安装 Python。

1
brew install python
1
sudo apt install python3 python3-pip

接着克隆项目并进入目录。

1
2
git clone https://github.com/hugohe3/ppt-master.git
cd ppt-master

然后安装依赖。

1
pip install -r requirements.txt

完成后,就可以在支持 Agent 的工具中打开项目目录,并开始使用资料生成演示文稿。

如果后续需要更新克隆版本,可以运行项目提供的更新脚本。

1
python3 skills/ppt-master/scripts/update_repo.py

这个脚本会拉取最新版本,并在依赖文件变化时同步 Python 依赖。

也可以作为技能安装

除了完整克隆项目,PPT Master 还提供面向 Agent 工具的技能安装方式。

1
npx skills add hugohe3/ppt-master

在 Claude Code 中,也可以通过插件市场安装。

1
2
/plugin marketplace add hugohe3/ppt-master
/plugin install ppt-master@ppt-master

技能安装路径主要获取技能文件。

如果需要使用后处理脚本,仍然需要在安装位置执行依赖安装。

1
pip install -r requirements.txt

这种形式让 PPT Master 可以更自然地进入已有 Agent 工作环境中。

用户不需要在每次制作演示文稿时重新解释完整流程。技能文件承载了工作流规则与生成逻辑,Agent 可以据此组织任务。

图片可以由 AI 生成,也可以来自网页搜索

演示文稿中的图片往往决定页面的情绪和完成度。

PPT Master 为非用户提供的图片准备了两种可混合使用的路径。

第一种是 AI 图像生成。

通过设置图像后端与对应的 API 密钥,工作流可以自动调用图像生成能力。

第二种是网页图片搜索。

项目提供图像搜索脚本,并支持在不额外配置的情况下使用 Openverse 与 Wikimedia Commons 作为搜索来源。

如果配置 Pexels 或 Pixabay 的 API 密钥,则可以在默认搜索链路中获得更丰富的现代库存摄影、人物、工作场景、生活方式与插画素材覆盖。

图片来源并不需要全盘统一。

同一份演示文稿中,可以让某些页面使用用户提供的高分辨率素材,让另一些页面使用 AI 生成画面,再让部分内容页使用网页搜索图像。

项目也会综合考虑不同许可类型,并在需要时加入小型行内署名。

对于封面、产品展示、人物肖像和品牌场景,README 给出了明确的优先顺序:

用户提供的高分辨率素材与 AI 生成图像优先,其次是配置图片服务密钥后的网页搜索,再之后是零配置搜索结果。

SVG 是生成流程中的关键中间层

PPT Master 的输出流程中,SVG 扮演重要角色。

工作流会生成 SVG 内容,再由统一的 PPTX 转换器读取 SVG 输出目录,最终写出可编辑的原生 DrawingML 演示文稿。

1
svg_output
1
exports

SVG 在这里不只是最终图片格式。

它更像一个能够承载布局、文字、图形与视觉设计的中间表达层。

通过 SVG,AI 可以先完成页面视觉结构,再将这些结构转换为 PowerPoint 中可编辑的原生对象。

这条路径连接了视觉生成与 PowerPoint 编辑能力。

它既让 AI 可以处理更灵活的画面设计,也让最终交付物不必退化为扁平图片。

支持多种画布与交付场景

PPT 并不总是在传统十六比九屏幕上展示。

有些内容需要用于普通演示。

有些内容需要适配小红书、微信等不同画布。

有些内容需要作为社交传播图片。

有些内容需要用于打印或其他特定展示场景。

PPT Master 的文档中提供了多种画布格式支持,包括 PPT 十六比九,以及十种以上的其他格式。

这意味着内容制作不必局限于一种页面比例。

同样的资料可以根据最终用途,被组织成更适合的视觉输出。

演示文稿不再只能服务于投影幕布,也可以进入更多内容传播与沟通场景。

示例项目保留了从设计到页面的结构

PPT Master 的示例项目并不只是放出成品截图。

每个示例通常包含设计规格、执行约束、图像资源、逐页演讲者备注、原始 SVG 输出和可独立预览的最终 SVG。

1
2
3
4
5
6
7
project_name/
├── design_spec.md
├── spec_lock.md
├── images/
├── notes/
├── svg_output/
└── svg_final/

其中,design_spec.md 用于保存可读的设计规格。

spec_lock.md 用于保存机器可读的执行约束。

images 存放图像资源。

notes 存放逐页演讲者备注。

svg_output 保存带有占位内容的原始 SVG。

svg_final 保存图标和图片已经嵌入的独立预览 SVG。

通过这种结构,示例项目不只是展示结果,也保留了生成过程中的设计与内容组织方式。

用户可以从中观察,一份完整演示文稿如何从规范、素材和页面内容逐步形成。

预览不必等待 PowerPoint 打开

示例中的最终 SVG 可以直接在浏览器或编辑器中打开预览。

也可以通过简单的本地 HTTP 服务进行查看。

1
python -m http.server --directory examples/project_name/svg_final 8000

然后在浏览器中访问本地服务。

这种预览方式让设计检查不必完全依赖最终 PPTX 文件。

在 SVG 阶段,用户已经可以观察页面布局、图像内容、文字层级和整体视觉方向。

如果某页的构图、内容密度或风格不符合预期,可以在更早的阶段调整,而不是等到演示文稿完全生成后才开始发现问题。

从一份资料到一套演示叙事

PPT Master 最值得关注的地方,并不是它能生成多少页幻灯片。

而是它将演示文稿理解为一套完整叙事。

资料不是按段落被机械拆分。

内容需要被分析,重点需要被筛选,页面需要承担不同职责,视觉风格需要服务于主题,图表和图片需要支持论点,备注和旁白则承担讲述节奏。

从这个角度看,PPT 不是 Word 文档的横向排版版本。

它是一种独立的表达媒介。

它需要内容结构,也需要视觉结构。

它需要页面之间的递进,也需要重点之间的呼应。

它需要能够在会议室中讲述,也需要能够在异步场景中被阅读。

PPT Master 试图让 AI 进入这条完整链路。

一份真正可以继续工作的 PPT

自动生成演示文稿的最终价值,不在于几秒钟内得到多少页页面。

更重要的是,生成后的文件能不能继续工作。

能不能改文字。

能不能换数据。

能不能调整图表。

能不能替换图片。

能不能套入品牌模板。

能不能加入动画。

能不能保留演讲者备注。

能不能嵌入旁白。

能不能作为团队下一轮制作的起点。

PPT Master 给出的方向很明确。

它希望 AI 生成的不是一次性视觉结果,而是一份真实、原生、可持续编辑的 PowerPoint 演示文稿。

当资料、主题、设计、图像、图表、表格、旁白和模板开始进入同一条工作流,PPT 制作不再只是把内容搬进页面。

它开始成为一场由 AI 协助推进的表达设计。