作者做了两个PPT skill,经验很实在。他说Claude Opus做HTML比GPT好看,还对比了不同路线的优劣势,想省成本又出效果可以看看。
作者分享了用Claude Opus生成PPT的经验,对比了HTML+CSS和SVG路线,认为HTML是最佳中间格式。baoyu-design skill可用Opus模型1:1还原PPTX,美观度优于GPT-5.6。成本方面,非大量制作时差异不大,重点在效果。业界多数产品选择HTML/CSS或操作PPT软件包,而remio设计了精炼直观的IR并实现往返高保真,效率比Claude Code快一两倍、成本低2/3。
AI 生成 PPT 这事我有发言权,我做过两个还颇受欢迎的 PPT Skill 版本,一个是纯图片的(baoyu-slide-deck skill),一个是 HTML 但是能转原生 PPTX(baoy...
AI 生成 PPT 这事我有发言权,我做过两个还颇受欢迎的 PPT Skill 版本,一个是纯图片的(baoyu-slide-deck skill),一个是 HTML 但是能转原生 PPTX(baoyu-design)。 我的结论是要设计效果好并且方便编辑,一定还要是 HTML + CSS,因为你要自己设计一套中间格式,大概率是 AI 不友好的,那么设计出来的不会多好看,或者说只能组合出有限的风格样式,毕竟 AI 没丰富训练过。但现在 Claude Opus 这样的模型做 HTML 很漂亮。 或者说 HTML 就是最佳中间格式。 如果要转原生 PPTX,那么就需要是有约束的 HTML + CSS,这样就能兼顾美观和原生。 这是我前不久用 baoyu-design skill 做的一个 PPT: s.baoyu.io/files/baoyu-ai… 基本上是 1:1 还原成 PPTX 没有任何问题。 从美观程度来说 Opus 模型效果最好,比 GPT 5.6 要好,但是 GPT 的画图模型很好,可以配合着用来画图。 比如我这个 Slides 就是用 Claude Code + Opus 4.8 设计,用 baoyu-image-gen Skill 调用 Codex 画图。 至于成本,不是每天大量做,差别不大,重点是效果要好。 推荐试试看: github.com/jimliu/baoyu-d… WY @wangyuanzju 上一条说到remio做PPT很专业,我觉得做原生PPT,我们应该是最专业的,而大部分业界产品做PPT的路线是错的。 这事也挺好玩的。之前在网易的时候,最后几年我们团队内部沟通是要求不用PPT的,因为磨PPT太浪费时间。但我们做了remio之后,确实发现做PPT的需求太普遍,所以就扎根到解析和做PPT里了。 要做好PPT,关键是要设计好一种合适的DSL或IR,让模型像写Markdown那样自然,而且看到IR就基本能知道效果。 在这一点上,业界很多产品的做法就是不对的。 比如特别多产品和SKILL是用HTML和CSS的,这就做不好也费钱,因为HTML的非绝对定位和CSS的selector等机制都会使得语言和效果脱节,所以容易写出来效果有问题,调试问题容易折腾。这一点上我们和guizang等基于HTML的SKILL做过对比,基本上remio会快一倍,成本低的更多。 再比如很多产品是基于操作PPT的软件包写代码来实现,这些软件包的代码描述的很多时候是过程而非结果,语言也不够精炼,这样质量和效率也就自然做不好。remio和Claude Code比速度快一两倍,成本只有1/3,原因就在这里。 最正确的路是设计一种精炼直观的IR,并且做到往返高保真,也就是说模型用这个IR生成的PPT,解析后读过来还是这个IR。往返保真这点特别重要,否则已有PPT就没法修改,对生成而言,模型写的时候是一个东西,读过来突然变成另一个东西,模型就被搞晕,不自信了,不知道自己写的对不对。 但往返保真的工作量特别大,PPT的格式及其复杂,把各种PPT元素都解析成IR的工作量是很夸张的,我们做了九个月,算是做了个八成,也还没做完。 走在这条路上的,业界我们除了我们,也就ppt master。ppt master是用svg作为IR。svg还是比较合适的,因为它是绝对定位布局,语法也精炼,模型也会用。但svg有个很大的问题是文本不会排版,这就要求生成的时候模型得把每个换行都算好,要是改一个字后面所有换行都得重算。这是svg路线的硬伤。当然ppt master要做的工作还有很多,最大的一块是解析已有ppt到svg的功能它才开始,这块的工作量是极大的。 🔗 View Quoted Tweet 💬 4 🔄 0 ❤️ 12 👀 2270 📊 6 ⚡