AI 多媒体制作
AI 多媒体制作工作流实践与资料
按素材、分镜、版式与最终文件,阅读图片、视频、音乐、PDF 翻译和 PPT 的制作案例与工具。
多媒体任务的关键是把生成结果接成可交付的作品。本组包括 Gemini 视频分析与复刻、图像和音乐评测、NotebookLM/PPT 流程、PDF 中文视觉翻译以及 Remotion 源码。先明确要保留的素材与结构,再检查时间轴、页面对应、可编辑性和最终导出;源码包按制作用途归类,即使作品讨论的主题是 GEO。
文章与配套资源
先按标题与简介判断它是否对应你的问题;资源条目会带你进入原有预览与下载页面。
- 资源 Gemini Video Analysis Skill | 视频转写、分镜与分析报告工具下载 下载开源 Gemini Video Analysis Skill,把本地视频或视频链接整理成带时间戳转写、语义分镜、关键帧、接触表和 HTML 分析报告。
- 资源 贴图提示词 | 前端透明 PNG 资源重建提示词下载 下载一份可直接给 Codex 或图像 Agent 使用的中文提示词,用来把参考图拆成适合前端切图的透明 PNG 资源,并约束白底隔离、透明化、文件命名与最终交付边界。
- 资源 Bilibili Subtitle Extractor v2.0.0 | B站字幕提取与 Apple Silicon 加速 B站字幕提取 Codex Skill v2.0.0:优先使用官方字幕,无字幕时支持 Apple Silicon Core ML、ANE 与 Metal 加速,保留 Whisper 回退,生成原始字幕和整理版 Markdown。
- 文章 我把英文PDF翻成中文版以后,才发现AI真正省下的不是翻译费 通过整页重建 PDF 的方式,我把英文资料转为中文后意识到:AI真正省下的不是单次翻译工时,而是整条从翻译、排版到发布的资产化链路。
- 资源 GEO Citation Lab Remotion 视频源码下载 下载果叔 AI 搜索引用实验视频的 Remotion 源码包,包含数据可视化组件、字幕时间轴、完整口播音频、封面图和使用说明。
- 资源 PDF 中文视觉翻译 Skill | 整页 Imagegen 工作流下载 一个面向 Codex 的开源 Skill,用整页栅格流程把英文 PDF 转成中文视觉版 PDF:先渲染页面图片,再用 imagegen 整页生成中文页图,最后尺寸矫正并装订成 PDF。
- 文章 Google 发布 Nano Banana 2:图像生成进入“高质低时延”拐点 | 果叔AI日报 Google发布Nano Banana 2模型,实现图像生成高质与低时延的平衡,推动内容生产从离线工具向在线实时交互能力的战略转型。
- 文章 Gemini 3.1 音乐创作能力专业音乐人级别亲测:离专业音乐模型还有多远 专业音乐人实测Gemini 3.1音乐创作能力,结论是它更像语义驱动的草图工具,而非稳定生产系统。
- 文章 Google AI Studio 官方 Demo 拆解10 组提示词,让你一人顶一个美术外包团队 拆解Google AI Studio官方10组提示词,掌握结构化方法论,助你一人搞定游戏、电商等多种美术资产外包需求。
- 文章 NotebookLM + Nanobanana Pro 让 99% 的 AI PPT 产品可以埋了 NotebookLM结合Nanobanana Pro和WPS可生成高质量、可编辑的AI PPT,效率和准确性远超现有主流产品。
- 文章 NanoBanana Pro 上手实测:从 Vogue 封面到废土少女,它到底有多能打? NanoBanana Pro 实测展示了其从时尚封面到废土场景的强大生成能力,是加速设计从 0 到 0.7 的多面手工具。
- 文章 复刻爆款AI视频?我用 Gemini 跑通了一条“全自动”生产线 使用 Gemini 原生多模态能力,本文揭示了七步“全自动”复刻爆款AI视频的工作流,实现创意工程化生产。
- 资源 AI PPTX 生成工具 Skill | Slides Skill for AI 下载 基于 PptxGenJS 的 AI Skill 工具包,支持通过 AI 直接生成可编辑的 PPTX 文件,而非 HTML 网页版 PPT。包含布局助手、渲染验证工具和完整工作流。