用多模态 AI 做实时协作与创作
基于近期 OpenAI 与 Google DeepMind 发布的功能,提炼三种可落地的多模态 AI 实战工作流。
OpenAI 推出连续语音交互与数学推理进展,Google DeepMind 发布 Gemini Robotics ER 2 与 Lyria 3.5。本文提炼三个可操作技巧:实时语音驱动工作流、视频理解编排多步骤任务、可控音乐生成,帮你把新功能变成生产力。
背景
2026 年 8 月初,OpenAI 与 Google DeepMind 密集发布了一系列多模态 AI 更新。OpenAI 带来了连续语音交互能力(来源)和数学推理方面的十项进展(来源)。Google DeepMind 则发布了面向机器人的 Gemini Robotics ER 2(来源)以及音乐生成模型 Lyria 3.5(来源)。
这些更新有一个共同方向:AI 正在从"单次问答"走向"持续交互、多模态理解与任务编排"。对普通用户和开发者来说,这意味着你可以用语音实时驱动 AI、用视频输入让 AI 理解复杂物理场景、用更精细的参数控制音乐创作。
本文从这些发布中提炼三个可以直接上手的工作流技巧。
技巧一:用连续语音交互做实时口述工作流
适用场景
需要边思考边记录的场景:会议实时纪要、口述草稿、编程时的连续问答、学习外语的对话练习。
怎么做
OpenAI 发布的连续语音交互功能(来源)允许你与 GPT 进行不间断的语音对话,无需反复点击录音按钮。传统语音助手的模式是"说一句→等翻译/回复→再说一句",而连续交互模式下,AI 可以在你说话的同时进行处理。
Step 1:开启连续语音模式 在支持该功能的客户端中启动语音对话,确认进入连续交互状态。 预期结果:界面上不再显示"按住说话"按钮,而是显示持续的语音波形或连接状态。
Step 2:口述你的任务上下文 像跟同事说话一样,连续描述你的需求。例如:"我正在写一份关于机器人协作的报告,先帮我列出三个关键论点,然后逐个展开。" 预期结果:AI 在你停顿时开始回应,你可以随时打断补充信息。
Step 3:边听边修正 当 AI 回应时,你可以直接插话修正方向,比如"第二点换成多机器人协作的案例"。AI 会基于连续上下文调整输出。 预期结果:输出内容贴合你的实时修正,不需要重新发起对话。
注意事项
- 环境噪音:连续交互对背景噪音敏感,嘈杂环境下可能误拾取声音。建议在安静环境或使用定向麦克风。
- 打断时机:过早打断可能导致 AI 漏掉前半段信息。建议在 AI 完成一个完整句子后再插话。
- 上下文长度:长时间连续对话可能超出上下文窗口,重要结论建议随时让 AI 总结确认。
技巧二:用视频理解驱动多步骤任务编排
适用场景
需要从视频中提取信息并拆解为多个子任务的场景:工厂流水线动作分析、教学视频拆解、物理操作流程文档化。
怎么做
Gemini Robotics ER 2 的核心能力是视频理解、任务编排和多机器人协作(来源)。虽然该功能面向机器人应用,但其底层能力——从视频中理解动作序列、拆解任务步骤——同样适用于知识工作和内容分析。
Step 1:输入视频并定义分析目标 将操作视频输入给支持视频理解的多模态 AI,明确要求:"观看这段视频,按时间轴列出每个操作步骤,标注关键动作和所用工具。" 预期结果:AI 输出结构化的步骤清单,每步包含时间戳、动作描述和工具信息。
Step 2:让 AI 将步骤编排为可执行任务序列 基于上一步的清单,要求 AI 将其转化为标准操作流程(SOP),包括前置条件、执行动作和验证标准。 预期结果:输出一份带有依赖关系的任务图或编号 SOP 文档。
Step 3:分发子任务 如果是团队协作,可以将 SOP 中的子任务分配给不同人(或不同 AI Agent),每个子任务附带对应的视频片段引用和操作说明。 预期结果:每个执行者收到的任务包含完整的上下文,不需要重新观看整段视频。
注意事项
- 视频质量:分辨率低、遮挡严重的视频会导致动作识别出错。关键步骤建议补充文字说明。
- 步骤粒度:AI 默认的拆解粒度可能不符合你的需求。第一次交互时明确要求"按每个独立动作拆"或"按每个工序阶段拆"。
- 多机器人场景:如果涉及真实多机器人协作部署,Gemini Robotics ER 2 支持多机器人协同(来源),但这需要硬件环境配合,非普通用户可直接使用。知识工作者可以借鉴其"任务编排"思路用于人力分工。
技巧三:用 Lyria 3.5 做精细可控的音乐创作
适用场景
需要快速生成带人声的原创音乐:短视频配乐、播客片头、产品演示背景音乐、个人创作。
怎么做
Google DeepMind 在 Google Flow Music 中推出了 Lyria 3.5,在音乐性、歌词、人声和创作控制方面均有提升(来源)。相比早期的"输入提示词→等结果"模式,Lyria 3.5 的关键改进在于对创作过程的控制粒度。
Step 1:定义音乐结构和风格参数 不要只写"生成一首欢快的歌"。明确风格、BPM、段落结构:
风格:电子流行,BPM 120,结构:Intro(8小节) → Verse(16小节) → Chorus(16小节) → Outro(8小节)
预期结果:AI 生成的音乐符合你定义的结构框架,而非随机长度。
Step 2:分阶段输入歌词和人声要求 Lyria 3.5 对歌词和人声有专门优化。按段落输入歌词,并标注每段的人声风格:
Verse: 女声,低沉叙述感 Chorus: 合声,高亢
预期结果:人声风格随段落变化,整体听感有层次。
Step 3:迭代微调 基于第一版结果,针对性调整。例如"Chorus 的鼓点加重""Verse 的人声延迟 0.5 拍"。利用提升后的创作控制能力进行精细化修改。 预期结果:每次迭代只改动指定部分,其余保持不变。
注意事项
- 提示词语言:音乐风格描述建议用英文,流派术语更准确;歌词可用中文。
- 人声自然度:虽然 Lyria 3.5 在人声方面有提升,但复杂中文歌词的咬字仍可能出现偏差。建议在歌词中使用短句,避免生僻字。
- 版权意识:生成音乐时避免在提示词中指定特定歌手名字或歌曲风格组合,以免产出过于接近已有作品的结果。
小结
这三个技巧的共同思路是:把 AI 的多模态能力当作持续协作的伙伴,而非单次查询工具。
- 语音交互让 AI 进入你的工作节奏,而不是你适应 AI 的输入框
- 视频理解让 AI 从"读文字"变成"看世界",任务编排能力把看懂的东西变成可执行计划
- 音乐生成的精细化控制让创作从"碰运气"变成"可迭代"
核心行动建议:选一个你本周正在做的任务,尝试用对应的技巧替换现有流程中的一个环节,对比效率差异。
来源与延伸阅读
- Continuous voice interaction with GPT Live
- Gemini Robotics ER 2: powering robotics with video understanding, task orchestration, and multi-robot collaboration
- We're launching Lyria 3.5 in Google Flow Music
- Ten advances in mathematics
- Gemini Robotics 2 brings whole body intelligence to robots
接下来值得继续跟踪
- 连续语音交互的打断精度:当前注意事项基于功能发布信息推断,实际使用中 AI 对打断时机的响应准确度需要进一步验证。观察指标:插话后 AI 是否能正确区分"补充信息"与"新指令"。
- Lyria 3.5 中文人声质量:官方强调人声方面的提升,但未公布分语言表现。观察指标:中文歌词的咬字准确率和情感表达自然度。
- Gemini Robotics ER 2 的非机器人场景适用性:本文将视频理解能力迁移到知识工作场景,这一应用方式并非官方说明。观察指标:是否有第三方基于该能力构建非机器人的视频分析工具。