Day 078AI 协作手记 Working with AI约 7 分钟

ChatGPT Voice 的更新让人惊喜

ChatGPT Voice's update surprised me

很早就试过 ChatGPT Voice。

但过去一年多,我基本没怎么用。

不是因为语音识别差,也不是因为声音不像真人,而是我一直觉得:一旦切到 Voice,ChatGPT 就好像变弱了一点。

简单聊聊天没问题,但稍微复杂一点,我还是会想:

算了,打字吧。

最近 OpenAI 更新了新一版 Voice,我重新用了几次,第一次真的有点被 impress 到。

我现在依然绝大多数时候都在打字。Voice 和文字的使用比例,可能连 1:100 都不到。

但有一个变化很明显:

以前有些生活场景,我根本不会想到打开 ChatGPT;现在我开始会用 Voice。

这次 Voice 到底变了什么?

我自己的体验毕竟有限,所以后来也去看了 OpenAI 这轮到底更新了什么。

还真不只是“声音更自然了”。

1. 对话终于没那么像轮流发语音了

7 月 OpenAI 推出了新的 GPT-Live。

一个很重要的变化是 full-duplex:它可以持续听你说话,同时判断什么时候该回答、什么时候继续听。

这听起来很技术,但落到使用体验里其实很好懂。

人讲话不会像填写表单一样:

你说完一句 → 停止 → 对方完整回答 → 再轮到你。

我们会停顿,会想一下,会突然插话,也会说到一半改口。

新版 Voice 对停顿、打断、背景噪音、turn-taking 都做了优化。

所以这次我很明显的感受就是:

终于比较像在聊天,而不是轮流录音。

2. Voice 不需要自己硬扛所有复杂任务了

我觉得这是比“声音像不像真人”更重要的变化。

实时语音一直有一个矛盾:

你希望它马上回答,但越复杂的推理、搜索和任务,通常越需要时间。

新版 GPT-Live 的思路是让不同模型分工。

Voice 负责实时交流;遇到需要搜索、复杂推理或者更重的任务,可以交给后台更强的模型处理,再把结果带回当前对话。

也就是说:

负责跟你聊天的,和负责认真干活的,不一定非得是同一个模型。

这也解释了为什么这次语音和文字之间的“能力落差感”比以前小很多。

3. 它也终于能接上更多你原本就在 ChatGPT 里做的事情

现在 Live Voice 已经可以使用 web search 和 memory。

8 月又加入了 Files 和 Projects。

比如你本来就在一个 Project 里长期讨论某件事,现在可以直接开 Voice,继续参考这个 Project 里的 recent chats、sources 和 instructions,而不是从头交代一遍背景。

这一点对我很重要。

因为我平时很多事情本来就长期放在 ChatGPT 里:写作、产品、求职、学习,以及一些生活里的长期问题。

以前 Voice 最大的麻烦之一就是:

一开口,又要重新解释。

现在这种割裂感小了很多。

4. Voice 也开始进入“不只是聊天”的地方

最近我还注意到,ChatGPT 里越来越多地方出现了 Voice 入口,桌面端的 Work / Codex 也加上了语音。

这里需要区分一下:

普通 Chat Voice 目前并不是“你说句话,它就能调用所有 connected apps 和 plugins”。

但在 Work / Codex 这种 agentic 环境里,Voice 可以利用当前环境已有的 tools 和 permissions,启动任务、查看进度、调整正在做的事情。

这让我开始觉得,OpenAI 最近对 Voice 的定位可能正在发生变化。

以前的问题更像:

“AI 能不能和我自然地说话?”

现在开始变成:

“当我的手和眼睛正在做别的事情时,我还能让 AI 帮我做什么?”

但我并没有因此少打多少字

这点我觉得挺重要的。

我不认为 Voice 会替代文字,至少对我完全不是。

写文章、改简历、看代码、比较信息、核数字、做最后审核,我都更喜欢文字。

文字方便扫读、回看、修改,也更精确。

Voice 真正开始进入我的生活,反而是另一类场景。

比如:

散步的时候想事情。

以前如果脑子里突然有一个问题,我不会停在路边打十分钟字。

现在可以直接边走边聊。

模拟面试。

文字模拟面试当然也可以,但真实面试不是让你坐在那里慢慢组织一个完美答案。

Voice 可以一题一题问、继续追问,暴露出来的问题也更接近真实表达。

想把一件复杂的事情聊清楚。

有时候自己也还不知道问题到底是什么。

这种时候,与其先写一大段结构完整的 Prompt,我反而更喜欢直接讲,让它不断追问。

练习语言。

这可能是 Voice 最天然的场景之一。

不是让 AI 帮我“修改一句英文”,而是真的需要张嘴、组织语言、临场回答。

所以如果一定要总结我自己的使用方式,我现在会觉得:

文字更适合“产出和审核”,Voice 更适合“过程和互动”。

当然不是绝对,但这个区别对我很有用。

如果你想重新试 Voice,我会先试这几种

其实 Voice 不太需要复杂 Prompt。

比起规定最终输出格式,我觉得更重要的是提前告诉它:

我们接下来要怎么聊。

比如散步时整理思路:

我接下来会散步 20 分钟,想把 X 想清楚。一次只问我一个问题,不要急着给答案。你的回复尽量短一点,最后再帮我总结我真正纠结的几个问题。

模拟面试:

你现在是 X 岗位的面试官。一次问一题,根据我的回答继续追问。过程中不要提示我应该怎么答,面试结束以后再从内容、结构和表达三个方面给反馈。

想梳理一件让自己困扰的事情:

我想把一件事情讲清楚。先不要急着给建议,像访谈一样逐步问我,帮我区分事实、我的解释、感受和真正的需求,最后再总结。

或者你正在做饭、走路,没办法一直盯屏幕:

我现在不方便一直看屏幕。需要搜索时直接搜索,先用很短的话告诉我最重要的结论,详细信息留在聊天里,我之后再看。

我现在甚至觉得,Voice Prompt 和文字 Prompt 有一点不同:

文字里,我们经常定义“最终要产出什么”;Voice 里,更值得定义的是“我们接下来怎么互动”。

一次问几个问题、回答多长、什么时候追问、什么时候总结、什么时候才给建议。

这几个规则一说清楚,体验会好很多。

为什么偏偏是现在?

我不确定 OpenAI 内部到底把 Voice 放在多高的战略优先级,所以不想替他们下结论。

但从产品发展来看,我觉得现在确实到了一个比较合理的时间点。

因为几个条件终于同时成熟了一些:

语音交互本身够顺了;

ChatGPT 已经有 memory、search、Projects、files 这些长期 context;

复杂工作又可以交给后台模型和 agent 去完成。

所以 Voice 不再需要成为一个独立的“语音版 ChatGPT”。

它更像是现有 ChatGPT 能力的一扇新入口。

这也是为什么我觉得最近到处增加 Voice 入口这件事挺值得留意。

不是因为以后所有人都要对着电脑讲话。

而是以前很多使用 AI 的前提其实是:

你得停下正在做的事情,拿起手机或者坐到电脑前,开始打字。

Voice 开始把这个前提拿掉了一部分。

如果你一年前也试过 ChatGPT Voice,然后觉得鸡肋,我觉得现在值得重新打开一次。

不用强迫自己把原来的打字习惯改掉。

找一个本来就不适合打字的场景试试:

散步、做饭、开车前后、练面试、练口语,或者只是脑子里有件事情想边说边想。

至少对我来说,Voice 这次真正开始变得有用,就是从这些小场景开始的。