ChatGPT Voice:用说话来指挥任务
ChatGPT Voice 的可用范围、如何开始一次语音对话、它与语音听写的区别、如何用它调度多个任务,以及 macOS 上的屏幕上下文该怎么谨慎使用。
适用平台
- ChatGPT 桌面应用(Chat / Work / Codex)
- iOS 上的 Remote(配对桌面主机后)
官方文档怎么说
ChatGPT Voice 由 GPT-Live 驱动,让你在 ChatGPT 桌面应用的 Chat、Work 和 Codex 中通过说话讨论想法和协调任务。
ChatGPT VoiceChatGPT Voice 在 ChatGPT 桌面应用中面向 ChatGPT Plus、Pro、Business、Edu 和 Enterprise 套餐可用;Enterprise 和 Edu 的可用性从为期两周的早期访问期开始,之后才默认可用。
ChatGPT Voice与桌面主机配对之后,也可以通过 iOS 上的 Remote 使用 ChatGPT Voice。
ChatGPT Voice开始方式是在已有任务中选择 Start voice chat,或在新对话或任务中选择 Start new voice chat;第一次使用需要允许麦克风访问、选择一个声音,并在 macOS 上审阅屏幕上下文。
ChatGPT Voice可以在 Settings > Voice > Voice chat hotkey 设置快捷键。
ChatGPT VoiceChatGPT Voice 支持自然的轮流对话,你可以在它回应过程中打断、追问或改变方向。
ChatGPT VoiceChatGPT Voice 可以为较长的工作启动独立任务、检查已有任务并发送后续指令,并把进展、阻塞和结果带回语音对话。
ChatGPT Voice可以要求切换到另一个 Codex 任务再切回来;目标任务必须支持语音且在已连接的主机上可用。
ChatGPT VoiceChatGPT Voice 遵循与它所指挥的任务相同的权限设置。
ChatGPT Voice在 macOS 上,可以在 Settings > Voice 打开 Screen context,ChatGPT 便可以对你最前面的窗口拍一张 appshot 并用作上下文;你所在的组织可以禁用这项能力。
ChatGPT Voiceappshot 可以包含窗口的图像和可访问文本,包括可见滚动区域之外的内容;官方提醒避免共享含敏感信息的窗口。
ChatGPT VoiceChatGPT 桌面应用中同一时间只能有一个语音对话处于活动状态;语音对话使用单独的、依套餐而定的额度,按滚动的五小时窗口计量。
ChatGPT Voice通过 Voice 启动的任务仍然消耗你的 Codex 使用预算。
ChatGPT Voice
它的真正用途是"调度",不是"朗读"
ChatGPT Voice 由 GPT-Live 驱动,让你在 ChatGPT 桌面应用的 Chat、Work 和 Codex 中通过说话讨论想法、协调任务。官方给它的定位是:启动工作、检查进度或改变方向,而不必切回打字。
这句话里最有价值的是"改变方向"。语音的优势不在于输入更快,而在于你可以在事情正在进行的时候插手。
可用范围
ChatGPT Voice 在 ChatGPT 桌面应用中面向 Plus、Pro、Business、Edu 和 Enterprise 套餐可用。Enterprise 和 Edu 的可用性从为期两周的早期访问期开始,之后才默认可用。
此外,与桌面主机配对之后,也可以通过 iOS 上的 Remote 使用它。
可用性同样取决于灰度状态和工作区设置。
开始一次语音对话
- 在桌面应用中打开你想讨论的 Codex 任务,或者开一个新对话或新任务。
- 在已有任务中选择 Start voice chat,在新对话或任务中选择 Start new voice chat。
- 第一次使用时:允许麦克风访问、选择一个声音,并在 macOS 上审阅屏幕上下文。
- 开始说话。结束时选择 Stop voice chat。
想更快进入,可以在 Settings > Voice > Voice chat hotkey 设置一个快捷键。
有一个正在变化的行为值得知道:在已有 Codex 任务中使用语音正在灰度推出。可用时,你可以在一个以打字开始的任务里直接开口说话——语音会使用该任务的对话和已选模型来执行你的请求,所以你可以讨论它的进展或改变方向,而不必另起一个任务。
如果已有任务里找不到 Start voice chat,官方给的处理顺序是:更新桌面应用和跑这个任务的 Codex 主机;可用性还取决于你的账号和工作区。你仍然可以在支持的地方新起一个语音对话,或者用语音听写输入提示词文本。想恢复一次早先的语音对话,打开它并选择 Start voice chat。
打断它是设计内的用法
ChatGPT Voice 支持自然的轮流对话。你可以在它回应过程中打断、追问或改变方向。如果 ChatGPT 开始干活了,继续说话就能检查进度或调整任务方向。
这一点和打字交互有本质区别——打字时你通常得等它写完。语音里"插嘴"是被支持的行为,不是干扰。
调度多个任务
这是 Voice 最容易被低估的能力。它可以:
- 为较长的工作启动独立任务
- 检查已有任务
- 发送后续指令
- 把进展、阻塞和结果带回你的语音对话
官方给的三个例句就是典型用法:
- "审阅今天的发布简报,总结需要审批的决策。"
- "启动一个 Codex 任务去跑测试,并排查任何没通过的项。"
- "检查活跃任务,总结任何阻塞进度的问题。"
还有一个更进一步的用法:你可以要求切换到另一个 Codex 任务,再切回来。比如说"让我跟正在审阅测试的那个任务说话",然后说"把我带回上一个任务"。前提是目标任务支持语音,且在已连接的主机上可用。
权限方面不用额外担心:ChatGPT Voice 遵循与它所指挥的任务相同的权限设置,语音不会绕过你已有的审批和沙箱配置。
屏幕上下文:好用,但要看清代价
在 macOS 上,打开 Settings > Voice 里的 Screen context,然后说"看一下这个",ChatGPT 就可以对你最前面的窗口拍一张 appshot 并用作上下文。
官方在同一段给了三条提醒,都值得当真:
- appshot 可以包含窗口的图像和可访问文本,包括可见滚动区域之外的内容。
- macOS 可能会请求 Screen & System Audio Recording 与 Accessibility 权限。
- 避免共享含敏感信息的窗口,包括可见滚动区域之外的文本。
第一条和第三条要连起来读:你看到的窗口内容不等于 appshot 里的全部内容。一个滚动到中间的长文档,看不见的部分也可能被一起带走。
你所在的组织可以禁用这项能力。
限制与排查
同一时间只能有一个语音对话处于活动状态(跨整个 ChatGPT 桌面应用)。
用量上有两层,容易混淆:
- 语音对话使用单独的、依套餐而定的额度,按滚动的五小时窗口计量。
- 通过 Voice 启动的任务仍然消耗你的 Codex 使用预算。
达到任一限制时 ChatGPT 会通知你。
开不了语音对话时的排查顺序:先确认 ChatGPT Voice 对你的套餐、灰度和工作区可用;再检查麦克风权限;再确认是否已经有一个语音对话在另一个应用窗口中活动。屏幕上下文不可用时,检查 Settings > Voice、Appshots 权限,以及你所在组织的限制。
实际操作
- 在 ChatGPT 桌面应用中打开你想讨论的 Codex 任务,或者开一个新对话或新任务。
- 在已有任务中选择 Start voice chat,在新对话或任务中选择 Start new voice chat。
- 第一次使用时允许麦克风访问、选择一个声音,并在 macOS 上审阅屏幕上下文。
- 开始说话;结束时选择 Stop voice chat。
- 需要更快进入时,在 Settings > Voice > Voice chat hotkey 设置快捷键。
- 想让它看你屏幕上的东西时,在 macOS 的 Settings > Voice 打开 Screen context,然后说"看一下这个"。
Windows 步骤
- 官方把 ChatGPT Voice 描述为 ChatGPT 桌面应用中的能力,可用套餐为 Plus、Pro、Business、Edu 和 Enterprise,并未按操作系统作出区分。
- 但屏幕上下文(Screen context)在官方文档中被明确限定为 macOS 上的能力,Windows 上不适用该段说明。
- 若在你的桌面应用中找不到语音入口,按官方排查顺序处理:确认套餐、灰度和工作区是否支持,检查麦克风权限,并确认是否已有另一个应用窗口中的语音对话在进行。
手机步骤
- 官方说明:与桌面主机配对之后,可以通过 iOS 上的 Remote 使用 ChatGPT Voice。
- 因此手机端的用法依赖已配对的桌面主机,而不是手机独立提供该能力。
- 官方这一段只提到 iOS,未提及 Android,本教程不对 Android 上的行为作出陈述。
使用案例
- 边走边让它审阅当天的发布简报,并总结出需要审批的决策。
- 用一句话启动一个 Codex 任务去跑测试并排查失败项。
- 询问当前活跃任务的情况,并总结出正在阻塞进度的问题。
常见错误
- 把 ChatGPT Voice 和语音听写混为一谈。前者是与 ChatGPT 的实时对话,后者只是把语音转成提示词文本再发送。
- 已有任务里找不到 Start voice chat 就以为功能坏了。官方说明"在已有 Codex 任务中使用语音"正在灰度推出,需要更新桌面应用和跑这个任务的 Codex 主机。
- 在含敏感信息的窗口上使用屏幕上下文。appshot 可以包含可见滚动区域之外的文本。
- 同时开多个语音对话。官方明确同一时间只能有一个处于活动状态。
常见问题
- ChatGPT Voice 和语音听写有什么区别?
- 官方的划分很清楚:用 ChatGPT Voice 进行与 ChatGPT 的实时对话;只是想把语音转成提示词文本再发送时,用语音听写。
- 它能同时管理多个任务吗?
- 可以。官方说明 ChatGPT Voice 可以为较长的工作启动独立任务、检查已有任务并发送后续指令,并把进展、阻塞和结果带回语音对话,让你在工作继续进行的同时继续说话。你还可以要求切换到另一个 Codex 任务再切回来,例如说"让我跟正在审阅测试的那个任务说话",然后说"把我带回上一个任务"。目标任务必须支持语音且在已连接的主机上可用。
- 屏幕上下文安全吗?
- 需要你自己判断范围。在 macOS 上打开 Settings > Voice 里的 Screen context 之后,ChatGPT 可以对你最前面的窗口拍一张 appshot 并用作上下文。官方提示 appshot 可以包含窗口的图像和可访问文本,**包括可见滚动区域之外的内容**,macOS 可能会请求 Screen & System Audio Recording 与 Accessibility 权限,并明确建议避免共享含敏感信息的窗口。你所在的组织可以禁用这项能力。
- 有用量限制吗?
- 有两层。语音对话使用单独的、依套餐而定的额度,按滚动的五小时窗口计量;而通过 Voice 启动的任务仍然消耗你的 Codex 使用预算。达到任一限制时 ChatGPT 会通知你。
- 它的权限是怎样的?
- 官方说明 ChatGPT Voice 遵循与它在桌面应用的 Chat、Work 和 Codex 中所指挥的任务相同的权限设置。也就是说语音不会绕过你已有的审批与沙箱配置。