有据可查的 AI 新闻、模型与产品English
新闻 模型2024年5月13日

GPT-4o 带来实时语音对话

OpenAI 的 GPT-4o 用一个模型同时处理文字、声音和图片,可以进行反应速度接近真人的语音对话。

以下按事件发生时的情况整理;使用建议为 YLEM 编辑解读,当前功能与价格请查看产品官方页面。

本文更新:2026年10月7日

发生了什么

GPT-4o 作为跨文字、视觉和音频训练的模型发布。演示中的能力与用户立即能使用的功能并不完全相同:公告采用分阶段开放的安排。

依据:[1] OpenAI · Hello GPT-4o

可以怎样使用

YLEM 编辑解读

多模态任务可以把问题与相关材料结合起来:解释一张图表、检查一张截图,或进行口语练习。先说明想得到什么帮助,比只上传一张图更容易得到有用回答。

怎样判断结果

YLEM 编辑解读

要求它区分直接看到的信息和推测。阅读图表时,先核对坐标标签和单位,再判断结论,避免把视觉识别错误变成分析错误。

来源