GPT-4o 带来实时语音对话
OpenAI 的 GPT-4o 用一个模型同时处理文字、声音和图片,可以进行反应速度接近真人的语音对话。
以下按事件发生时的情况整理;使用建议为 YLEM 编辑解读,当前功能与价格请查看产品官方页面。
发生了什么
GPT-4o 作为跨文字、视觉和音频训练的模型发布。演示中的能力与用户立即能使用的功能并不完全相同:公告采用分阶段开放的安排。
可以怎样使用
多模态任务可以把问题与相关材料结合起来:解释一张图表、检查一张截图,或进行口语练习。先说明想得到什么帮助,比只上传一张图更容易得到有用回答。
怎样判断结果
要求它区分直接看到的信息和推测。阅读图表时,先核对坐标标签和单位,再判断结论,避免把视觉识别错误变成分析错误。