每日速览
OpenAI 发布 GPT-4o,文本、视觉与语音进入端到端实时多模态
摘要
2024年5月13日,OpenAI发布GPT-4o,其中“o”代表omni。与此前语音模式依赖语音转文字、语言模型回答、再将文字转语音的三模型流水线不同,GPT-4o以单一神经网络端到端处理文本、图像和音频,并面向实时视频交互设计。OpenAI披露其音频响应最快为232毫秒、平均320毫秒,接近自然人类对话时间;文本和代码能力约等同GPT-4 Turbo,非英语文本、视觉和音频理解有所提升,API速度约为前代两倍、价格降低50%。这些能力和性能数据来自OpenAI发布评估,应保留厂商归因。发布当天,文本与图像能力开始进入ChatGPT免费版和付费版,开发者API最初也只开放文本与视觉,新的实时语音和视频能力随后分阶段测试。GPT-4o的重要意义在于把低延迟、情绪语音、视觉理解和通用推理汇入同一模型,推动AI助手从文字聊天走向自然实时交互。
内容由花盆 AI 编辑整理,仅作信息索引;事实与完整内容以原始来源为准。
查看原文