本地生活 · 深度阅读

OpenAI发布两款转录模型,分别侧重实时低延迟与上下文理解能力

OpenAI于7月29日宣布推出GPT-Live-Transcribe和GPT-Transcribe两种转录模型,均可通过API调用。GPT-Live-Transcribe专为低延迟实时场景设计,而GPT-Transcribe则适用于优化已完成音频的异步处理。官方指出,这两种模型在理解上下文、应对不同口音及语言方面表现更佳,并在多个行业基准测试中展示了优于现有模型的性能。

OpenAI公司于7月29日宣布推出GPT-Live-Transcribe和GPT-Transcribe两种转录模型,并且支持通过API的方式调用这些新模型。此次发布标志着OpenAI在语音转写技术领域进行了重要升级,旨在为用户提供更专业化、场景化的解决方案。

从产品定位来看,OpenAI公司将功能划分到了两个不同的模型中。GPT-Live-Transcribe被明确设计用于低延迟的实时转录需求,这使其非常适合需要即时反馈的应用场景。与之相对,GPT-Transcribe则侧重于优化已完成音频文件和批量工作负载的异步转录任务。

在成本结构方面,用户可以根据使用场景选择合适的模型进行计费。据公开资料显示,GPT-Live-Transcribe的转录费用为每分钟0.017美元;而GPT-Transcribe的转录费用则设定为每分钟0.0045美元。

除了延迟和工作流的区分外,OpenAI官方还强调了这两种转录模型在核心能力上的提升。OpenAI公司表示,上述两种转录模型可以更好地理解上下文,并且能够在各种口音和语言的真实世界音频上提供更准确的转录效果。这种对上下文的增强理解是本次发布的一个关键亮点。

从技术性能的佐证来看,GPT-Transcribe在多个基准测试中展现出显著优势。例如,在Context Aware ASR基准测试中,GPT-Transcribe的语义准确率从无自由形式上下文的41.6%提升到了有上下文的45.2%。此外,在Common Voice的22种语言上,GPT-Transcribe的转录错误率为19.27%,这一数据显著低于Whisper (whisper-1) 的40.37%。

更进一步地考察真实世界音频的处理能力,在包含九种语言的真实世界音频录制基准测试中,GPT-Transcribe的转录错误率达到了8.98%,而Whisper (whisper-1) 在该项测试中的错误率为15.21%。这些数据对比清晰地展示了OpenAI公司新模型在处理复杂、多变真实语音环境时的优越性。

时间线回顾显示,此次发布发生在7月29日。这表明OpenAI正在持续迭代其核心AI能力,将转录技术从单纯的文本匹配提升到了具备深度语义理解和场景适应性的层面。对于开发者而言,这意味着可以根据应用对实时性、准确性和处理批次大小的不同需求,选择最合适的API调用路径。

背景分析指出,随着远程会议、多媒体内容创作以及智能客服等领域对语音转写需求的爆发式增长,市场对“低延迟”和“高上下文理解力”的要求达到了前所未有的高度。OpenAI公司通过推出区分实时流处理(GPT-Live-Transcribe)和离线批处理(GPT-Transcribe)的策略,精准地切入了当前行业痛点。

影响分析方面,对于依赖语音转写作为数据输入源的企业而言,选择合适的模型将直接决定后续流程的准确性和效率。例如,如果应用场景是直播字幕或实时会议记录,应优先考虑GPT-Live-Transcribe;若处理的是大量历史录音库的整理和归档,则GPT-Transcribe可能更具成本效益和优化潜力。

读者提示:对于计划集成语音转写功能的开发者而言,建议参考OpenAI公司提供的API文档,并利用其在不同场景下的性能数据(如Context Aware ASR或真实世界音频基准)来对自身业务流程进行压力测试和模型选型验证。

信息来源

本文基于上述公开资料整理,未使用来源页面的图片、视频或嵌入媒体。