OpenAI近日正式发布两款全新转录模型——GPT-Live-Transcribe与GPT-Transcribe,并同步开放API调用接口。这两款模型在语音识别领域实现重要突破,尤其针对复杂音频场景的转录准确性显著提升,支持多语言、多口音及含背景噪音的语音内容处理。
在技术特性方面,GPT-Live-Transcribe专为实时转录场景设计,通过优化算法架构实现低延迟响应,适用于直播、会议等需要即时文字输出的场景。GPT-Transcribe则针对已完成音频文件处理,通过批量处理机制提升效率,特别适合媒体内容生产、客服录音分析等异步转录需求。两种模型均采用上下文感知技术,可精准识别专业术语、数字序列及短语结构,在嘈杂环境下的表现尤为突出。
定价策略显示,GPT-Live-Transcribe按使用时长计费,每分钟0.017美元(约合人民币0.12元);GPT-Transcribe每分钟费用为0.0045美元(约合人民币0.03元)。这种差异化定价模式为用户提供了灵活的选择空间,满足从个人开发者到企业级用户的不同需求。
性能对比数据显示,在Context Aware ASR基准测试中,GPT-Transcribe引入上下文信息后语义准确率从41.6%提升至45.2%。在多语言测试环节,该模型在Common Voice数据集的22种语言测试中取得19.27%的错误率,较Whisper(whisper-1)模型降低52%;在真实场景音频基准测试的九种语言中,错误率控制在8.98%,较竞品减少41%。这些数据验证了新模型在复杂语音环境下的技术优势。
技术文档指出,模型训练过程中采用了大规模多模态数据集,涵盖不同口音、语速及专业领域的语音样本。通过持续优化神经网络结构,系统在保持低延迟的同时,显著提升了对模糊发音、行业术语及背景噪音的识别能力。开发者可通过API接口直接调用模型服务,快速集成到现有应用系统中。