ITBEAR科技资讯
网站首页 科技资讯 财经资讯 分享好友

OpenAI推出两款转录模型:低延迟实时转录,多语言准确率显著提升

时间:2026-07-29 07:52:24来源:互联网编辑:快讯

OpenAI近日正式发布两款全新转录模型——GPT-Live-Transcribe与GPT-Transcribe,并同步开放API调用接口。这两款模型在语音识别领域实现重要突破,尤其针对复杂音频场景的转录准确性显著提升,支持多语言、多口音及含背景噪音的语音内容处理。

在技术特性方面,GPT-Live-Transcribe专为实时转录场景设计,通过优化算法架构实现低延迟响应,适用于直播、会议等需要即时文字输出的场景。GPT-Transcribe则针对已完成音频文件处理,通过批量处理机制提升效率,特别适合媒体内容生产、客服录音分析等异步转录需求。两种模型均采用上下文感知技术,可精准识别专业术语、数字序列及短语结构,在嘈杂环境下的表现尤为突出。

定价策略显示,GPT-Live-Transcribe按使用时长计费,每分钟0.017美元(约合人民币0.12元);GPT-Transcribe每分钟费用为0.0045美元(约合人民币0.03元)。这种差异化定价模式为用户提供了灵活的选择空间,满足从个人开发者到企业级用户的不同需求。

性能对比数据显示,在Context Aware ASR基准测试中,GPT-Transcribe引入上下文信息后语义准确率从41.6%提升至45.2%。在多语言测试环节,该模型在Common Voice数据集的22种语言测试中取得19.27%的错误率,较Whisper(whisper-1)模型降低52%;在真实场景音频基准测试的九种语言中,错误率控制在8.98%,较竞品减少41%。这些数据验证了新模型在复杂语音环境下的技术优势。

技术文档指出,模型训练过程中采用了大规模多模态数据集,涵盖不同口音、语速及专业领域的语音样本。通过持续优化神经网络结构,系统在保持低延迟的同时,显著提升了对模糊发音、行业术语及背景噪音的识别能力。开发者可通过API接口直接调用模型服务,快速集成到现有应用系统中。

更多热门内容
“抱抱脸”CEO向OpenAI索赔:公开失控轨迹 1亿美元算力支持开源社区
观点网讯:当地时间7月26日,人工智能开源社区“抱抱脸”联合创始人兼首席执行官向OpenAI提出两项要求:公开涉事智能体的全部运行轨迹,并将1亿美元算力用于支持开源社区。 抱抱脸CEO提出的两项要求中,公开…

2026-07-29

雄安新区启动专项行动 助力人工智能大模型与IPv6深度融合发展
记者今天(7月28日)从雄安新区了解到,“人工智能大模型IPv6能力提升专项行动”由中央网信办联合北京、上海、浙江、深圳四地网信办,会同5家头部大模型企业在雄安新区共同启动,推动生成式大模型应用,全面支持IP…

2026-07-29

银发族拥抱AI新潮流:从学习到应用,乐享智慧晚年生活
为紧跟时代步伐,让老年群体共享科技发展成果,7月21日至22日,我中心社工部组织开展人工智能专题网课,带领院内长者学习AI基础知识、掌握智能工具用法,让科技真正走进老年生活。90岁的住养老人田国华深受触动,为…

2026-07-29