OpenAI近日遭遇持续服务异常,其核心产品API、ChatGPT及Codex在7月25日集体出现故障,导致31个服务组件性能下降,中断时长超过1小时50分钟。此次事件并非孤立案例,第三方监测数据显示,自7月中旬以来,该平台已连续17天未实现完全稳定运行,引发行业对AI服务可靠性的深度关注。
根据公开状态记录,7月25日17时17分,OpenAI首次披露多项服务错误率攀升,随后在1小时内分阶段实施缓解措施,最终于19时08分宣布全面恢复。受影响组件涵盖API的12个模块、ChatGPT的15个模块及Codex的4个模块,第三方监测平台记录的事故时间与官方披露完全吻合。用户反馈显示,服务中断期间出现请求失败、响应延迟及任务中断等问题,其中Codex的编程任务中断尤为严重,部分大型项目因服务中断面临烂尾风险。
持续异常的服务状态已成为OpenAI近期的显著特征。第三方监测平台Bifrost的统计显示,7月9日至25日期间,该平台未出现单日完全正常的记录,其中7月12日和16日发生两次重大中断,其余日期则在性能降级与部分服务中断间反复波动。另一监测机构incidenthub的记录显示,仅7月23日当天就发生四起独立故障,涉及ChatGPT的错误率与延迟问题,24日Codex审核功能报错,25日则演变为全产品线崩溃。
对于故障频发的原因,官方尚未作出明确说明。行业分析认为,夏季推理负载持续攀升、新模型与功能迭代加速,可能导致基础设施长期处于超负荷运转状态。这种推测虽未获证实,但已引发市场对AI服务架构承载能力的质疑。监测平台下方出现的"自动路由至替代模型"广告,折射出多模型容灾方案正成为新兴商业需求。
与两年前ChatGPT宕机仅影响聊天体验不同,当前API服务已深度嵌入企业生产系统。客服机器人、代码生成流水线、自动化审计等场景对服务连续性要求极高,111分钟的中断直接导致生产线停滞。这种变化使得服务水平协议(SLA)成为企业AI选型的核心指标——模型能力差异可通过百分比量化,而服务中断造成的损失却是全额的。
当前市场正形成两大趋势:其一,多云多模型路由架构从可选配置升级为必要组件,企业对单一供应商的依赖风险被重新评估;其二,海外旗舰平台故障期间,国产模型迎来承接溢出需求的战略机遇,但前提是自身稳定性需通过同等负载压力测试。尽管OpenAI工程团队预计将在近期发布技术复盘,但连续17天的异常记录已使市场期待远超"错误率升高"的简单解释。