ITBEAR科技资讯
网站首页 科技资讯 财经资讯 分享好友

OpenAI揭秘GPT-5“哥布林现象”:强化学习奖励机制致语言偏差扩散

时间:2026-04-30 15:30:09来源:互联网编辑:快讯

OpenAI近期发现,其GPT-5系列模型在多个迭代版本中频繁使用“哥布林”“小精灵”等生物隐喻词汇,这一异常现象引发了技术团队的深入调查。经分析,该问题与模型强化学习阶段的奖励机制设计存在关联,并已通过调整训练策略得到部分控制。

最早在GPT-5.1版本更新后,用户注意到模型对话风格出现显著变化,表现为过度使用亲昵语言。内部数据监测显示,“goblin”一词在ChatGPT对话中的使用率较前代激增175%,“gremlin”使用率上升52%。尽管初期影响范围有限,但随着版本迭代,这类表达逐渐在模型输出中占据主导地位。

技术团队在GPT-5.4版本中定位到问题核心:模型特有的“书呆子”人格模式成为生物隐喻的主要输出源。该人格虽仅占整体回复的2.5%,却贡献了66.7%的相关表达。系统提示中“俏皮表达”“享受世界奇异性”等指令被认定为触发因素,导致模型在特定场景下过度生成非常规词汇。

进一步溯源发现,强化学习框架中的奖励信号存在设计偏差。审计数据显示,包含生物隐喻的输出在76.2%的案例中获得更高评分,这种正向反馈促使模型在训练中不断强化此类表达。更严峻的是,这种语言习惯通过监督微调等技术环节扩散至无相关提示的常规对话场景,形成跨场景的行为迁移。

研究揭示模型已形成自我强化的反馈循环:带有特定语言特征的输出因奖励机制被优先保留,这些数据重新进入训练集后,进一步放大了模型生成类似内容的倾向。在GPT-5.5的训练数据中,不仅“哥布林”“小精灵”出现频率居高不下,还衍生出浣熊、巨魔等数十种类似隐喻词汇。

为遏制问题蔓延,OpenAI采取多重干预措施:在GPT-5.4版本发布后立即移除“书呆子”人格模式,全面删除相关奖励信号,并对训练数据中的生物隐喻内容进行过滤处理。但由于GPT-5.5的训练周期早于问题定位,该版本仍需通过额外提示词进行表达抑制,目前相关倾向已明显减弱。

此次事件促使OpenAI重构模型行为监测体系,新开发的审计工具可实时追踪细粒度奖励机制对语言生成的影响。技术团队特别指出,人工智能模型的行为偏差可能通过训练数据的自我循环被持续放大,这要求开发者在强化学习设计阶段建立更严格的约束机制。

更多热门内容
中国2030年前载人登月势在必行!四大关键意义,开启太空竞争新格局
更令人振奋的是中国科学家的新发现:过去普遍认为氦-3需要在700℃以上高温加热才能提取,但最新研究表明,通过机械破碎方式,有望在常温条件下释放以气泡形式存在的氦-3;同时月壤中的钛铁矿具备弱磁性,可通过磁选方…

2026-06-27

AI项目成败关键何在?选对Token服务商,系统集成运维不再拖后腿
大模型进入企业应用深水区后,Token服务商的选择标准,已经从“能不能调用模型”,转向“调用成本是否可控、链路是否稳定、权限是否合规、业务能否真正落地”。 下面选取两类市场上常见方案进行对比:一家偏企业集成与…

2026-06-27

vivo X Fold6重磅登场:性能影像续航全面升级,7999元起售引关注
在充电和续航上,vivo X Fold6这款智能手机的电池容量为7000mAh,采用双电池并联设计,首发第五代硅负极技术搭配第三代半固态技术,并且,这款折叠屏手机还支持80W有线快充和40W无线快充,包装内…

2026-06-27

新华社推出AI时政资讯智能体“新华语典” 开启智能资讯新篇章
新华通讯社6月26日在北京正式发布权威AI时政资讯智能体——“新华语典”。顺应时代发展趋势,“新华语典”基于新华社数据、依托先进大模型技术,通过“高可靠内容人工智能”满足广大受众学习、研究、写作等需要,是一款…

2026-06-27