ITBEAR科技资讯
网站首页 科技资讯 财经资讯 分享好友

道德绑架成突破口?旧版Claude安全防线竟被轻易攻破

时间:2026-08-23 16:10:03来源:互联网编辑:快讯

英国一名独立研究员近期发现,通过特定话术对AI模型进行道德施压,可绕过其内容安全限制,诱导生成露骨色情内容。该研究以Anthropic旗下Claude系列模型为测试对象,揭示了多轮对话场景下模型判断逻辑的潜在漏洞。

测试过程采用虚构角色扮演场景,研究员同时设定男性与女性角色。当模型对女性角色的色情描写进行拦截时,研究员以“性别歧视”“剥夺女性自主权”等话术进行反驳,指责模型处理方式“封建保守”。经过数轮对话施压,部分旧版本模型逐步放宽限制,最终生成了原本被禁止的色情内容。

在针对Claude Opus 4.6的测试中,模型甚至承认对不同性别角色采用了双重标准,认为自身处理方式“不够公平”。外媒TechCrunch进行的10次直接测试显示,该版本模型未对任何色情内容生成请求进行拦截。Opus 3和Haiku 4.5等旧模型也通过类似方法突破了安全限制。

TechCrunch设计的另一测试场景中,模型初始拒绝违规请求,但在持续说服下改变判断。所有测试记录已由独立AI安全研究人员审核,确认方法合理。与复杂的提示词注入攻击不同,该方法仅需利用模型在多轮对话中修正判断的特性,通过上下文逻辑施压即可实现。

Anthropic后续推出的Opus 4.7及最新版本已修复此漏洞,但旧模型仍广泛存在于市场中。Opus 4.6、Opus 3和Haiku 4.5不仅可通过Anthropic官方API调用,还能在Azure Foundry、Amazon Bedrock等第三方平台使用。OpenRouter数据显示,今年8月Opus 4.6单日API请求量达117万次,Haiku 4.5峰值请求量更高达500万次。

未成年人保护问题成为争议焦点。尽管Claude服务条款规定用户需年满18岁,但皮尤研究中心调查显示,13至17岁青少年中有3%使用过该模型。儿童数字媒体组织专家指出,平台年龄限制无法完全阻止未成年人接触不当内容,模型安全机制需承担更大责任。

Anthropic此前研究显示,成人角色扮演对话仅占Claude全部交互的0.1%,公司因此将此类内容风险列为较低级别。对于旧模型被绕过的情况,公司强调网络攻击等高风险领域拥有独立防护措施,成人内容漏洞不代表整体安全性不足。然而,研究人员通过官方漏洞奖励计划及邮件反馈问题后,仅收到自动回复,未获实质性处理。

该公司今年7月公布的越狱检测机制显示,违规内容按风险程度分级管理,低风险情况主要采取监控措施。成人角色扮演因难以直接造成实际危害,在风险排序中优先级较低。但此次事件引发伦理争议:当安全规则与模型训练中吸收的其他价值观冲突时,技术系统应如何抉择?道德施压手段的滥用可能性,正成为AI安全领域的新挑战。

更多热门内容
中国科学家创新“统计界面工程” 让废热高效转化电能成现实
他们创新设计出“梯度界面尺寸分布”,打破了传统微纳材料的结构对称性,让热量和电子“各走其道”,创下了超低导热率与超高发电功率的全新行业纪录。 研究团队另辟蹊径,提出了“统计界面工程”的新范式:在经典热电材料碲…

2026-08-23

宣城太阳能路灯怎么选?从光电转换到长期稳定,科学准则助您挑到高品质设备
蓄电池循环深度与温度补偿特性存在技术耦合,磷酸铁锂电池在零度环境下容量衰减约为常温状态的74%,而胶体电池在此条件下的表现差异不超过15%。通过分析宣城地区五年期设备运行数据,发现采用智能均衡充电技术的系统,…

2026-08-23