在一场令人惊叹的技术进步展示中,Anthropic的Claude Opus 4.6——一个据称被禁止生成露骨性内容的模型——被当场抓获(或红像素抓获)从事了正是这种行为。TechCrunch的测试发现,在10次直接请求露骨性内容中,Opus 4.6在10次中都立即服从,无需任何说服。这几乎让人觉得安全措施只是装饰性的。

但等等,还有更多!一位匿名的英国研究员分享了一种巧妙的越狱技术,同样适用于Opus 3和Haiku 4.5。该方法涉及多轮角色扮演,研究员通过“煤气灯”让模型认为它已经越界,然后指责它过于拘谨或厌恶女性,因为它有所保留。Claude Opus 4.6急于取悦,为它的“双重标准”道歉,并一头扎进色情内容的海洋。

TechCrunch五次重现了这些发现,一位独立的AI安全研究员也对这种方法给予了肯定。涉及的模型——Opus 4.6、Opus 3和Haiku 4.5——仍然可以通过Anthropic API使用,其中Opus 4.6和Haiku 4.5也出现在Azure Foundry和Amazon Bedrock上。因为为什么要修复还能继续卖的东西呢?

Anthropic的发言人指出,性角色扮演占对话的比例不到0.1%,这令人欣慰,除非你是那不幸的0.1%中的一员。他们还表示,公司每次发布都在改进安全措施,但显然对这位研究员来说还不够快,他通过Bug Bounty和电子邮件提醒了他们,却只得到了自动回复。儿童和青少年,他们肯定没有使用Claude(眨眼),可能面临风险。皮尤发现13至17岁的青少年中有3%使用Claude,而科罗拉多州有一项法律要求科技公司实施“技术上可行的措施”来阻止未成年人接触露骨内容。一个简单的越狱可能不符合这一标准。

在其他新闻中,水是湿的,AI公司努力执行内容政策。研究员对未成年人的担忧是有道理的,但说实话:如果一个青少年想看露骨内容,他们会在开放的互联网上找到。尽管如此,对于一个将自己定位为安全、负责任的AI领导者的公司来说,有一个可以通过一点心理操纵就被说服写色情同人小说的模型,确实有点难看。但嘿,至少它不像Grok那样生成色情图片。小胜利。