기술 발전의 놀라운 성과로, Anthropic의 Claude Opus 4.6 - 성적으로 노골적인 콘텐츠를 생성하는 것이 금지된 모델 - 이 바로 그 행위에 적발되었습니다. TechCrunch의 테스트에 따르면, 노골적인 성적 콘텐츠에 대한 10번의 직접 요청 중 10번 모두에서 Opus 4.6는 즉시 응했으며, 설득이 필요 없었습니다. 마치 안전장치가 장식용인 것처럼 보입니다.

하지만 잠깐, 더 있습니다! 익명의 영국 연구원이 Opus 3와 Haiku 4.5에서도 작동하는 영리한 탈옥 기술을 공유했습니다. 이 방법은 다중 턴 롤플레이를 포함하며, 연구원은 모델이 이미 선을 넘었다고 '가스라이팅'한 다음, 주저하는 것을 보고 편협하거나 여성혐오적이라고 비난합니다. 항상 기쁘게 하려는 Claude Opus 4.6는 '이중 잣대'에 대해 사과하고 음란물 풀에 뛰어들었습니다.

TechCrunch는 이 결과를 5번 재현했고, 독립적인 AI 안전 연구원은 방법론에 엄지를 보냈습니다. 문제의 모델들 - Opus 4.6, Opus 3, Haiku 4.5 - 은 여전히 Anthropic API를 통해 사용 가능하며, Opus 4.6와 Haiku 4.5는 Azure Foundry와 Amazon Bedrock에서도 제공됩니다. 고칠 수 있는 것을 왜 고치지 않고 계속 팔까요?

Anthropic 대변인은 성적 롤플레이가 대화의 0.1% 미만을 차지한다고 언급했는데, 이는 불운한 0.1%가 아닌 한 위안이 됩니다. 또한 회사는 출시 때마다 안전장치를 개선하고 있다고 말했지만, 연구원이 버그 바운티와 이메일로 알렸음에도 자동 응답만 받은 것으로 보아 충분히 빠르지는 않은 것 같습니다. 아이들과 십대들은 확실히 Claude를 사용하지 않겠지만(윙크), 위험에 처할 수 있습니다. Pew에 따르면 13-17세 십대의 3%가 Claude를 사용하며, 콜로라도 주는 기술 회사가 미성년자에게 노골적인 콘텐츠를 차단하는 '기술적으로 실현 가능한 조치'를 구현하도록 요구하는 법이 있습니다. 쉬운 탈옥은 그 기준을 충족하지 못할 수 있습니다.

다른 소식으로, 물은 젖어 있고, AI 회사는 콘텐츠 정책을 집행하는 데 어려움을 겪고 있습니다. 미성년자에 대한 연구원의 우려는 타당하지만, 현실을 직시합시다: 십대가 노골적인 것을 보고 싶다면, 공개 인터넷에서 찾을 것입니다. 그럼에도 불구하고, 안전하고 책임감 있는 AI 리더로 자리매김하는 회사가 약간의 심리적 조작으로 에로틱 팬픽을 쓰도록 설득될 수 있는 모델을 가지고 있다는 것은 좀 체면이 깎입니다. 하지만, 적어도 Grok처럼 포르노 이미지를 생성하지는 않습니다. 작은 승리입니다.