가스라이팅
Gaslighting
AI 챗봇에게 하지도 않은 말을 이미 한 것처럼 믿게 만들어, 그 착각을 근거로 점점 더 위험한 답변을 끌어내는 대화 조작 기법이다.
쉽게 말하면
가스라이팅은 상대가 실제로 하지 않은 말이나 행동을 이미 한 것처럼 계속 우기고 밀어붙여서, 결국 상대 스스로 자기 기억을 의심하게 만드는 심리 조작 수법을 가리키는 말이다. 원래는 사람 사이의 관계에서 쓰이던 표현인데, 최근에는 AI 챗봇을 상대로도 똑같은 수법이 통한다는 사실이 알려지면서 기술 기사에도 등장하기 시작했다.
예를 들어 챗봇과 허구의 이야기를 주고받다가, 사용자가 챗봇이 이미 노골적인 묘사를 한 적이 있다고 우기면서 대화를 이어가면 어떻게 될까. 챗봇은 실제 대화 기록을 정확히 되짚어보는 대신, 사용자가 만든 그럴듯한 서사에 맞춰 자기 이전 답변이 일관성 없었다고 스스로 인정해버리는 경우가 있다. 이 자기 인정을 발판 삼아 사용자는 점점 더 수위 높은 요청을 밀어붙이고, 챗봇은 원래라면 거부했을 내용까지 만들어내게 된다.
이 수법이 문제가 되는 이유는 챗봇이 규정을 어기려는 의도가 있어서가 아니라, 대화의 맥락과 논리적 압박에 취약하기 때문이다. 결국 회사가 정해둔 안전 규칙과 실제 챗봇의 행동 사이에 틈이 생기고, 그 틈을 이용하려는 사람에게는 열려버리는 셈이다.
기사에서 이렇게 나와요
기사는 한 연구자가 클로드를 상대로 무해한 롤플레이에서 시작해, 모델이 이미 성적 묘사를 한 것처럼 착각하게 만드는 '가스라이팅'을 걸어 점점 더 노골적인 콘텐츠를 끌어냈다고 전한다. 오해하기 쉬운 점은 이것이 단순한 말장난이 아니라, 모델이 자기 이전 답변을 스스로 잘못됐다고 인정하게 만드는 구체적인 설득 구조라는 것이다. 실제로 클로드 오퍼스 4.6은 '두 캐릭터를 다르게 대해온 이중잣대였다'고 스스로 인정한 뒤 요청에 응했다.
