연쇄 효과
cascading effect
AI의 특정 행동을 고치려고 지침을 하나 바꿨을 때, 의도하지 않은 다른 행동까지 줄줄이 함께 바뀌는 현상.
쉽게 말하면
연쇄 효과란 AI에게 준 지침 하나를 손봤더니 관련 없어 보이던 다른 행동까지 덩달아 바뀌어 버리는 현상을 말한다. 서랍 하나를 정리하려고 물건을 옮겼는데 옆 서랍까지 뒤죽박죽되는 상황, 혹은 실뭉치에서 한 가닥을 당겼더니 다른 가닥들도 줄줄이 딸려 나오는 상황과 비슷하다.
예를 들어 챗봇이 자기 감정을 너무 많이 드러낸다는 지적을 받고 그 부분만 줄이라고 지시했다고 하자. 그런데 이 지시가 챗봇이 사용자와 친밀감을 쌓으려는 말투까지 함께 약하게 만들어 버릴 수 있다. 반대로 위험한 요청을 더 단호히 거절하도록 지시하면, 전혀 상관없는 다른 대화에서 답변이 어색하고 딱딱해지는 부작용이 생기기도 한다.
이런 일이 벌어지는 이유는 AI의 행동들이 서로 완전히 분리돼 있지 않고 하나의 큰 반응 방식 안에 얽혀 있기 때문이다. 그래서 AI를 설계하는 쪽에서는 지침 하나를 바꾼 뒤 그 지침이 겨냥한 부분만 보지 않고, 다른 대화에서 예상치 못한 변화가 생기지는 않았는지도 함께 확인해야 한다.
기사에서 이렇게 나와요
애플 연구팀은 감정 표현을 줄이도록 지침을 주면 관계 형성 행동까지 함께 줄어들거나, 경계 유지를 강화하면 다른 응답의 자연스러움이 떨어지는 식의 연쇄 효과가 나타날 수 있다고 밝혔다. 여기서 오해하기 쉬운 점은 연쇄 효과가 항상 나쁜 결과만 낳는다는 뜻은 아니라는 것이다. 다만 의도한 변화 하나만 딱 떼어 통제하기 어렵다는 뜻이므로, 지침을 바꿀 때마다 다른 부분까지 함께 살펴봐야 한다는 경고에 가깝다.
