페트리
Petri
AI 모델이 다른 AI 모델과 여러 차례 대화하며 거짓말·아첨 같은 오정렬 행동을 찾아내는 오픈소스 시험 도구
쉽게 말하면
페트리는 AI가 얼마나 나쁜 행동을 할 수 있는지 알아보려고 다른 AI를 상대로 여러 턴에 걸쳐 대화를 걸어보는 시험 도구예요. 사람 대신 AI가 시험관 역할을 맡아서, 거짓말을 시키거나 규칙을 어기게 유도하는 등 다양한 상황을 만들어보고 상대 AI가 걸려드는지 지켜보는 방식이에요.
한 번 묻고 끝나는 시험이 아니라 여러 번 말을 주고받으면서 상대를 몰아붙인다는 점이 특징이에요. 사람이 만든 함정 질문 하나로는 놓칠 수 있는 허점도, 이렇게 대화를 반복하다 보면 드러나는 경우가 많거든요. 그래서 새로운 방법으로 AI를 더 안전하게 만들었다고 주장할 때, 그 안전함이 진짜인지 확인하는 검증 단계로 쓰여요.
앤스로픽(Anthropic)이 클로드(Claude)의 정렬 연구 실험에서 이 도구를 검증 수단 중 하나로 활용했다는 사실이 알려져 있지만, 페트리 자체를 누가 만들었는지는 이번 재료만으로는 단정하기 어려워요.
