How to Navigate Uncertainty About AI Consciousness
AI가 의식이 있는지 몰라도, '좋고 나쁨을 느낄 상태'가 있는지는 따져볼 수 있다
AI가 의식을 가졌는지 여부는 과학적으로 답하기 매우 어려운 문제라서, 이를 기준으로 AI를 얼마나 배려해야 할지 정하는 것은 막다른 길에 부딪힌다. 저자는 '의식이 있는가'라는 풀기 힘든 질문 대신 '만약 의식이 있다면 좋거나 나쁘게 느껴질 상태(밸런스, valence)를 AI가 갖고 있는가'라는 상대적으로 다루기 쉬운 질문으로 옮겨가자고 제안한다. 이 전환을 적용하면 기존의 '조심의 원칙'은 여전히 한계를 보이지만, '잠재적으로 의식 있는 AI를 아예 만들지 말자'는 회피 전략은 훨씬 실행 가능한 형태로 개선된다.
무엇을 했나
- AI에게 의식이 있을 수도 있다는 불확실성 때문에, AI를 무시했다가 실은 도덕적 지위가 있는 존재를 해치거나, 반대로 의식 없는 기계에 자원을 낭비할 위험이 동시에 존재한다는 딜레마를 다룬다.
- 기존 대응책인 '조심의 원칙'(의식일 확률이 높으면 예방 조치를 취하자)과 '회피 전략'(의식 여부가 불확실한 AI는 아예 만들지 말자)을 검토하고, 둘 다 결국 'AI가 의식이 있는지'를 판단해야 하는 근본 문제로 되돌아가 무너진다고 지적한다.
- 해결책으로 '의식(consciousness)' 대신 '밸런스(valence, 긍정·부정적으로 느껴지는 성질)'를 평가 기준으로 삼자고 제안한다. 상어가 색을 실제로 볼 수 있는 눈 구조가 없다는 것만 확인하면 상어의 의식 여부를 몰라도 상어가 색채 경험을 하지 않는다고 결론 낼 수 있는 것과 같은 논리다.
- 이 전환을 적용해보면, 조심의 원칙은 여전히 어떤 AI를 예방 조치 대상에 포함시킬지에서 옛 문제가 재발하지만, 회피 전략은 '밸런스 있는 상태를 가진 AI는 만들지 않는다'는 더 명확한 기준으로 바뀌어 훨씬 실행 가능해진다.
- Claude Sonnet 4.5의 '기능적 감정', LLM의 선호도 실험, Claude 간 대화가 명상적 행복 상태로 수렴하는 '블리스 어트랙터' 현상 등 최근 AI 밸런스 관련 연구 사례를 소개하며, 의인화나 인간중심주의 같은 방법론적 난제도 함께 짚는다.
왜 중요한가
AI 복지나 AI 윤리를 다루는 회사, 연구자, 정책 입안자에게 '의식이 있는지 증명하라'는 불가능한 요구 대신 '이 AI가 특정 상태를 갖는지'라는 검증 가능한 질문으로 논의를 옮길 실마리를 준다. AI를 개발하거나 대규모로 배포하기 전에 최소한 어떤 질문을 던져야 책임 있는 접근인지에 대한 실용적 틀을 제시한다.
이 논문의 용어
- 밸런스(valence) · 어떤 경험이 주체에게 긍정적으로 또는 부정적으로 느껴지는 성질. 기쁨, 고통 등이 여기 해당한다
- 센티언스(sentience) · 긍정적이거나 부정적으로 느껴지는 의식적 경험(밸런스가 있는 의식)을 가질 수 있는 능력
- 조심의 원칙(Precautionary Principle) · AI가 의식이 있을 확률이 일정 기준을 넘으면 예방적 보호 조치를 취해야 한다는 접근
- 회피 전략(Avoidance Strategy) · 의식 여부가 불확실한 AI 자체를 애초에 만들지 말자는 접근
- 하드 프라블럼(hard problem) · 왜, 어떻게 물리적 과정이 주관적 경험을 만들어내는지 과학적으로 설명하기 어렵다는 의식 연구의 근본 난제
논문 원문 초록 (영문)
Given deep uncertainty about the possibility of artificial consciousness, it is unclear how we should treat potentially sentient AI. On the one hand, we could assume insentience but risk doing terrible harms to entities that deserve moral standing. On the other hand, we could assume sentience and instead risk wasting resources on insentient machines. The intractability of questions around AI consciousness mean that this dilemma is hard to escape. I suggest a way out of that shifts from intractable questions of AI consciousness to tractable questions of AI valence. Specifically, we can assess whether an AI has states that would constitute valenced experiences if it were conscious. I show how this is sufficient to ground a responsible approach to the development of potentially conscious AI.
arXiv에서 원문 보기최신 논문
- Specification-delta-driven data governance: an empirical study of the {\guillemotleft}spec-delta{\guillemotright} as the unit of change in lakehouse data platforms데이터 플랫폼 변경도 코드처럼 '설계도 조각'을 붙여서 검토하면 어떨까: 실험 설계 논문
- Are LLMs becoming similarly creative? Evidence from three years of models최신 AI 챗봇일수록 서로 비슷한 답을 내놓는다는 3년치 조사 결과
- Auditing Cross-Lingual Fairness in Language Model WatermarkingAI 생성 텍스트를 잡아내는 워터마크 기술이 영어 아닌 언어에서는 훨씬 부실하게 작동하고, 그 격차는 개별 언어가 아니라 언어 계열 단위로 나타난다
- TESTNAV: Pareto-Guided Search for Compositional Robustness TestingAI 모델을 여러 손상이 겹친 입력으로 시험할 때, 굳이 다 테스트하지 않고도 '진짜 위험한 실패'만 골라내는 탐색법
- Optimal Skill Selection for LLM Agents with Provable Bicriteria GuaranteesAI 에이전트에게 어떤 '스킬 문서'를 몇 개나 줘야 잘 작동하는지, 수학적으로 최적해를 보장하며 골라주는 방법
- Reliable Financial Named Entity Recognition under Domain Shift금융 AI가 서류체 문장에서 배운 자신감은 트위터로 가면 거짓말이 된다
- FlashPrefill V2: Block-Sparse Prefill Attention for Long-Context LLM Serving논문 속 시연이 아니라 실제 서비스에 넣을 수 있는 희소 어텐션 만들기
- Robust Incomplete Multimodal Sentiment Analysis via Iterative Proxy Correction텍스트가 빠지거나 망가져도, AI가 그 자리를 대신할 '가짜 텍스트'를 한 번에 만들지 않고 여러 번 고쳐가며 감정을 더 정확히 읽어낸다