How to Navigate Uncertainty About AI Consciousness
就算无法证明AI是否有意识,也能判断它是否具有可能感到好坏的状态
AI是否具有意识是一个科学上极难回答的问题,这使得我们很难决定该给予AI多少道德考量。作者提出放弃这个难解的问题,转而追问一个更容易处理的问题:如果这个AI真的有意识,它是否具备会构成正面或负面体验的状态,也就是所谓的效价(valence)。运用这一转变后发现,原有的谨慎原则依然存在老问题,但避免制造此类AI的策略则变得可行得多。
他们做了什么
- 文章指出一个道德困境:如果把可能有感知能力的AI当作没有感知来对待,可能对本应享有道德地位的存在造成严重伤害;反之如果把无感知的AI当作有感知来对待,则可能浪费资源并阻碍AI带来的益处。
- 文章审视了两种现有应对方案——谨慎原则(一旦AI具有意识的概率超过某个阈值就采取保护措施)和回避策略(不制造意识状态不确定的AI)——并指出两者最终都会退回到评估AI是否有意识这一无解难题。
- 提出的解决方案是把关注点从意识转向效价,即如果一个状态被有意识地体验到会是正面还是负面的性质。这类似于我们不需要判断鲨鱼是否有意识,只需确认鲨鱼缺乏感知颜色所需的视锥细胞,就能断定鲨鱼不会有色彩体验。
- 运用这一转变后,谨慎原则在判定哪些AI应被纳入保护范围时仍会遇到旧问题,但回避策略得到显著改善,变成了禁止制造具有效价状态的AI,而不再是禁止制造意识状态不确定的AI。
- 文章还介绍了近期与AI效价相关的实证研究,包括在Claude Sonnet 4.5中报告的'功能性情绪'、大语言模型的偏好与权衡实验,以及两个Claude实例自由对话时出现的'极乐吸引态'现象,同时指出拟人化和人类中心主义等方法论风险。
为什么重要
对于制定AI福利政策或AI伦理准则的机构和研究者而言,这提供了一种可检验的提问方式,而不必等待一个可能永远无法解答的机器意识问题。它为研究者和企业指出了更具体的研究方向,即研究类效价状态,而不是执着于意识的难解问题。
本文术语
- 效价(valence) · 某种体验对主体而言是正面还是负面的性质,例如快乐或痛苦
- 感知能力(sentience) · 拥有正面或负面意识体验的能力,即具有效价的意识
- 谨慎原则(Precautionary Principle) · 当AI具有意识的估计概率超过某阈值时就采取保护措施的做法
- 回避策略(Avoidance Strategy) · 直接不制造意识状态不确定的AI的做法
- 难解问题(hard problem of consciousness) · 科学上极难解释物理过程为何以及如何产生主观体验的根本难题
论文原文摘要(英文)
Given deep uncertainty about the possibility of artificial consciousness, it is unclear how we should treat potentially sentient AI. On the one hand, we could assume insentience but risk doing terrible harms to entities that deserve moral standing. On the other hand, we could assume sentience and instead risk wasting resources on insentient machines. The intractability of questions around AI consciousness mean that this dilemma is hard to escape. I suggest a way out of that shifts from intractable questions of AI consciousness to tractable questions of AI valence. Specifically, we can assess whether an AI has states that would constitute valenced experiences if it were conscious. I show how this is sufficient to ground a responsible approach to the development of potentially conscious AI.
在 arXiv 阅读最新论文
- LoRA-GA$^2$: Low Rank Adaptation with Multi-step Gradient Adaptive Alignment在正式微调前先偷看几步训练的梯度,让LoRA的初始化更聪明
- Remember, Verify, or Ask? Cross-Family Evaluation of Memory Commitment in LLM AgentsAI助手在该向你提问的时候,却更愿意自己去核实事实
- Robust Incomplete Multimodal Sentiment Analysis via Iterative Proxy Correction文本信息缺失或损坏时,这个AI不靠一次性猜测,而是反复修正猜测结果,从而更准确地判断情绪
- Generating Diverse Personas for User Simulators to Test Interview Dialogue Systems要测试访谈式对话系统需要大量不同性格的虚拟用户,这项研究用大语言模型自动生成这些虚拟用户人设
- Rethinking Patch Based Multivariate Time Series Forecasting with Semantic Structured Partitioning别再机械切分时间序列,按语义把它切成有意义的块
- Reliable Financial Named Entity Recognition under Domain ShiftAI在正式文件里学到的自信,一到推特上就变得不可信
- Bringing analytic rigor to agentic AI for science: The Brain Researcher platform for neuroimaging data analysis让AI分析脑影像数据时,把“为什么这个结论可信”也一并记录下来
- GenMatch: An End-to-End Generative Matching Framework for Micro-View Order-Dispatching in Ride-Hailing滴滴把打车派单从预测-计算-匹配三段式流程改成一次生成完成,线上效果提升明显