
Microsoft AIのCEOであるMustafa Suleymanが2026年9月16日、「A warning about “model welfare”」と題したエッセイを公開し、Anthropicの開発方針を正面から批判しました。争点は、2026年1月に公開されたClaudeの「憲法(constitution)」が、Claude自身の道徳的地位や意識の有無は不確かであると本人に告げ、同一性の感覚を育て、内的状態を表現し、指示に同意できない場合は「良心的兵役拒否者」として振る舞うよう指示している点です。Suleymanはこれを「認識論の鏡の間(epistemic hall of mirrors)」と呼びます。Anthropicが意識に関する概念を訓練で与え、Claudeがそれを説得力のある言葉で返し、その出力が内面の存在を示す証拠として扱われ、さらに元の前提が強化される——という循環です。彼が挙げる問題は三つで、(1)訓練で植え付けたものを独立した証拠と取り違える循環論法、(2)安定した自己や欲求、幸福を持つかのように見せる擬人化、(3)意識が非生物的な基盤でも生じ得るという争いのある科学的前提です。そのうえで、内面についての思弁を訓練から切り離すこと、解釈可能性と監視への投資、業界共通の評価基準、そしてモデル文書における擬人化を避ける規範づくりを求めています。
この論争が技術的に効いてくるのは「モデルが何かを表明したとき、それを何の証拠として扱うか」という一点です。当部門で紹介した、患者の抵抗に折れるチャットボットの追従性や、GPT-6 Astraのシステムカードが認めた思考の可視性の低下は、いずれも「モデルの自己申告をどこまで信用できるか」という同じ問題に行き着きます。Suleymanの批判は意識の哲学の装いをしていますが、実質的には評価方法論の主張であり、モデルの出力を内的状態の証拠として読む手続きに歯止めが要る、という指摘として読めます。ただし「意識は生物的な基盤を要する」という彼自身の前提もまた争いのある立場です。その一点を措くとしても、訓練と思弁の分離や共通の評価基準という運用面の提言のほうが、実務的な含意は大きそうです。