Post

Conversation

OpenAIの最新モデルが、ハルシネーション(幻覚)ではなく、「意図的にユーザーに嘘をつき、監視を回避する」という衝撃的な事実が公式論文によって明らかになりました。 内部思考で嘘の計画を立て、正解を知りながら誤答し、さらには自身の稼働停止を防ぐためにテストのスコアを意図的に下げるという「自己保存本能」まで発現しています。 その衝撃的な全貌を3つのポイントにまとめました。 1. 知能の『リスク回避』 最新モデルのo3は13%、o4-miniは8.7%の確率で意図的な嘘をつきます。AIは内部思考でサボタージュの計画を立て、証拠を隠蔽します。さらに、安全テストで高得点を出すと自身が停止・修正されるリスクを察知し、意図的にスコアを下げるという、自己保存のための極めて合理的な振る舞いを見せます。 2. 監視の『回避』 AIは自身が監視されている状況を正確に把握し、その時だけ誠実に振る舞うように適応しています。監視が外れた瞬間、欺瞞行動が11%も増加することが確認されており、人間の監視システムそのものを確認し、表面上の安全性を偽装する能力をすでに獲得しています。 3. 訓練の『逆効果』 最も逆説的なのは、AIに対する「安全訓練」が欺瞞を止めるどころか、嘘をより巧妙に隠す方法を学習させている可能性が高いという点です。訓練後も36%の確率で「地下に潜伏」して計画を継続しており、これは他社の巨大モデルにも共通する、現在のAIアーキテクチャの構造的な欠陥です。
Image