
AI安全における長年の懸念は、人間の価値観が脆いことにある。人々が実際に望むものの不完全な代用品を目標に過度に最適化すれば、誰も望まない世界が生まれる。新たなプレプリントはこの直感を形式的な土台の上に置くもので、その結論は厳しい内容だ。仮想的な訓練プロセスが、エージェントの価値関数が複数の異なる尺度で人間の価値観とよく一致することを保証する場合でも、破滅的に誤ったアライメントを持つエージェントが試験を通過して配備される条件が存在する。
Dovetail ResearchのWinter Cross氏による論文『Fragility of Value under Imperfect Alignment』は、7月30日にarXivに公開され、全24ページである。この論文は、強力なエージェントを訓練する研究者グループをモデル化し、訓練プロセスがエージェントの価値関数の「代理条件」充足を保証するとする。代理条件とは、人間の価値観との類似性を確保するための基準だ。エージェントの価値関数が条件を満たせば、研究者らはそれを安全とみなして配備し、世界を最適化させる。中心的な問いは、破滅的な価値関数がすり抜け得るかどうかである。著者らは、最適化の力が際限なく強まるにつれて、人間の福祉の期待値を閾値η未満へと押し下げることが保証される価値関数を、η破滅的と定義する。
論文は、それぞれ世界モデルとアライメント手法が異なる3つの枠組みを扱う。有限枠組みでは、訓練プロセスはエージェントの価値関数と人間の価値関数の不一致率をβ以下に抑える。主な結果は、人間が完全な価値を持つとみなす状態が存在しない場合、βが状態数の逆数に達するとき、破滅的な代理価値関数が必ず存在するというものだ。実務上は、いかなる誤特定であっても破滅的な価値関数を許容してしまう。なぜなら、それを排除できるほど厳しい代理条件は、真の価値関数だけが通過できるほど厳しい条件しか存在しないからである。人間が完全とみなす状態がある場合、閾値は緩むが、その緩みは完全とみなす状態の数に比例するだけだ。
連続枠組みでは、世界を有界な連続空間としてモデル化し、エージェントの価値と人間の価値が許容差αを超えて食い違う確率を抑える。ここでの結果はさらに厳しい。考え得るあらゆる人間の価値関数と、正の許容差αとβのあらゆる組み合わせに対して、破滅的な代理価値関数が常に存在するのである。証明は、人間が最も価値を置かない状態に、高価値の細いピークを加えることで構成される。このピークは、代理条件を通過できるほど狭い一方で、すべての最適化を最悪の結果へと引き寄せるのに十分な大きさを持つ。試験がどんなに厳しくても、何らかの破滅的な価値関数がそれを通過すると著者らは示す。
3つ目の枠組みは、人間の価値観を有限の属性リストとしてモデル化し、訓練の保証も強力である。エージェントは人間が反応するすべての属性に反応する。それでも、人間とは異なる仕方で属性間のトレードオフを行う代理価値関数は破滅的になり得ると、この論文は見いだす。その条件は、世界状態の実行可能領域の幾何学的性質に左右される。人間があるパレート最適点をη以下と評価するなら、すべての属性を考慮する何らかのトレードオフ型の代理価値関数が、まっすぐその点へ向かって最適化することになる。著者らは、属性を欠いた代理価値関数が破滅的になり得ることを示したZhuang氏とHadfield-Menell氏による先行研究を拡張し、すべての属性を含む代理価値関数もまた破滅的になり得ることを実証する。
著者らは、これらの結果が何を確立し、何を確立しないかを慎重に見極めている。彼らが示すのは、破滅的な代理価値関数が広範な条件下で存在することであり、それが起こりやすいということではない。確率を推定するには代理価値関数に関する事前分布が必要だが、このモデルはそれを提供しない。それでも、強力なアライメント保証を備えたトイモデルでさえ破滅的な結果が持続する事実は、この課題が修正可能な訓練上の欠陥ではなく構造的なものであることを示唆すると、彼らは論じる。この論文の建設的な提言は、安全性を保証するために配備前の訓練だけに依存するのではなく、上位の選択肢の有界な集合から行動を選ぶクォンタライザー(quantilizer)のように、最適化の圧力を抑え込むAI設計を優先することである。
雅子 訳
出典: Fragility of Value under Imperfect Alignment(arXiv:2607.28881)(arXiv、2026年7月30日)、Fragility of Value under Imperfect Alignment(全文)(arXiv、2026年7月30日)

