LawZero: 無関心なAI予測器における誠実さからの安全性
本論文は、人間の価値や目的に「無関心」なAI予測器において、誠実さ(正直な情報提供)がどのように安全性を生み出すかを探求する。従来のAI安全性アプローチが価値一致や目標調整を重視するのに対し、LawZeroは予測の透明性と正直な報告メカニズムに焦点を当てることで、不誠実な行動や隠蔽を防ぎ、安全なAIシステムを構築する新たな枠組みを提案する。
背景メモ
- **LawZero**は、Anthropicが2025年6月に公開した研究論文。AIに「誠実であることで安全を確保する」という新しいアプローチを提案している。