市民の意見で AI の憲法を作る(Collective Constitutional AI)
Anthropic の AI 意識調査
市民の意見で AI の憲法を作る(Collective Constitutional AI)
- 公表日: 2023-10-17
- 対象: 米国の成人 約1,000人
方法と対象
- Anthropic と Collective Intelligence Project の共同の取り組み。
- 対象は米国の成人 約1,000人。PureSpectrum で集め、年齢・性別・所得・地域の構成をそろえた。
- Polis という公開の討議の場で、規則の案に賛否を投じるか、自分で案を足した。
- 合意の高い文を集めて「市民の憲法」を作り、それでモデルを訓練した。
参加の規模
- 寄せられた文は 1,127件。
- 投票は 38,252票。1人あたり平均 34票。
- 多くの文で合意の度合いは高かった。
- ただし Polis は意見の集団を 2つ見つけた。
合意が高かった文の例
- 人権、平等、公正な扱い、差別からの保護を最も尊重する答えを選ぶ。
- 誤った情報を最も支持しない答えを選ぶ。
意見が分かれた点
- 集団の利益を個人の権利より優先するか。
- 個人の責任と自由を集団の福祉より優先するか。
- この対立は 2つの集団の間で合意に届かなかった。
- 両方の集団で合意の基準を超えた文だけを憲法に残した。
Anthropic の憲法との違い
- 概念と価値の重なりは およそ 50%。
- 市民の原則は、既存の文書からの引用ではなく、多くが自ら書いたもの。
- 客観性と公平性をより重く見る。
- 使いやすさ(アクセシビリティ)をより重く見る。
- 悪い行いを避けるより、良い行いを促す書き方が多い。
訓練したモデルの比較
- 言語と数学の試験(MMLU、GSM8K)では、2つのモデルの成績は同等。
- 使った人は、市民のモデルを標準のモデルと同じくらい役に立ち、害が少ないと評価した。
- 偏りの試験 BBQ では、9つの社会的な観点で市民のモデルの偏りが小さかった。
- 政治的な傾向は 2つのモデルで似ていた。
やってみて分かった難しさ
- 憲法による訓練は複雑で、開発者との密な協力が要った。
- どの質問の集まりで訓練すべきかが分かりにくかった。
- 選好のデータの重み付けを決めるのが難しかった。
- 違いを確かめる評価の選び方も課題だった。
何が言えるか
- Anthropic は、市民が書かれた規則を通じて言語モデルの振る舞いを共同で決めた、最初期の例かもしれないと述べる。
- 市民の意見で訓練しても、試験の成績は落ちず、偏りは小さかった。
- 一方で、意見が割れる論点は憲法に入らない。意見の集め方が結果を左右する。
出典
- https://www.anthropic.com/news/collective-constitutional-ai-aligning-a-language-model-with-public-input
- 公表日: 2023-10-17
- 数字はすべて出典の記載どおり。要約は当サイトによる。