アンソロピックは2026年7月31日(現地時間)、自社の大規模対話AIモデル「Claude」の新しい憲法を全文公開した。この文書は、Anthropicが目指すClaudeの価値観と行動に関するビジョンを詳細に記述しており、モデルの訓練プロセスにおいてClaudeの振る舞いを直接的に形成する。同社は、モデルが従うべき価値観や行動原則の更新内容と改訂理由を説明し、AIの透明性を高めることを目的としている。
アンソロピックが公開した「Claudeの新しい憲法」は、Claudeがどのような存在であるかを定義し、形成する基盤となる文書と位置付けられている。この憲法は、Claudeが世界で適切に行動するために必要な知識と理解を与えることを意図し、主にClaude自身のために書かれている。あらゆる訓練や指示は、この憲法の文字と精神に合致するよう求められる。
同社は2023年から、憲法AI(Constitutional AI)と呼ばれる訓練技術を用いてClaudeモデルの訓練を開始しており、新しい憲法は訓練においてより中心的な役割を担う。Claude自体もこの憲法を利用して、憲法の理解を助けるデータや関連する対話、価値観に沿った応答、可能な応答のランキングといった合成訓練データを構築する。
従来の憲法が単なる原則のリストであったのに対し、新しいアプローチでは、AIモデルが特定の行動をとるべき理由を理解することが重要であるとされている。これにより、ClaudeのようなAIモデルが幅広い未知の状況において適切な判断を下し、一般的な原則を適用できるようになることを目指す。特定の規則や明確な境界線は高リスクの行動に適用される「ハードな制約」として一部用いられるが、憲法自体は厳格な法的文書とは意図されていない。
新しい憲法は、Claudeモデルが「広範に安全であること」「広範に倫理的であること」Anthropicのガイドラインに従うこと「真に有益であること」を目標としている。これらの特性が競合する場合には、この順序で優先される。憲法の主要なセクションは、Helpfulness(有益性)、Anthropic’s guidelines(Anthropicのガイドライン)、Claude’s ethics(Claudeの倫理)、Being broadly safe(広範な安全性)で構成されている。
参考: anthropic.com (アーカイブ) — 2026年8月1日 09:00 (JST)
原文ハイライト"a detailed description of Anthropic’s vision for Claude’s values and behavior"