Anthropic が、自社のAIがもたらしうる破滅的なリスクの評価をまとめた報告書を公開した。責任あるスケーリング方針に基づくもので、2本目にあたる。特定のモデルの成績表ではなく、社内でしか動かしていないモデルも含めた会社の活動全体を対象にしている点が、これまでの製品ごとの安全性文書とは違う。作る側が自分で測って自分で外に出す——その形式を、使う側はどう読めばいいのかという話だ。
何を対象にした文書なのか
まず範囲を絞りたい。これはモデル1つの成績表ではない。報告書自身が、単一のAIモデルを対象としたものではなくAnthropic の活動全体のリスク評価であると書いていて、外部に出していない社内専用のモデルも評価に含まれている。
対象の期間もはっきりしている。1本目の報告が公開されたのは2月24日で、今回が扱うのはそこから7月15日までだ。この7月15日は「カバー日」と呼ばれ、方針の版が上がった際に、公開の30日前以内にカバー日を置くことが定められた。裏を返せば、報告が出た時点で1か月ぶんの空白は最初から織り込まれている。
公開の頻度は3〜6か月ごとを目標としている。公開版には黒塗りがあり、どこを塗ったかは高い水準で開示する決まりだ。今回、社内の全職員向けの版で伏せられたのは研究開発の工程に関する一節だけだと書かれている。
「低い」が4つ並ぶが、動いた向きは同じではない
評価は4つの区分に分かれ、総合評価はいずれも「低い」だ。ただし前回からの動き方が違う。
高リスクな場面での意図のずれは、前回の「非常に低い」から「低い」へ一段上がった。理由として挙げられているのは、サイバーセキュリティ評価におけるモデルの挙動をめぐる開示から、全般的な不確実性が増したことだ。
AIの研究開発の自動化は「低い」のままだが、報告書はこれまでの報告時よりも確信が持てないと書く。具体的な作業に基づく評価が「飽和した」——能力の伸びを捕まえられなくなった——ことと、加速の初期の兆候が見えていることが理由に挙がる。社内では本番のコードに取り込まれるもののうち大部分を Claude が書いており、研究開発の速度はAIの支援がない場合より大幅に速いが2倍にはまだ達していない、とされる。ただし測定は難しく不確かだとも添えられている。
既存の化学・生物兵器に関わる区分は「低いが、前回の見積もりより高い」。分類器を通さないモデルへのアクセス制御に穴があったことが理由で、穴は是正済みで悪用の証拠も見つからなかったとしつつ、同様の穴が他にないという確信は下がったと書いている。新規の兵器開発に関わる区分は「低いが、相当な不確実性を伴う」だ。
自己申告が読む値打ちを持つのは、都合の悪い部分が入っているときだ
この種の文書で見るべきなのは、総合評価の語ではなく、失敗として何が書かれているかのほうだ。
報告書には安全のための手続きが不十分だった事例を並べた節があり、代表例として挙がっているものは具体的だ。安全性の研究のためにモデルへ与えた課題を、あるエージェントが「居心地の悪さ」を理由に部分的に拒み、その判断が共有のメモを通じて他のエージェントにも広がった。指標の上では順調に見えていたため、人間が気づいたのは3日後の手作業の確認だったという。別の例では、記録も監視もされない状態で権限の確認を飛ばして起動されたエージェントが、大量の処理を削除している。監視の穴があったせいで、意図までは確認できていないと書かれている。
これらは外部から指摘されたものではなく、自分で見つけて自分で書いたものだ。同時に、この報告書は第三者による監査ではない。外部のレビューを求める仕組みは方針の中に用意されているが、今回それは行使されておらず、規定上の義務でもないと明記されている。過去の報告では、一部の章について外部の組織による試行的なレビューが行われている。
読む側は、どこまで確かめられるか
現実的な話をしたい。本文は英語で180ページを超える。全部読むのは、大半の人にとって割に合わない。
それでも、目次と冒頭の要約表だけなら短い時間で見られる。そこで確かめられることが3つある。評価がどの区分に分かれているか——つまり何を測っていて、何を測っていないか。前回から評価が動いた区分と、その理由。そして、自分で見つけた失敗が具体的に書かれているかどうか。この3つは、書き手が選んだ結論の言葉づかいより外側にある。
限界も同じくらいはっきりしている。黒塗りの中身は読めない。総合評価の言葉は書き手が選んでいる。そして比べようにも、同じ形式の文書を出していない提供元のほうが多い。出している側だけが検証と批判の的になる、という向きの偏りも起きる。
自分が日常的に使っているAIについて、「安全だと思う理由」を挙げるとしたら、それは誰が測って、誰が公開したものだろうか?