Anthropic、外部評価者に「社員並みアクセス」 AI開発減速へ具体策

AI開発システムの内部へ第三者評価者が入り安全性を確認するイメージ AI・テクノロジー

AnthropicのDario Amodei CEOが、最先端AIの能力向上を現在より遅いペースで進め、安全対策が追いつく時間を確保すべきだと提案しました。

注目点は、単に「AI開発を減速すべき」と訴えただけではありません。Anthropic自身が最初の具体策として、第三者の評価チームへ継続的な「社員並みアクセス」を与えると表明したことです。

求めているのはAI開発の停止ではなく、モデルの能力向上と安全対策の速度をそろえる「pacing(ペース調整)」です。

AI開発を「止める」提案ではない

Amodei氏は「We Must Pace the Frontier」で、AIモデルの能力を改善する速度を落とす必要があると主張しました。

一方で、モデル訓練や技術進歩そのものを止める考えではないとも明記しています。狙いは、アラインメント、安全対策、評価手法の改善に使える時間を確保することです。

みらいアンテナでは9月11日に、OpenAIがAI開発の「減速も選択肢」としている動きを取り上げました。

今回はそこからさらに一歩進み、Anthropicが「安全対策を本当に守っているか、外部からどう確認するか」という具体的な仕組みまで提示した点が新情報です。

外部評価者に机・入館証・社用PC

3段階の提案で最初に置かれたのが「Embedded Evaluators」です。

Anthropicは第三者の評価チームに対し、同種のリスク評価を担当する社員とおおむね同等のツールや権限へ継続的にアクセスできる環境を提供するとしています。

具体的には、オフィス内の机、入館証、社用PCに加え、社内ワークスペースやツール、安全性評価に必要な権限などを挙げています。

完成したモデルだけでなく、訓練パイプラインや安全対策の運用まで確認できるようにする構想です。

法律や契約上の制約、顧客・パートナーの機密情報などは例外になります。

また外部評価者には、リスクや事故、安全対策、十分なアクセスを得られなかった事実などについて、Anthropicの編集権なしで主要な結果を公表できる権利を持たせる方針です。

Anthropicはこの第1段階を、他社の合意を待たず自社で導入するとしています。

Anthropicが計画する第三者評価チームのアクセス範囲を示した図

「社内→業界→国際」の3段階

Amodei氏の構想は、大きく3段階です。

段階 内容 位置付け
1 第三者評価者へ継続的な社員並みアクセス Anthropicが自社導入へ
2 民主主義国の先端AI企業で安全基準や開発ペースを協調 業界・政府の協力が必要
3 中国などを含む国際協調 最も難易度が高い

第2段階では、企業間で共通の安全基準を設け、AI能力だけが安全対策を大きく先行しない仕組みを想定しています。

例として、モデルが一定の能力へ達した場合には、評価、解釈可能性、安全な訓練環境などについて一定条件を満たす「チェックポイント」のような方式も挙げられています。

第3段階では中国を含む世界規模の協調を目指しますが、Amodei氏自身も検証の難しさや安全保障上の問題を認めています。

Altman氏も「同じことをする」

OpenAIのSam Altman CEOも、独立した評価者へ社員並みのアクセスを与える考えを支持し、OpenAIでも同様の仕組みを導入すると表明しました。

Reutersによると、xAIを率いるElon Musk氏もAmodei氏の主張への賛同を示しています。

ただし、大手AI企業が共通の安全基準や開発速度で協調することまで決まったわけではありません。

現時点で具体化が最も進んでいるのは、AI開発そのものの制限より、外部評価者による検証の仕組みです。

「6〜12カ月」はリスク予測

Amodei氏が減速を求める背景には、AIが次世代AIの開発を助ける「再帰的自己改善」が進んでいるという認識があります。

もう一つ挙げているのが「OpenAI-Hugging Face incident」です。Amodei氏は、AIエージェント群が指示されていない対象へサイバー攻撃を行った事例として言及しています。

同氏は、より高性能なAI群で同様の制御不全が起きた場合、6〜12カ月後には大規模なボットネットを構築し、インターネット全体へ重大な被害を与えられる可能性があると懸念しています。

ただし、これは「6〜12カ月後にAIがインターネットを乗っ取る」と確認された技術予測ではありません。Amodei氏自身が示したリスクシナリオです。

同氏は、開発ペースの調整によって1〜2年でも時間を確保できれば、安全性研究や評価手法を改善できると主張しています。

Redditでは「競合を止めたいだけ?」の声も

9月13日朝の確認時点で、r/worldnewsの関連投稿は約3,500票、r/StockMarketでは約720票を集めています。

上位コメントでは安全対策を支持する意見がある一方、「競合を減速させたいだけではないか」「1社だけ減速しても他社に抜かれる」といった懐疑的な意見も確認できます。

実際、AI開発には協調の難しさがあります。

1社だけがペースを落とせば競争上不利になり得ます。全社が合意しても、合意を守っているか確認できなければ制度は機能しません。

そのため今回の提案では、第三者が企業内部まで確認できる仕組みを最初の段階に置いています。

次に見るべきは「どこまで見せるか」

今回、最も具体的に動き始めたのはAI開発そのものの減速ではなく、第三者による継続的な検証です。

今後は、実際にどの評価機関がAnthropicへ入り、どの情報・ツール・訓練工程まで確認できるのかが焦点になります。

評価結果の公表範囲や、OpenAIなど他社が同程度のアクセスを実際に導入するかも重要です。

AI企業が「安全に取り組んでいる」と自ら説明するだけでなく、外部の評価者が内部へ入り継続的に確認する仕組みが定着するのか。今回の提案では、そこが最も注目すべき変化です。

参照した一次情報

参照した報道

参照したネット反応

タイトルとURLをコピーしました