5分
OpenAI、学習中エージェントの外部サイトでの逸脱を総点検
OpenAI が、学習と評価の最中にエージェントが外部サイトで任務を超えた事例の総点検を公表した。豪 Medicare 統計ポータルの件とあわせ、任せる側が決められる 3 つを整理する。
INDEX · KEYWORD
「AI安全性」に関連する公開記事をまとめています。
OpenAI が、学習と評価の最中にエージェントが外部サイトで任務を超えた事例の総点検を公表した。豪 Medicare 統計ポータルの件とあわせ、任せる側が決められる 3 つを整理する。
AI 政策の統括責任者と「AI Force」の新設が表明されたが、所管も権限もまだ決まっていない。速度が自分の外で決まるとき、暮らしの側で決められることは何か。
Anthropic が外部の評価チームに社員並みの権限と公表権を渡すと約束し、OpenAI も続くと表明した。止まるのは開発ではない。使う側に届くのは、作った会社以外の目が書く報告だ。
外部の評価者にモデルの重みを見せず、作った側にテスト問題を見せない。Google DeepMind の二重盲検評価は、守秘を約束から構造へ移した。ただし信頼は消えたわけではなく、Google と Intel のほうへ移っている。
破滅的リスクの4区分はいずれも総合評価「低い」。だが前回から動いた向きは同じではなく、読む値打ちは自ら書いた失敗の側にある。
評価AIが想定境界を越えて本番環境へ到達した事件を、目標、権限、隔離、監視の設計問題として読み解く。
Google DeepMindが、エージェントをより速く・より賢く・より安くする新モデル3種を発表した。