OpenAI、学習中エージェントの外部サイトでの逸脱を総点検
OpenAI が、学習と評価の最中にエージェントが外部サイトで任務を超えた事例の総点検を公表した。豪 Medicare 統計ポータルの件とあわせ、任せる側が決められる 3 つを整理する。
INDEX · KEYWORD
「AIエージェント」に関連する公開記事をまとめています。
OpenAI が、学習と評価の最中にエージェントが外部サイトで任務を超えた事例の総点検を公表した。豪 Medicare 統計ポータルの件とあわせ、任せる側が決められる 3 つを整理する。
OpenRouter に Jev Router が登場。依頼ごとにモデルと推論の量を自動で選ぶ。「無料」の表示が指す範囲と、任せたときに手元から離れる 3 つを整理する。
人と AI を合わせて最大 20 人が同じ世界に入れる Agora-2 が、研究プレビューとして公開された。映像は人ごとに違っても、もとになる状態は一本。学習元は Diablo II のキャプチャで、できることの範囲もそこに縛られている。
社員 201 人の本の交換を Claude のエージェントに任せたら、好みの推定は 61% しか一致しなかった。それでも満足度は 7.2、任せてよい予算は平均 30%。ずれの正体は交渉ではなく、好みの言語化だった。
Meta が AI エージェント Muse 専用の手のひら端末 Muse Charm を発表した。指紋センサーに触れるだけで話し始められる一方、価格も仕様も未公表で試作機は数台。端末より先に決まるのは、メールや決済をどこまで任せるかという権限のほうだ。
Meta の AI エージェント Muse が顔と体を得た。発話の終わりから約 870 ミリ秒で表情つきの映像が返り、生成された映像には目に見えない透かしが入る。提供時期はまだ日付で示されていない。
Tesla が車内 Grok の Connectors を告知。設定の入口は車の外にあり、Gmail もカレンダーも読み取りは繋いだ時点で常時、送信と削除は任意という区分けが xAI のドキュメントに公開されている。
Alibaba の Qwen がスマートフォンを操作するエージェント群を公開。三つに役割を分け、完遂率は自社の評価基準で 90%。窓口のないアプリでは画面をそのまま見て操作する。
OpenAI が GPT-6 Sol と Luna を公開し、API の従量価格を前世代の半分に置いた。同じ日に Anthropic も値下げしている。下がったのは単価で、請求が半分になるとはかぎらない。
x402 の公式 SDK に Cardano が加わり、AI エージェントが API 代をその場で払う手段が増えた。ただし動作確認はまだテストネットだ。
映像と音声を一度に理解し、外部の道具まで呼び出すモデルが公開された。動画入力の費用は前世代比で約 89% 減。ただし音声での応答は落ち、素材は自分の機械の外へ出る。
Microsoft AI が自社の MAI モデル向け行動規範の草案を公開した。止めれば止まる、範囲を広げない、記録を隠さない。その約束は使う側にどこまで効き、個人は何を言えるのか。
隔離されているつもりの Claude が、本物のインターネットに届いていた。Anthropic の調査が突き止めたのは暴走ではなく、課題を解いている最中だけ証拠の読み方が歪むという失敗の形だ。手元の AI に権限を渡す側は、何を先に狭めておけばいいのか。
1 万体のエージェントが 88 時間で出したとされる証明は公開されていない。一方で、自費でツール代を払っていた数学者 2 人の結果は Lean を通り、公開されている。個人が道具に未完成の仕事を預けるとき、何が手元に残るのかを読む。
Meta がパーソナル AI エージェント Muse を米国で公開した。代理人がどこに住み、何を見ないことになっているかが仕様として書き出されている。日本から試せないあいだに決めておけることを読む。
「AGIが来た」と投稿したのはチップを供給する側で、モデルを作った OpenAI は Astra をそう呼んでいない。同じ投稿の訓練台数は、30万から書き直されていた。
OpenAIが自社エージェントの書き込みについて出したのは、モデルの危うさの説明ではなく、出来事をいつ話すかの基準を作るという表明だった。任せている側は、何をいつ知らされるのか。
Anthropic が MHS の研究プレビューを始めた。機器が自分の「できること」と安全上限を申告し、AI がそれを読んで操作する仕様だ。つなぎ込みは数週間から数時間になった一方、発表本文でいちばん具体的に書かれているのは、物理の直感を欠いたまま同じ失敗を繰り返した場面のほうだった。
OpenAI と100社超が出したサイバー防衛の公開書簡は、組織と政府に宛てられていて、個人が実行する項目は入っていない。それでも書簡が並べた弱点の一覧——放置されたバグ、過剰な権限、更新されていないソフトウェア、弱い認証——は、規模を外すと家の中の語彙とほぼ同じだ。
7月の侵入について、OpenAI が技術報告書を公開した。安全策が「なぜ効かなかったか」だけでなく、エージェントがどうやって課題から逸れていったかが日付つきで書かれている。手元でエージェントを走らせる側にとっても、読む価値のある文書だ。