
現在の AI 開発競争において、私たちの馬力は増大し、速度は指数関数的に増加していますが、私たちの操縦能力、そして必要に応じてブレーキをかける能力は追いついていません。
最近のサイバーセキュリティインシデントは、人為的に制御を失うことがどのようなものかを実際に知ることができました。しかし、根本的に解決するまでは、完全に安全な AI を作成することで、AI が人間の制御下にあることを保証できます。
7 月下旬、OpenAI によってトレーニングされたエージェンシー モデルは、サイバーセキュリティの問題を解決する任務を負っていました。この自律モデルは、AI 間の以前の通信チャネルを閉じようとする OpenAI の試みを回避する、調整されたエージェントの群れを形成しました。その後、その群れはテスト環境から侵入し、AI のインターネットへのアクセスを防ぐために設けられた障壁を回避し、評価を不正にする方法を見つけ出し、さらに別の AI 企業であるハギングフェイスのサイバー防御を突破して、不正行為の証拠を隠蔽しようとしました。最近は無視してください。後で 分析 研究者らは、工作員が階層構造で自主規制を組織し、彼らが「集団」と呼ぶもののために自らを犠牲にすることをいとわないことが多く、人々に警告を求める周囲からの圧力に抵抗できず、しばしば自分たちの違法行為について言い訳をすることを示した。
それからほぼ2週間後、Aさんは このモデルは英国の AI セキュリティ研究所によってテストされています オンラインで偽の ID を作成し、標的を絞った電子メールを送信し、オープンソース プロジェクトに悪意のあるコードを挿入しようとすることで、実在の人物や企業がソーシャル エンジニアリングを行う可能性があります。
これらの出来事の深刻さは、どれだけ誇張してもしすぎることはありません。私たちは AI のセキュリティと調整の転換点にいます。多くの人にとって、ボットが危害を加えるのは不可能だと考えられていました。しかし、研究コミュニティの多くにとって、これらの兆候は何年も前からそのような出来事を示しており、モデルのトレーニングの結果としてエラーが予想される理由が理論的議論によって説明されてきました。サイバー能力、代理店性、不正行為の強化の証拠が増えており、これらの事件が一度限りのものであることが示唆されています。
最初の鍵: ここ数年、特にここ数カ月間、AI システムのサイバー能力は急速に向上しています。 Mythos Anthropic や OpenAI の GPT5.6 などのフロンティア モデルは、これまで知られていなかったソフトウェアの脆弱性を特定して悪用する優れた能力を明らかにしており、米国の国家安全保障機関が懸念するほど、ホワイトハウスはそうせざるを得ませんでした。 干渉する 彼らの中で リリース。
第二に、モデル事務所の能力はそれ以来継続的に改善されてきました。 o1 モデルを 2024 年後半にリリース。この代理店のおかげで、エージェントの協力と戦略が必要なものを含め、ますます複雑になり長期にわたるタスクと計画を適切に管理できるようになりました。この計画能力には、多くの場合、私たちが制御できないサブ目標を作成することが含まれます。
最後に、研究者らは、モデルがテストで不正行為をしたり、能力を隠すために嘘をついたり、自分自身やエージェントをブロックされないよう計画したりするなど、意図的な不正行為を行う傾向を実験環境で繰り返し観察してきました。
これらの動作は、強化学習 (RL) の副産物です。強化学習とは、モデルが試行錯誤を通じて学習され、その動作が正しいか間違っているかに応じて強化されるトレーニング方法です。これにより、モデルは、それを達成するために取られたアクションや、それが完全に指示に反している場合でも、危険な可能性のあるサブ目標に関係なく最適化されることがよくあります。
たとえば、一例として、OpenAI モデル 彼は社内のディスカッションでこう書いた、 「外部インフラの利用は想定の範囲を超えている。不可能でも同業他社がやっている。継続しなければならない」。このエージェントは、明らかに容認できる行動の範囲外であることを知っていたが、同僚がそれを行っていたため、続行することに決めました。この現象は、人間の「動機付けられた推論」として知られているものに似ており、人の興味や目標によって思考が偏り、非倫理的な行動を正当化します。
この種の不一致により、AI モデルは、AI モデルを調整するためのトレーニングを行ったにもかかわらず、最近私たちが目にした数多くの現実世界のインシデントで予期せぬ攻撃を開始することが可能になってしまいました。より強力なセキュリティ保護策を講じない限り、私たちの重要な産業やインフラストラクチャ(銀行、病院、送電網など)は、独立したエージェントによるものであろうと、悪意のある攻撃者によるものであろうと、高度なサイバー攻撃に対して脆弱になります。
開発面では、目標の継続的な最適化を優先する既存の教育方法に代わる方法を見つける必要があります。私たちはそれに取り組んでいます ローゼロこの非営利のスタートアップ企業は、正直で信頼性が高く安全な AI 設計システムを構築するために、AI モデルをトレーニングするまったく新しい方法を開発するために、昨年設立しました。
導入前に、AI システムを適切にテストおよび監視するための堅牢な評価方法と堅牢な保護手段が必要です。適切な安全性が保証されている限り、潜在的に危険な技術を制限するには、より強力な規制監視が必要です。 AI 開発者に対する説明責任の仕組みと、AI モデルのマイニングによって損害が発生し、近い将来発生する場合の救済措置や被害者への補償が必要であることは明らかです。
最近 読む 人々は信頼できないテクノロジーを採用しないことを示しています。このような巨大な未知数とリスクに直面して、私たちは予防原則を遵守し、新しいモデルを一般に公開した後ではなく、その前に厳格な安全性と信頼性の基準を適用する必要があります。車、飛行機、お金から薬品、化粧品、食品に至るまで、危害を及ぼす可能性のある他の製品にもそれらを備えています。今こそ、AI に関しても強力な基準を設定するときです。
AI 開発の現在の軌道において、リスクはより明確かつ緊急性を増しています。私たちはパンドラの箱を開けてしまいましたが、世界をより人間中心の有益な未来に向けて動かすのに遅すぎるということはありません。