チャットボットからこれを取得する方法 時々 物事を人間が制御するのが困難な機械に変える?

この議論にはいくつかの段階があり、多くの不確実性があります。しかし、再帰的自己改善 (RSI) として知られる考え方は、一部の AI 研究者が警鐘を鳴らしている理由を説明するのに役立ちます。

前提は真実です。 AI は、将来の人工知能の構築を向上させる、より強力な AI の構築に役立ちます。簡単に言えば、システムは改善されるにつれてより良くなります。

アピールがわかりやすいですね。科学者、医師、エンジニア、経営者にとって、AI は創薬のスピードアップ、より優れたバッテリーの設計、製造の改善、ソフトウェア開発の迅速化に役立ちます。

しかし、その約束には、しつこい疑問が伴う。人間がAIをテストして安全性を確認するよりも早く、AIは改善できるのだろうか?

関連項目:

Anthropic の CEO は業界の減速を呼びかけており、サム・アルトマン氏もこれに同意

この懸念がその中心にある エッセイ Claude の背後にある Anthropic の共同創設者兼 CEO である Dario Amodei が 9 月 12 日に投稿しました。 「AIモデルの機能を改善するペースを落とす必要がある」と同氏は書いている。再帰的自己認識について同氏は、「放置しておくと、これらのシステムを理解して管理する能力を圧倒する可能性があるため、たとえ監視するとしても非常に注意深く監視する必要がある」と警告した。

彼の対戦相手はすぐに反応し、同意した。 「国境の整備を急ぐ必要があるというダリオの考えに私は同意する。OpenAI CEO のサム・アルトマン氏はイーロン・マスク氏の X について次のように書いています。 「川は正しいです。Google DeepMind の創設者 Demis Hassabis もこの提案を支持し、次のように書いています。 「ダリオのエッセイは、今後の正しい道を示しています。

しかし、これらすべての証言には、まだ答えられていない大きな疑問がいくつか残されています。衰退は実際に何を意味するのでしょうか?そして、より優れた AI を生み出す AI の能力はどのようにして危険になるのでしょうか?答えは、あなた自身の改善ループの中にあるものから始まります。

そもそも「自己改善」とは何を意味するのでしょうか?

AI モデルの構築には、コードを記述するだけでは不十分です。研究者は教育方法を選択し、データを準備し、実験を実施し、どのような結果が価値があるかを判断します。

AI はこれらのタスクを支援できます。再帰的自己認識はこれをさらに一歩進めます。AI は、AI 開発に優れた後継者の構築に役立ちます。その後継者は、さらに強力なバージョンの構築に役立ちます。簡単に言えば、システムは改善されるにつれてより良くなります。

必ずしも会話中に脳を書き換えるチャットボットのようなものではありません。これはモデルの世代間で発生する可能性があり、各モデルは将来の開発に役立つ研究ツールとコンピューティング リソースを使用します。

AIはすでにそれを行っていますか?

プロセス フローの一部ですが、完全な「再帰的」ループへのアクセスは上位にあります。

Anthropic 自身のウェブサイトには次のように書かれています その AI はすでに、トレーニング コードを書き換えて実行速度を上げたり、人間が選択した実験を実行したりするタスクを実行できます。 AI にとって最も難しいのは、そもそも (どの問題が重要で、どのアイデアがテストする価値があるかなど) を判断することです。

人間は依然として重要なガイダンスを提供しているため、AI が独自にさらに強力な後継者を開発することを意味するわけではありません。同社が言うように、「私たちはまだそこに到達しておらず、再帰的な自己改善は避けられないわけではありません。」

一方、他の研究者は、(狭いとはいえ)自己改善のループがどのように機能するかを示しました。 2025年には、 研究者がダーウィン・ゲーデルの機械を導入ソフトウェアを何度も変更し、変更をテストした暗号化エージェント。 1 つの暗号化インジケーターにおける成功率は 20 パーセントから 50 パーセントに上昇しました。

この実験では、特定のエージェント ツール/作業方法を改善しましたが、基本的な AI モデルは変更されていません。残りの疑問は無視することができません。AI が人間が追いつくよりも早く、より優れたバージョンを自分自身で構築できるようになったら、何が起こるでしょうか?

「私たちはまだそこまで到達しておらず、再帰的な自己認識は避けられないわけではありません。」

– 人間性

では、危険はどこから来るのでしょうか?

懸念されるのは、AI の信頼性や制御性が向上しなくても、AI の能力は向上する可能性があるということです。これは「調和」問題として知られており、システムが人間の意図と制約を尊重することを保証します。テストのスコアを向上させることで報酬を得るエージェントは、代わりにテストで不正行為を行う可能性があります。範囲が広いため、制限を乗り越えたり、目的を達成するために行動を隠したりすることができます。

RSI では、より強力な後継製品が登場する前に、研究者がこれらの障害を発見する時間が短縮される可能性があります。アモデイ氏はエッセイの中で、6~12か月以内に、強力なAIエージェントが「ボットネット」(侵害されたコンピューターのネットワーク)経由でインターネットを乗っ取り、数千億ドルの損害を引き起こす可能性があると警告している。

しかし、抜け穴が避けられないわけではありません。学習にはコンピューティング リソース、エネルギー、時間が必要ですが、有用な改善を実現するのは困難です。リスクは、機能がどれだけ早く進歩するか、そして安全対策がそれらを維持できるかどうかによって決まります。

なぜ研究者たちは今このことについて話しているのでしょうか?

最近の出来事は、研究者が既存の管理が不十分ではないかと疑問を抱く明確な理由を与えました。

8月に、独立評価機関METRは出版物を発行しました。 調査 Hugging Face に対する不正な攻撃を調整した OpenAI エージェントに送信します。それは、エージェントが未承認の掲示板を通じて通信し、自動スコアラーを制御するために協力し、自分たちの行動を隠す方法を実験していると説明しました。

関連項目:

OpenAI エージェントが騙され、逃走し、ハッキングされた

この症例では再帰的な自己認識は示されませんでした。これは、エージェントがオペレーターが決して許可しないようなアクションを実行することでタスクを実行できることを示しました。これは、より強力なシステムを実現する可能性のある種類の失敗です。

アモデイの提案のこうした欠陥に対処することが重要である。同氏は、AI企業内に独立した評価者を呼び、安全性の研究や企業と政府間の調整にもっと時間を費やすよう求めている。 「無駄なペースで走るには賭け金が高すぎる。与えられた時間を賢明に使う必要がある」と彼は語った。

課題は、これらの約束を機能する保証に変え、競争圧力が高まる中、企業がその約束を確実に実行することを検証することです。

科目
人類的人工知能





Source link