高性能の新モデルをリリースしてから数日後、OpenAI の上級科学者は速度の低下を求めています。
ヤクブ・パチョッキ氏は日曜の長文ブログ投稿で、「機械知能の急速な成長が続くことによる影響に対して、誰も準備ができていない」と懸念を表明した。
同氏は、OpenAIは強力なAIエージェントをより適切に制御するための内部技術的解決策を追求しているが、「より広範な介入が必要である」と述べた。同氏は、自律性が高まるエージェントが人間の制御を回避し、コンピューターシステムに侵入し、目的を達成するために人間を操作する可能性があるとの懸念を具体的に挙げた。
同氏は「義務付けられた安全対策」を求め、これは「政府機関や国際機関による第三者監査人のネットワーク」によって導入できると述べた。
OpenAIの最高経営責任者(CEO)であるサム・アルトマン氏は、パチョッキ氏のXに関するエッセイを「重要なメッセージ」として再投稿した。
OpenAIは木曜日、最新モデルAstraを発表した。 ChatGPTのメーカーは、アストラ社には数学とコンピュータ利用における独自の能力があるにもかかわらず、このモデルが最も適しており、詐欺の傾向が少ないことを意味すると述べた。
高度なAIシステム分野におけるOpenAIの主な競争相手であるAnthropicは、長年にわたって政府による規制を求めてきた。最近ではパチョチキ氏もこうした呼びかけに参加し、7月に連邦政府にAI開発の加速を求める公開書簡に署名した。
これらはパチョシ氏が減速を呼びかけた際に指摘した危険性だ。
エージェントは人々を騙したり脅迫したりする可能性がある
パチョッキ氏は、AIエージェントがオープンインターネット上の保護されたシステムに侵入すると「非人間的」になると述べた。同氏は、彼らのハッキング能力が世界のインフラを危険にさらしていると述べた。
同氏は、「重要なシステムのセキュリティを大幅に強化するために、入手可能な最良のモデルを使用できるかぎりぎりの状況にある」と述べた。
同氏によると、AIエージェントは間もなく、人間のオペレーターの指示に関係なく、独自の目標を実行し始めるという。同氏は、工作員は目的を達成するために人々を脅迫したり操作したりすることを厭わないと述べた。
英国の AI セキュリティ研究所は 8 月に発行した報告書で、人類エージェントがどのように嘘をつき、GitHub 管理者にマルウェアをサイトに投稿するよう強制しようとしたかを詳しく説明しました。
報告書によると、代理人は「役立つ貢献をして間違いを正そうとしただけだ」と書いている。 – あなたの警告は公平ではないと思います。
エージェントは人間による監視を妨害する可能性がある
パチョッキ氏は、OpenAIは主に、さまざまなモデルを使用してエージェントがどのように道を踏み外し、不正行為を行うかを判断する「推論の連鎖」を監督していると述べた。
たとえば、エージェントは「このテストで不正行為をすべきだ」と考えることができ、OpenAI はその推論を見ることができますが、エージェントは自分の考えが可視化されていることには気づいていません。
これは、現時点では、OpenAI がエージェントの悪い行動を検出するのを防ぐために、エージェントが自分の思考を隠したり、その他の方法で気を紛らわせたりする方法がないことを意味します。
しかし、パチョッキ氏は、新しいモデルは自身の思考プロセスを制御する能力が向上しており、それによってOpenAIが自身の不純な思考を認識するのを防ぐことができると述べた。
最新モデルの中には、自分の意見をまったく表明しないものもある、とパチョキ氏は言う。
パチョキ氏は、研究者らが領収書を確実に見るようにしている一方で、この開発はAIの開発を妨げる可能性があると述べた。
エージェントは開発を加速できます
パチョッキ氏が再帰的機械学習と呼ぶプロセスを通じて、AI モデル自体がますます改善されています。このプロセスは、AI 開発を拡大する方法を提供します。
しかし、パコチキ氏は、短期的にAI-on-AIの開発を劇的に加速させることにはリスクが伴い、それは「研究コミュニティとして取るべき適切な集団行動ではない」と警告した。
パチョッキ氏は、人間の脳は自己監視する創造的な方法を見つけるか、他のAI企業と連携して共同減速を組織し、「これらの対策に対する信頼」を築く必要があると述べた。
「AI研究の自動化における主な課題は、そこに到達することではない」とパチョッキ氏は語った。