AI エージェントの信頼性には新しい観察モデルが必要

TL; DR

従来の監視ツールは決定論的なシステム向けに構築されており、HTTP エラー コードなどの既知の障害パターンに依存しています。 AI エージェントは、間違った結果が得られた場合でもタスクを完了でき、ビジネスで障害が発生した場合でも既存の監視は成功を記録します。 Moyai の創設者 Robert Hommes 氏は、異常を最初に検出することを主張しています。つまり、同じルールで新たな障害をすべて追跡するのではなく、何か違うものを見つけてから、それが間違っているかどうかを判断します。

AI エージェントの急速な導入により、組織の運営方法のアーキテクチャが変化しています。エージェントは、情報を解釈し、意思決定を行い、企業システムと対話し、以前は人間の関与が必要であったある程度の自律性を持ったタスクを実行できます。この自律性は効率性を高める大きな機会を提供しますが、従来の監視アプローチでは決して対処するように設計されていなかった根本的な問題も引き起こします。

のために ロバート・ホームズ創設者 モアイ中心的な問題は、もはや AI エージェントがタスクを実行できるかどうかだけではありません。それは、組織がタスクが正しく実行されたことを確実に判断できるかどうかです。

AI エージェントの最も危険な例は、タスクを正常に実行し、実際には間違った結果を生成するエージェントです。「オムスは言います。」エージェントはツールを備えており、通常、これらのツールは内部ビジネス システムに接続されているため、チャットボットで知られる従来の AI とは異なります。適切に登録または伝達されていないシステムを誤用すると、起こっていると考えていることと実際に起こっていることの間に大きな違いが生じる可能性があります。»

この区別は、エージェントが財務上または業務上に影響を与える決定を下したり、行動を開始したりする権限を持っている場合に特に重要になります。

ホームズはこう説明する。購入エージェントが特定の種類のコーヒー豆を購入するように指示されたと想像してください。エージェントは調達システムと正常に通信しますが、間違った製品パラメータを提供し続けます。同時に、在庫や購入記録を別の製品カテゴリと照合します。従来のインフラストラクチャ監視の観点からは、システムは正常に動作します。ただし、ビジネスの観点から見ると、エージェントは定期的に間違った結果を返します。»

違いは、認識される前に顕著になる場合があります。航空会社の顧客サービスでも同様の問題が発生する可能性があります。係員は足止めされた乗客にフライトが再予約されたことを通知し、予約確認の待機を開始することができます。元のトランザクションが成功しなかった場合、顧客は空港に到着して初めて問題に気づく可能性があります。

これらのシナリオは、ホームズが緊急の障害のカテゴリーとみなしているものを表しています。問題は、システムが明らかなエラーを生成するとは限りません。問題は、エージェントの追跡によって表される状態、組織の監視システム、およびビジネスの実際の状態が異なる可能性があることです。

従来の可観測性は、明らかな技術的障害を特定するための強力なメカニズムを提供します。 HTTP ステータス コードは簡単な例を示しています。 400 レベルの応答はリクエストに問題があることを示し、500 レベルの応答はサーバー側の問題を示します。 200 応答は通常、リクエストが正常に処理されたことを示します。 AI エージェントはこの仮定に異議を唱えることができます。

ホームズは言う、「エンドポイントに到達しました。間違ったパラメータでリクエストしました。必要なもの以外のものを受け取りました。」というエラー コードはありません。技術的には何も失敗しないのですが、機能しないだけです。»

したがって、エージェントは有効なリクエストを行い、有効な応答を受信して​​も、無効な決定を下す可能性があります。ビジネスでは失敗が発生する一方で、インフラストラクチャはコラボレーションの成功を捉えます。これにより、従来の技術的な信号収集だけでは解決できない信頼性の問題が生じます。

当然のことながら、組織は追加の保護措置を導入することで対応しました。サイクル内のヒューマン アーキテクチャでは、従業員がさらなるアクションを承認する必要がある場合があります。エンタープライズ システムは、コスト、売上高、その他の財務パフォーマンス指標を監視できます。成熟した組織は、エージェントが明確に定義された境界を超えて逸脱することを防ぐための制御を確立することもできます。

ホームズ氏は、これらのメカニズムが特に自律システムの周囲に保護層を提供するため、価値があると考えています。ただし、主要な問題は解決されません。物質の影響を監視するということは、多くの場合、影響が検出できるほど大きくなるまで待つことを意味します。

物質的な影響が生じたときにそれがわかりますが、すでに手遅れです。「オムスは言います。」あなたはすでに影響力を持っています。気づく前に悪化していたはずです。»

さらに深刻な問題は、未知の障害モードに組織がどのように対応するかということです。従来の観察は通常、既知のパターンに基づいて構築されています。特定の障害が発生した場合、チームはパターンを特定し、将来それを検出できるようにルールを開発します。この方法は、システムの動作が比較的予測可能な決定論的な環境で効果的に機能します。

AI エージェントがさらなる変化を推進しています。彼らの決定は、事前に列挙することが難しいコンテキスト、入力、ツールの相互作用、および解釈に依存する場合があります。組織は、これまでに発生したことのない動作にさらされたままでありながら、以前に観察された障害に対するルールを継続的に追加できます。

ホームズはこのプロセスを次のように説明しています。1モル。「新たな障害が発生するたびに異なるルールが作成されますが、次の予期せぬ障害は既存の枠組みの外に残ります。」規格外のシステムをルールでチェックすると叩かれますが、彼は言い​​ます。いつも次の挑戦を見つけようとしていて、いつも少し遅れてしまいます。»

ホームズ氏によれば、代替案は、検出の開始点を変更することだという。組織は、エージェントが失敗する可能性のあるすべての原因を特定しようとするのではなく、まず異常な動作を特定してから、その曲線が真の問題を表しているかどうかを判断できます。

未知の未知やそのような失敗パターンを見つけたい場合は、他の場所を探すのが最適です。「オムスは言います。」ほとんどのシステムには特定のユーティリティがあります。システムが行うことのほとんどは良いものです。したがって、最初に何が違うのかを見て、それから何が違うのかを判断すれば、より良い識別力が得られます。»

これは、組織が可観測性についてどのように考えるべきかという、より広範な変化を表しています。ホームズは、決定論的システムのために開発された監視モデルは、再検討することなく独立したエージェントに移すことはできないと主張しています。

ソフトウェアの信頼性と可観測性は、決定論的なシステムと過去の作業方法に非常に密接に関係しています。彼は言い​​ます。エージェントが提供する機能のおかげで仕事のやり方が変わると、過去に使用していたシステムがこれらの新しいシステムを制御できるかどうかを尋ねる必要があります。私の推測では、エージェントはさまざまな方法で失敗するため、エージェントは私たちが知らなかった方法や、これらの監視システムが検出するように設計されていなかった方法など、さまざまな方法で失敗するためです。»

ホームズ氏にとって、その答えは、AI エージェントの信頼性を別の分野として、そして最終的には新しい製品カテゴリーとして考えることにあります。継続的な動作分析は、結果が重大になる前に逸脱を特定することで、既存の観察、人間による制御、およびシステムレベルの制御を改善できます。

目標は、考えられるすべての異常を排除することではありません。これは、組織がそれを理解し、対処できるよう、重大な異常を早期に可視化するためです。



Source link