LinkedIn が複数教授の蒸留により AI 求人検索を 8 倍高速にトレーニングする方法
LinkedIn は、AI を活用した求職活動の背後にあるトレーニング インフラストラクチャの詳細を公開し、大規模な教師モデルからの知識をコンパクトな 0.6B パラメーター分類モデルに圧縮する複数教師抽出パイプラインについて説明しました。主な貢献は蒸留技術だけではありません。反復に十分な速度を実現するのはシステムの動作です。これには、SGLang 上に構築されたカスタム フレームワークが含まれており、教師モデルをトレーニング サイクルに直接提供します。 クリックやアプリなどの関連性やエンゲージメントの目標を向上させるために小規模言語モデル (SLM) をトレーニングするには、トレーニング サンプルごとに 1 つ以上の大規模な教師モデルをクエリする必要があります。それらの教師に出席すると、プロセスが遅くなる可能性があります。これは、LinkedIn の規模で 1 秒あたり数十万のクエリを処理する必要があるランキング システムにとってボトルネックになります。多くの検索チームと推奨チームは共通の課題に直面しています。キーワードベースのシステムから、LLM によって管理される統合分類器に移行するのが困難です。 LinkedIn は、SGLang を使用して数人の教師向けの蒸留フレームワークを作成しました。このシステムは、さまざまなサイズの教師モデルをロードして提供します。テンソル並列構成とデータ並列構成も処理します。非同期クライアントはトレーニング中に教師に質問します。それらの出力を処理し、蒸留損失に追加します。チームはこの方法をオンライン複数教師蒸留と呼んでいます。ローカルの教師レプリカを使用してこれを複数のノードにわたってスケーリングすると、蒸留プロセスが 3 倍高速化されました。また、レイテンシーも低く抑えられ、高速な反復が可能になりました。サービスのオーバーヘッドを削減し、計算の繰り返しを避けるために、LinkedIn はオフライン マルチ教授蒸留を導入しました。このモードでは、システムは教師の出力を事前計算し、HDFS または NFS に保存します。これらは、リアルタイムでクエリされるのではなく、トレーニングで直接使用されます。…