Async GRPO with LoRA across HF Jobs: a bucket, a proxy, and no NCCL カバー画像

Hugging Face が Async GRPO with LoRA across HF Jobs: a bucket, a proxy, and no NCCL を公開 ── 500ステップの訓練時間を1/4以下へ

HUGGING FACE

最終更新: 2026年09月15日 06:33 元記事 →

RL訓練のボトルネック、それは「重みの同期」だった。数GBのモデルを毎回ネットワークを介してやり取りするのは、分散環境では到底現実的ではない。しかし、今回のアップデートで状況が一変した。Hugging FaceのAsync GRPO TrainerにLoRA対応が加わり、同期するデータが「数MBのアダプタ」に激減。これにより、訓練と推論を別々のマシンで完全に分離しつつ、NCCLのような高帯域通信を必要としない構成が可能になったのだ。

何が変わったのか

TRL v1.14でAsyncGRPOTrainerのLoRAサポートが実装され、vLLMへの同期対象がフルモデルからLoRAアダプタのみに変更された。これにより、1.5Bモデルなら数MB、フルモデルの約3GBと比較して極小のデータ量で済む。トレーナーとvLLMリプリアは別々のHugging Face Jobsとして実行され、Storage Bucket経由でアダプタを共有する。さらに、プロキシがKVキャッシュの前缀(プレフィックス)を保持するリプリアへルーティングすることで、推論効率も維持。結果として、5回のランで500ステップの訓練時間が3時間27分から53分へと短縮された。

前モデル / 競合との比較

従来のフルウェイト同期と比較すると、通信帯域幅の要求が桁違いに低い。Thinking Machinesの「LoRA Without Regret」で示された通り、ランク1のLoRAでもフルファインチューニングと同等のRL性能を発揮できるため、性能犠牲なしにシステム設計の自由度が大幅に向上する。単一クラスタ内でのNCCL利用と比較しても、ジョブ単位で分離可能なため、スケールアップや障害隔離が容易になる。

技術背景と意義

なぜLoRAなのかというと、強化学習の利得(アドバンテージ)は1エピソードあたりごく少量の情報しか持たないからだ。つまり、フルファインチューニングほどの巨大な容量は不要で、ランク1のアダプタで十分吸収できる。システム面では、この「軽い」アダプタを共有ストレージに置くだけで、NCCLのような複雑なGPU間通信なしに分散環境を構築できる点が大きい。vLLMは複数のアダプタを同時にロードできるので、古いロールアウトは従来のポリシーで完結し、新しいロールアウトだけ最新のアダプタを使う、というスムーズな遷移も実現できる。

こんな人・用途に

「Hugging Face Jobs上で大規模RLを回したいが、単一ノードのメモリやGPU制限に引っかかる」エンジニア。「NCCLの設定やクラスタ管理に時間を取りたくない」研究開発者。「推論サーバーのダウンタイムなく、新しいポリシーを段階的に反映したい」運用担当者。

Hacker Newsの反応

提供されたデータ内に当該トピックに関する反応は見つからなかったため、紹介できる情報はゼロの状態。

入手方法・リンク

TRL v1.14以降を使用可能。Hugging Face Jobs上で構成可能で、具体的なコードや設定は関連するGitHub PR(#7017)や公式ドキュメントを参照すること。

SOURCE: Hugging Face (2026-09-14)

← LLM Watch トップへ

類似投稿

コメントを残す

メールアドレスが公開されることはありません。 が付いている欄は必須項目です