LARA (ライトウェイト・アディティブ・レジデュアル・アダプテーション) は2026年7月25日(現地時間)、フリーズされたモデルの重みに変更を加えず、残差ストリーム内で動作する新たなモデル適応手法としてarXiv (アーカイブ) に発表されました。この手法は、既存のLoRA (ローラ) と同等のパラメータ数で高い性能を発揮し、隠れ状態の読み取りと低ランク補正を残差ストリームへ追加することで、基本モデルの重みを不変に保ちます。単一モデル上で複数の学習済み動作を効率的に管理する可能性を示唆しています。

LARAは、フリーズされたモデルの重みに低ランクの更新を追加するLoRAとは異なり、残差ストリーム内で機能する点が特徴です。このアプローチでは、少数の層で隠れ状態を読み取り、低ランクの補正を残差ストリームに追加することで、全ての基本重みに影響を与えません。

コードファインチューニングタスクと選好最適化 (DPO) の両方において、LARAはLoRAと同等のパラメータ数で、匹敵する性能を示しています。適応がフリーズされた基本モデルと残差の組み合わせとして機能するため、LARAは推論時に適用されるスケール「γ」を通じて、基本動作と適応動作の間をスムーズに補間する段階的な制御を提供します。これは、重み空間での適応では実現が難しい機能とされています。

各動作は共有されたフリーズされた基本モデル上の小さな残差モジュールとして機能します。これにより、多くの動作を一度に保持し、トークンごとに自動的にルーティングすることが可能になります。研究では、7つの動作(6つはファインチューニング、1つは選好最適化)を1つのフリーズされた1.5Bモデルに、約33 MBのオーバーヘッドで配置可能であることを示しています。

基本モデルが変更されないため、動作は個別に学習され、オンデマンドでロードされるのではなく、トークンごとに選択されます。この特性は、単一デバイス上の単一モデルで多数の動作をホストし、新しい動作を柔軟に追加する用途に適していると考察されています。本研究は、パスカル・エキン氏、ヒョソン・チョイ氏、ウェイ・ジー氏らによって発表されました。


参考: arXiv cs.LG (アーカイブ) — 2026年8月3日 13:00 (JST)

原文ハイライト

"LARA: Lightweight Adapters in the Residual Stream for Composable Adaptation and Alignment"

この記事をシェア
X はてブ LinkedIn