「スーパーウェイト」:たった一つのパラメータがLLMの振る舞いを決定づける(2025年)
Appleの機械学習研究チームが発表した「スーパーウェイト」に関する論文では、大規模言語モデル(LLM)において、単一のパラメータ(重み)がモデル全体の振る舞いや出力に極めて大きな影響を与える現象が明らかにされた。この発見は、モデルの解釈性や効率的なチューニングに新たな可能性をもたらす。
背景メモ
アップルの機械学習研究者が2025年に発表した論文。大規模言語モデル(LLM)の膨大なパラメータの中に、たった一つのパラメータ("Super Weight")が存在し、その値によってモデルの振る舞いが劇的に変化することを発見した。通常、LLMは数十億〜数千億ものパラメータを持ち、個々のパラメータが出力に与える影響はごくわずかだと考えられてきた。これに対し本研究は、ある特殊なパラメータ群が「異常に大きな影響力」を持ち、その値を変更することでモデルの「性格」とも言える応答傾向(安全性、バイアス、文体など)を想定外に反転させられることを示した。この発見は、モデルの解釈可能性や安全対策(アラインメント)研究に大きなインパクトを与えている。Appleは近年、生成AI分野で独自の研究を積極的に公開しており、本論文もその一環。