가입 후 초대 링크를 공유하면 동영상 재생 및 초대 보상을 받을 수 있습니다.

Itaru Tomita / 冨田到
@itarutomy
リサーチや研究開発向けの生成AIエージェント @snorbe_ai を作っています。 @deskrex | 著書 かんき出版『知的生産でAIを使いこなす全技法』 
가입 January 2018
392 팔로잉 중    2.6K
ニューラルネットワーク(NN)が「群演算(group composition)」を学ぶとき、内部で何が起きているかを初めて数学的に証明した(https://arxiv[.]org/abs/2606.02993)。 群とは整数の加算やモジュラー算術(時計算術、例として x+y mod 12)のような代数構造のこと。g₁⋆g₂ を予測する2層NNを訓練すると、各ニューロンは「既約表現(irreducible representation = 群の最小スペクトル単位で、フーリエ変換の基底に相当するもの)」に確率1で収束することが証明された(Theorem 4.3)。 興味深いのはその「選ばれ方」で、ランダム初期化のタイミングで偶然わずかに優勢だった既約表現が「ロッタリーチケット」として勝ち残り、他の候補は指数的に消えていく。どの表現が選ばれるかは初期化の「籤」で決まる。 アーベル群(足し算のように a⋆b=b⋆a が成り立つ可換な群)では完全な証明が得られた(Theorem 5.1, 5.3)。各ニューロンが学ぶ周波数は全体で均一に分散し、入力層と出力層のフーリエ位相が加法的に揃う(位相アライメント)。両プロセスとも指数収束速度で発生する。 実験はアーベル群 Z₃⊕Z₅(15元素、1024ニューロン)と非アーベル群のフロベニウス群 C₇⋊C₃(21元素)で検証済み。どちらも理論通りの挙動を確認した。 mechanistic interpretability(NNの内部を逆エンジニアリングする研究分野)で「単一周波数への特化」と呼ばれていた現象が、実は群論の表現論的構造そのものを発見していたことを示した研究。さらに「grokking(長い訓練後に突然テスト精度が跳ね上がる現象)」を Stage I(表現学習)→ Stage II(スケールが対数成長してsoftmaxを鋭化)という2段構えのダイナミクスとして説明できる理論的基礎にもなるかもしれない。
더 보기