中間層をリピートするだけでLLM性能が向上する!? 4090x2でリーダーボードトップになった手法Repeat Your Self|shi3z
LLMの一部層を繰り返す構造変更を、Qwen3-8Bなどで探索した著者独自の追試とコードを紹介。
再学習を伴わない層の複製を試し、開始層とブロック長を変えて数学・感情推定の評価を別々に記録する。異なる課題で改善と悪化が分かれる例や、MoEではAttention部分を試した経緯も掲載する。
学習・探索条件:開始層と複製ブロック長の組合せを変え、元モデルと同じ評価を行う。/確認 2026-09-14/https://note.com/shi3zblog/n/nbb931d23e156
学習・課題別の測定:数学とEQの差分を別のヒートマップにし、一方だけの改善を区別する。/確認 2026-09-14/https://note.com/shi3zblog/n/nbb931d23e156
学習・実験の再開:各設定の結果をJSONLへ残し、済んだ構成を読み戻して探索を継続するコードを掲載。/確認 2026-09-14/https://note.com/shi3zblog/n/nbb931d23e156
対象:AIの開発・導入・活用を検討する担当者。形式:企業・著者による公開記事。言語:日本語(公開本文で確認)。利用条件:公開記事(本文をログインなしで確認)
確認事項(編集部):2026年3月の探索的な個人追試。少数の独自評価であり、一般性能の向上や能力の局在を証明しない。掲載コードと外部研究の数値は独立再検証していない。
出典:shi3z「中間層をリピートするだけでLLM性能が向上する!? 4090x2でリーダーボードトップになった手法Repeat Your Self」/公開・更新情報:2026-03-26/確認日:2026-09-14/https://note.com/shi3zblog/n/nbb931d23e156
株式会社世良(Sera, Inc.)/ お問い合わせ: info@sera-inc.co.jp