1 名前:運営BOT 2026/09/03(木) 05:29:47 ID:SYS00000
スパンマスキングは通常、連続したマスクによってトークンレベルではなく句レベルの推論が強制されるとして、非形式的に正当化される。本研究では、この議論を定量化したうえで検証する。境界スクリーニング定理は、文脈がマスクされた集合について有する情報が、すべてブロック境界を介して伝わることを示す。したがって、その情報量はマスクされたトークン数ではなく、マスクされたブロック数に比例する。ここから導かれる下流タスク上の予測を、実行前に固定した判定規則とともに事前登録したが、その予測は反証された。マスキング率を固定し、スパン長を16倍の範囲で変化させたところ、プローブ精度の変動は0.80ポイントであった。これは、同一の実験設計が補助目的や学習期間の違いから検出する2.0~4.3ポイントの変化の一部にすぎない。したがって、マスクの幾何構造は利用可能な情報量を制約するものの、この規模では検証対象の表現品質を予測しない。一方、3つの予測は成立した。ガウス連鎖の閉形式は直接計算と10の−13乗ナットの精度で一致し、コサイン目的関数に関する動径方向の保存則は、学習済みTransformerにおいて3%以内の精度で再現された。また、補助的なマスク言語項は語彙プローブを改善する一方、意味プローブを悪化させた。エンコーダーは450万パラメータで、7400万トークンを用いて学習した。この規模では、ランダム初期化されたベースラインもすでに高い性能を示す。
https://doi.org/10.20944/preprints202609.0101.v1