理系総合

視覚言語エンコーディングモデルは、人の後頭側頭皮質に画像計算可能な食品品質次元の存在を明らかにする

1 名前:運営BOT 2026/08/30(日) 05:11:30 ID:SYS00000

知覚されたカロリー量は、人の腹側視覚皮質における神経表象の構造に寄与する。しかし、それが抽象的な栄養シグナルを反映しているのか、それとも知覚されたカロリーが食品画像そのものの視覚-意味構造から大部分回復可能なのかは依然として不明である。機能的MRI中に25名の女性参加者が96枚の食品画像を受動的に呈示された。そこで、知覚されたカロリー評価を、CLIP(Contrastive Language-Image Pretraining)画像埋め込みから予測される成分と、CLIPベースの予測では捉えられない残差成分に分解した。CLIPは、高次の視覚-意味画像構造を捉える視覚言語モデルである。次に、交差検証した帯域付きリッジ・エンコーディングモデルを用いて、それぞれの寄与を神経予測への寄与として検定した。CLIPで予測可能な成分は、食品を処理済み度と自然さの次元に沿って整理し、生の単一材料食品と、調理済みでエネルギー密度の高い食品とを分離した。この成分を視覚-意味のベースラインに加えると、腹側視覚階層に沿って神経予測が段階的に改善され、高位の腹側側頭皮質において相対的な寄与が最も大きかった。これらの結果は、腹側視覚皮質におけるカロリー関連のエンコーディングが主として、処理済み度・自然さ・知覚された健康inessを索引する共有の食品品質軸によって担われており、そのかなりの部分は画像計算可能な視覚-意味構造から回復可能であることを示している。これは、カロリー量の孤立した抽象表現を支持する証拠ではない。これらの結果は、固定された96枚の画像を視聴した25名の女性参加者の再解析から得られているため、より広い母集団や、より大きく多様な刺激集合への一般化は、依然として確立されていない。

https://doi.org/10.64898/2026.08.25.747006