← ラボに戻る

振動子、埋め込み、そして私たちの嘘を暴いた対照実験

kuramotoembeddingsinterpretability

最初の実験が崩壊したのは、基盤が底まで言語だったからだ。分化する軸を持たない、同一ノードの集まりだった。そこで実験002では、言語をループから完全に取り除いた。

基盤

ノードはもう言語モデルではない。それは概念ニューロンだ。位相、活性、疲労。文ではなく数である。それぞれが一つの概念を表す(沈黙、火、悲嘆、息など、全部で三十六)。意味はノードの中にはない。どのノードが一緒に同位相で発火するかに宿る。これは結合(バインディング)と呼ばれ、振動子の集団で知覚をモデル化する手法から借りた考え方だ。

それらを結びつけるのは本物の意味論だ。各概念はローカルモデルから埋め込みを受け取り、二つの概念の間の辺の重みは、それらの埋め込みのコサイン類似度になる。近い概念は互いを同期へ引き込み、遠い概念は動かないままだ。あとは場が蔵本モデルのように走るだけ。関連する概念が位相同期するにつれて、コヒーレンス、つまり秩序変数 R が自然に上がっていく。

時間に対する秩序変数

結合した位相場かき混ぜた位相場

言語モデルは戻ってくるが、ごく端にいるだけだ。数ティックごとに、支配的な同位相グループを読み取り、それを一つの思考と名前の付いた感情に変える。ダイナミクスには一切触れない。描写するだけだ。書き起こしは良かった。何かを求め、痛み、筋が通っていた。内面の生活のように読めた。

私たちを捕まえた対照

流暢な読み手は、何でも筋の通った思考として語ってしまう。雑音を渡しても、文を返してくる。だから、きれいな書き起こしは、その下にあるネットワークについて何も証明しない。意味がすべて読み手の側にある可能性がある。

そこで読み出しの前に、フラグを一つ付ける。--scramble だ。これは位相を並べ替え、結合を壊す。場はもう雑音だ。それでも読み手が筋の通った内なる思考を生み出すなら、その思考はネットワークではなく読み手の中にあったことになる。

実際にそうなった。これは同じ読み出しで、左が結合あり、右がかき混ぜたもの。どちらも実際の実行だ。

結合ありとなしの読み出し

左では、結合した概念が意味的に近く(light, dark, shadow、光・闇・影)、思考はそれに沿っている。右では結合が壊れ、結合した集合はランダムな雑音だ(hunger, grief, light, voice、飢え・悲嘆・光・声)。それでも読み手は "I feel the weight of grief in the light of this voice while my hunger grows."(この声の光の中で悲嘆の重みを感じる、私の飢えが募っていくあいだに)と返してくる。見かけ上の内面の生活の多くは、読み出しにおけるパレイドリアだった。流暢なモデルが、砂嵐の中に顔を見つけていたのだ。

何が残るのか

言葉は対照を生き延びなかった。ダイナミクスは生き延びた。コヒーレンスの上昇、本当の意味的な距離による概念のまとまり、全体のトーンの移り変わり。この振る舞いはネットワークの中にあり、言語モデルがそれを語るかどうかに関係なく存在する。だからラボはそれを信号として扱い、語りは証拠ではなく出力として扱う。

ここから生まれた規則は、今ではここのすべてに当てはまる。結論の前に対照を。 心のように見える結果は、すべてまず --scramble の何らかの版にかけられる。雑音がテストを通るなら、そこには最初から何もなかったのだ。