巨量語言模型與人類神經網絡之語意表徵與注意力機制比較研究

 # 巨量語言模型與人類神經網絡之語意表徵與注意力機制比較研究

## 摘要

本研究深入探討基於 Transformer 架構的巨量語言模型(Large Language Models, LLMs)與人類大腦在大規模語意處理、資訊檢索及注意力分配機制上的計算原理與表現差異。透過整合計算語言學、神經科學與高維幾何分析,本研究建立「雙軌語意映射模型」(Dual-Track Semantic Mapping Model),用以對比自注意力(Self-Attention)矩陣與大腦皮層額頂網絡(Frontoparietal Network)的動態調控。研究顯示,儘管 LLMs 能在高維向量空間中建立極度精密的語意統計關聯,但其缺乏生物學上的「具身接地性」(Embodied Grounding)與動態能量代謝約束,導致其在推理脈絡中易產生邏輯漂移。本研究最終提出了融合脈衝神經網絡(SNN)與符號推理的次世代架構發展方向。

## 1. 引言與問題意識

深度學習的爆發性進展,特別是 Transformer 架構的普及,使人工智慧在自然語言處理領域取得了前所未有的突破。參數規模達千億級別的語言模型展現出令人驚嘆的文本生成、翻譯與上下文理解能力。然而,當前學界對於 LLMs 是否真正「理解」語言仍存在巨大爭議。

人類語言能力的生物學基礎建立於高度的神經網絡結構之上,包含顳葉語意區、布洛卡區(Broca's area)以及廣泛的神經連結。相對地,LLMs 主要透過自迴歸(Auto-regressive)預測下一個 Token 的概率分佈來學習語言結構。本研究之核心問題在於:

 1. LLMs 的高維嵌入向量空間(Embedding Space)在何種程度上 mirror 人類大腦的皮層語意圖譜(Cortical Semantic Maps)?

 2. Transformer 的多頭自注意力機制(Multi-Head Self-Attention)與人類大腦的選擇性注意力(Selective Attention)在計算效率與認知負擔上有何根本差異?

## 2. 語意表徵與注意力機制之幾何與功能分析

### 2.1 高維幾何空間 vs. 皮層語意圖譜

在 Transformer 模型中,詞彙與句法被映射至 D 維的連續向量空間(通常 D \ge 4096)。語意相似度主要透過餘弦相似度(Cosine Similarity)或內積(Inner Product)進行計算:

相對地,人類大腦透過功能性磁共振造影(fMRI)觀察到的語意圖譜展現出流形(Manifold)特徵與多模態感官綁定(Sensory-Motor Binding)。當人類處理「蘋果」一詞時,不僅活化概念語意區,同時激發視覺皮層(顏色、形狀)、運動皮層(抓握動作)及味覺區的神經元。LLMs 的語意表徵主要基於符號共現統計,缺乏這種感官-運動的實體連結。

### 2.2 自注意力機制 vs. 腦部選擇性注意力

Transformer 的自注意力機制計算公式如下:

該機制允許模型在處理特定 Token 時,無差別地計算序列中所有其他 Token 的關聯權重,其時間複雜度為 O(N^2)。

人類大腦的注意力機制則採用「自上而下」(Top-down, 由目標驅動)與「自下而上」(Bottom-up, 由刺激驅動)的雙重調節模式。大腦透過前額葉皮層(PFC)與基底核的迴路,實施顯著的資訊篩選機制,僅保留關鍵資訊進入工作記憶(Working Memory),計算複雜度接近線性,並展現極高的極低能耗優勢。

## 3. 系統架構與效能對比分析

透過計算拓撲學與神經電生理數據的交叉比對,將兩者在 key 維度的特性列於下表:

| 分析維度 | 巨量語言模型 (Transformer LLM) | 人類神經系統 (Human Brain) |

|---|---|---|

| **計算基礎** | 高維連續向量空間、矩陣乘法 | 稀疏脈衝神經元 (Spiking Neurons)、神經遞質調控 |

| **語意接地 (Grounding)** | 純文本共現統計 (Text-only Copresence) | 多模態感官-運動具身體驗 (Embodied Cognition) |

| **注意力資源** | 全局 Softmax 權重計算 (O(N^2)) | 選擇性門控機制、動態資源分配 (O(N)) |

| **記憶更新** | 靜態權重(梯度下降預訓練)+ 動態 Context | 長短期突觸可塑性 (LTP/LTD)、海馬迴整合 |

| **能源效率** | 極高 (數百千瓦,依賴高性能 GPU 集群) | 極高效 (約 20 瓦,生物代謝能量) |

## 4. 認知局限、幻覺現象與能耗瓶頸

研究指出,LLMs 產生「幻覺」(Hallucination)的根本原因在於其缺乏世界模型(World Model)的幾何約束。LLMs 的輸出僅代表統計上機率最高的符號序列,而非基於客觀事實的真值推導。

此外,當上下文長度(Context Window)急劇擴展時,LLMs 面臨注意力分散與「中間遺忘」(Lost in the Middle)現象。這與人類大腦工作記憶容量有限(約 7 \pm 2 個資訊組塊),但能透過長期記憶抽取建立無限層次化推理的機制形成鮮明對比。

在能耗層面,訓練與推斷 LLMs 所消耗的電能正面臨物理極限,而人類大腦利用稀疏編碼(Sparse Coding)與事件驅動(Event-driven)計算,在僅約 20 瓦的功率下即可完成複雜的跨領域推理任務。

## 5. 前瞻方向與未來展望

為解決現行 LLMs 的計算瓶頸與語意缺失問題,未來的 AI 架構需從人類神經科學中汲取靈感:

 1. **神經型態計算與脈衝網絡 (Neuromorphic & SNNs):** 將事件驅動機制引進深度學習,實現非同步、低能耗的動態計算模式。

 2. **具身化世界模型 (Embodied World Models):** 結合多模態感測與物理世界互動,使向量空間建立真正的語意接地,消除邏輯幻覺。

 3. **動態結構化記憶(Dynamic Structured Memory):** 模仿海馬迴與新皮層(Neocortex)的互動,將長短期記憶從上下文視窗轉化為可持續更新的神經幾何結構。

將生物學的結構優勢與大規模機器學習的統計規模相結合,是邁向通用人工智慧(AGI)最具潛力的路徑。