语言神经表征
语言神经表征
语言神经表征关注人脑如何把词义、语法角色、依存关系、短语边界和上下文组织成可生成句子的内部表示。它不是单个脑区标签,而是一组分布式、层级化、组合式的神经编码问题。
观察
- Nature 2024 年的单细胞语义编码研究把语言理解推进到单神经元尺度:词义不是只存在于粗粒度脑区激活中,而可以在神经元群体中呈现结构化的语义选择性。
- Nature 2026 年的语言生成研究把对象从“词义理解”推进到“句子组织”:自由对话中的神经活动可以和词性、依存关系、短语结构、句法树深度、上下文嵌入等语言特征对应起来。
- 这条线索把语言生产力解释为组合式表征:同一个词在不同句法位置和上下文中不是同一个神经状态;可被编码的是词项、语法角色和上下文的组合。
- LLM 在这里既是比较对象,也是测量工具。研究者用语言模型和 NLP 表征去预测神经活动,说明现代语言模型内部表示与人脑语言系统之间可能存在可比较的表示几何,但这不等于“大脑就是 Transformer”。
- 语言网络比 Broca 区 / Wernicke 区的经典二分更分布式。单神经元尺度证据提示,前额叶、颞叶和左右半球的多个区域都可能参与词义、句法和上下文编码。
和 NeuroAI 的关系
NeuroAI 在这里表现为双向路线:一方面用 AI/LLM 表征解释神经活动,另一方面用人脑语言系统检验机器语言表征是否捕捉了类似的结构约束。它和 Concept2Brain 相邻,但方向不同:Concept2Brain 是从语义刺激生成脑电反应,语言神经表征更关注真实语言理解和生成过程中神经元如何编码语言结构。
边界
- 这些研究依赖临床植入电极的患者样本,样本规模和采样脑区受临床需求限制。
- 神经活动与 LLM 表征相符,只能说明预测相关或表征相似,不能直接推出神经机制等同。
- 自由对话提高了生态有效性,但也使语言内容、上下文和行为状态更难完全控制。