新论文:神经网络可从局部统计中学会解析特定层级语法,无需显式句法先验

研究提出一种可调参数的上下文无关语法模型与受卷积网络启发的学习机制,在深度卷积和Transformer架构上验证了分层表征可由跨尺度相关性涌现。

AI解读:这篇研究试图回答一个基础问题:仅凭大量句子文本,神经网络为什么能学会理解语言结构?作者引入了一类可调的概率上下文无关语法(PCFG),能分别控制歧义程度和跨尺度相关性,并用一个受深度卷积网络结构启发的推理算法,把可学习性和所需样本量跟具体的语言统计量挂钩,最后在深度卷积和Transformer网络上做了验证。核心发现是:不同尺度上的相关性可以消解局部歧义,让网络涌现出层级化的数据表征。对做语言模型的工程师来说,这意味着模型的分层能力未必来自显式语法规则,而可能只是从训练语料的统计特征中学会的;但这套结论目前只建立在论文定义的合成语法上,真实语言更复杂,能否直接迁移需要更多验证。

一项被ICML 2026接收为regular paper的研究提出,神经网络可以从句子训练语料的局部统计中学会解析一类特定层级结构的概率上下文无关语法(PCFG),过程中不需要显式的语法规则作为先验。论文由Jack T. Parley、Francesco Cagnetta和Matthieu Wyart撰写,发布在arXiv(编号2602.06065,最新版本为v4)。

核心方法:可控的PCFG与受卷积网络启发的学习机制

作者引入了一类可调节的PCFG,允许同时控制语法结构的模糊程度(degree of ambiguity)和跨尺度的相关性结构(correlation structure across scales)。在此基础上,他们提出一种受深度卷积网络结构启发的推理算法,把可学习性(learnability)和样本复杂度(sample complexity)与具体的语言统计量联系起来。

论文在深度卷积网络和基于Transformer的架构上进行了实证验证,支持其预测。作者提出的总体框架认为,语言数据中不同尺度上的相关性能够消除局部歧义,从而使神经网络涌现出对数据的层级化表征(hierarchical representations)。

研究定位与局限

论文指出,过往研究要么聚焦于事后刻画已训练网络内部类似解析的算法,要么研究固定语法结构下PCFG的可学习性——这种情形下不涉及解析过程。本研究的定位介于两者之间,试图将可学习性与数据统计特征直接联系。

依据的来源是论文摘要(arXiv标注“摘要”),未涉及论文全文的具体实验细节或数据量。

信息来源