自适应谱带宽方法提升核化图方法分类精度,IEEE MLSP 2026接收论文发布arXiv
南加州大学研究者提出逐节点带宽准则,将核有效秩与局部本征维数对齐,在CIFAR-100上六种编码器的SSL嵌入中一致优于固定带宽方法。
AI解读:高斯核的带宽 σ 是谱聚类、扩散映射等核化图方法的关键超参数:太小会把每个样本当成独立方向而夸大局部复杂度,太大则会让多个方向塌缩、条件数发散,几何区分度尽失。针对这个长期存在的调参难题,这篇论文提出按节点自适应设定带宽的准则——把核的有效秩匹配到由最小生成树估计的局部本征维数,并将搜索锚定在对数-对数尺度域——使得核的谱复杂度贴合数据流形自身的复杂度。对SSL任务的实际价值是:在CIFAR-100上,使用六种不同编码器提取的嵌入做留一法和标签传播分类时,自适应带宽一致优于固定带宽和已有的自适应方法。直接受益者是做图构建、半监督分类或流形学习的算法使用者:他们不再需要手动扫 σ,而是有了一条可操作、有理论依据的选择路径。但目前测试仅限单数据集(CIFAR-100)和六种编码器,泛化性仍待更大范围验证。
来自南加州大学的Ecem Bozkurt与Antonio Ortega在预印本平台arXiv发布论文《Geometry-Aware Graph Construction via Adaptive Spectral Bandwidth Control》,提出一种逐节点自适应带宽准则,用于改进谱聚类、扩散映射、稀疏核回归图等使用高斯核的核化图方法。该论文已被IEEE MLSP 2026接收,共 6 页、4 张图。
核带宽的尺度困境
论文指出,高斯带宽 σ 决定局部核算子的谱特征。当 σ 过小时,核会高估局部复杂度,把每个样本当作独立方向处理;当 σ 过大时,多个方向被折叠在一起,条件数发散,几何判别能力完全丢失。
逐节点带宽准则:匹配有效秩与本征维数
作者提出的准则使核的谱复杂度与底层流形的内在复杂度保持一致。具体操作上,该方法为每个节点设定带宽,将核的有效秩与通过最小生成树估计的局部本征维数相匹配,并将搜索锚定在符合流形特性的对数-对数尺度区间内。
实验评估结果
作者在CIFAR-100数据集上评估了来自六个编码器的自监督学习(SSL)嵌入,结果显示自适应带宽方法在留一法(LOO)分类和标签传播(LP)准确率上,一致优于固定带宽方法及其他竞争的自适应方法。