新张量补全框架CTTC:以张量形式整合辅助信息,提升药物效果预测精度

密歇根大学等机构研究者提出Coupled Tensor-Tensor Completion(CTTC)方法,允许将基因相似度等多维辅助信息以张量形式融入补全任务,在DTD和LINCS两个基准数据集上运行时间和精度均优于现有方法。

AI解读:许多生物医学问题可转化为张量补全任务:根据多维数组(张量)中已观察到的条目来推测缺失值,例如利用已知的药物—基因作用关系预测未知的药物效果。传统方法只能把基因相似度这类辅助信息整理成二维矩阵再融入模型,信息维度受限。CTTC的突破在于允许辅助信息本身也是张量,从而直接利用多模态数据间的隐藏关联来提升补全效果。论文作者在DTD和LINCS两个基准数据集上对比了HaLRTC、CTRC、Cell、NTDDR等方法,称CTTC在运行时间和相对平方误差(RSE)精度上均更优。对做药物重定位研究的团队来说,这意味着可以用统一框架处理更复杂的先验信息,减少手动把数据压成矩阵的步骤;但论文方法目前仍是预印本状态,实际效果尚待领域验证。

arXiv预印本论文提出一种名为Coupled Tensor-Tensor Completion(CTTC)的张量补全新框架,其核心改进是允许将基因—基因相似度等多维辅助信息以张量形式而非仅以矩阵形式整合进模型。论文作者称,在DTD和LINCS两个基准数据集上,CTTC的运行时间与相对平方误差(RSE)精度均优于HaLRTC、CTRC、Cell和NTDDR等现有张量补全方法。

该论文由Maryam Bagherian、Albert Hung、Ivo Dinov和Joshua Welch撰写,2026年9月2日提交至arXiv,归类于数值分析(math.NA)与机器学习(cs.LG)交叉方向。论文摘要称,CTTC在距离度量学习与群论基础上建立理论框架,并推导出交替求解算法,证明其能收敛至驻点。

方法背景与理论属性

论文摘要指出,许多生物医学挑战可被建模为张量补全问题:利用多维数组(张量)中已观察到的条目来推测缺失值。在此类设定下,纳入关于张量各模态的辅助信息(如基因—基因相似性)可显著提升补全效果。现有大多数张量补全方法只能以矩阵形式纳入辅助信息,而CTTC是作者提出的可纳入张量形式辅助信息的新框架。

摘要进一步说明,CTTC除实际效用外,还具有距离度量学习和群论层面的理论基础;作者推导出的交替算法可求解CTTC优化问题,并已建立其收敛到稳定点的证明。

评测结果与基准

根据论文摘要中的结果描述,CTTC与HaLRTC、CTRC、Cell和NTDDR等张量补全方法相比,在DTD和LINCS两个基准数据集上展现出更优的运行时间与RSE张量补全精度。

本文依据的是arXiv公开的论文摘要,未完整阅读全文,未核实具体实验设置、超参数选择与统计显著性检验细节。该论文为预印本(v1状态),其arXiv DOI仍在等待DataCite注册。

信息来源