BioGlyph:将网络拓扑编码为结构化角色语言,提升大模型网络推理准确率最高26个百分点
arXiv预印本论文提出BioGlyph,把图分区与结构测量转化为可解释的通用词汇,让开源大模型在网络结构推理任务中超越边列表、数值和习得表示等方法。
AI解读:大模型读得懂文字,却读不懂关系网络:蛋白互作、社交关系、电网这类数据一旦写成边列表或表格,模型很难判断哪个节点是枢纽、哪些连接跨社区、删掉某个节点会怎样。BioGlyph的解法是把网络拓扑翻译成一种描述“结构角色”的语言——每个元素被标为枢纽、社区核心或跨社区连接者,并附上证据和语义后果,再喂给模型。论文报告,在跨越五个领域的二十个网络上,开源大模型的系统准确率最高提升 26 个百分点,且增益来自这种可解释的角色编码,而非数据格式本身。对做生物网络或社交网络分析的人,这意味着可以用现成大模型直接回答结构问题,无需重新训练;但要注意,效果在稀疏网络上会减弱,而且论文目前只是arXiv预印本,尚未经过同行评审,实际使用时还需自行验证。
arXiv预印本论文提出BioGlyph,一种将网络拓扑结构转换成可解释语言表示的方法,用于提升大语言模型(LLM)回答网络结构推理问题的能力。论文称,在跨越五个领域的二十个网络上,BioGlyph使开源LLM的系统准确率最高提升 26 个百分点。
BioGlyph结合图分区与结构测量,识别枢纽(hubs)、社区核心(community cores)和跨社区连接者(cross-community connectors)等角色,并按固定规则将这些角色翻译成通用词汇。每个元素通过其结构角色、支持证据和语义后果来描述,网络本身和LLM均保持不变。
方法与评估
论文指出,网络描述生物及其他领域的系统,如蛋白相互作用、社交关系、电网和引文记录,推理这些系统需要理解其结构:哪些元素是核心,哪些连接桥接不同社区,以及移除元素后结构如何变化。然而,当网络以边列表、句子或测量表形式呈现时,LLM难以回答此类问题,因为需要从文本中推断结构含义。
BioGlyph利用图分区和结构测量识别网络角色,并通过语义可解释的术语显式编码结构角色。消融实验表明,性能提升正是来自这种显式编码。增益在密集且具有社区结构的网络中更为显著,而在拓扑结构较容易从文本推断的稀疏网络中则减弱。
- 在二十个网络、五个领域的测试中,BioGlyph优于基于边的、数值的和习得表示方法,系统准确率最高提升 26 个百分点。
- 在芽殖酵母蛋白互作网络中,BioGlyph揭示了生物学组织:跨社区连接者富含必需基因(essential genes),而外围蛋白则相对缺乏。
发布信息
论文题为“Language-encoded network topology enables large language models to reason about complex networks”,作者为Ucchwas Talukder Utsha、Sakib Mostafa、James Zou和Md Tauhidul Islam。预印本于 2026 年 9 月 3 日提交至arXiv(编号 2609.03229v1),归类于机器学习(cs.LG)。
论文摘要明确指出,该研究依据的是摘要内容;本报道仅基于论文提供的摘要信息,未涉及同行评审或完整实验细节。