研究:LLM能从代码提交中提取架构设计决策,但常遗漏决策理由

一项初步研究测试了四款大语言模型从源代码提交中恢复架构设计决策的能力,结果显示模型在自动评估中表现尚可,但生成内容往往过长且偏重实现细节。

AI解读:这项研究要解决的是一个具体问题:软件系统的架构设计决策很少被正式记录,往往只藏在代码提交里,导致后来维护的人很难理解当初为什么这样设计。研究者测试了四款大语言模型,发现它们能从提交信息中提炼出架构决策,自动评估分数不低,但人工检查发现生成内容经常太长、太关注实现细节,反而漏掉了关键的决策动机。这意味着,如果你指望用现成的LLM直接完成架构知识管理,目前还不够可靠——模型能帮你找到候选的决策点,但最终判断和补充理由仍需要架构师介入。研究采用的样本只有30条,属于初步探索,结论的普适性还有待更大规模验证。

一项预印本研究测试了四款大语言模型(Gemini 3 Pro、DeepSeek R1、Kimi K2和Qwen3)从源代码提交中提取架构设计决策(ADD)的能力,结果显示模型在自动评估指标上表现尚可(BERT-F1均高于 0.81),但人工审查发现生成内容往往过长、偏重实现细节,且常遗漏决策背后的理由。

研究设计

该研究由Amey Karan、Rudra Dhar、Mohamed Soliman和Karthik Vaidhyanathan完成,已投稿至ECSA 2026的IdeaArch研讨会。研究者使用零样本和少样本提示(fewshot prompting)两种方式,在来自开源项目的 30 条开发者撰写的ADD上测试了四款LLM。

评估采用ROUGE-L、BLEU、METEOR和BERTScore四项自动指标,另有一位作者对Gemini的输出进行了人工审查。

主要结果

所有模型在BERT-F1上都超过 0.81;少样本提示能提升对齐度,例如Gemini的BERT-F1从 0.828 提升至 0.847。

然而,人工审查发现生成的ADD经常过长、过于关注实现细节,并且遗漏了决策背后的理由。研究者据此指出,架构感知的LLM系统和自动化架构知识管理(AKM)仍有改进空间。

信息来源