研究团队发布LongCounsel-8基准套件,模拟7749条五次咨询轨迹以追踪抑郁纵向变化
该基准套件包含三个独立生成的数据集,用于从多会话咨询对话中估测抑郁症状严重程度及其跨会话的动态变化。
AI解读:抑郁症评估通常依赖单次会话的静态打分,但治疗是一个长期过程,医生更需要知道患者的症状是在好转还是恶化。研究团队提出的LongCounsel-8基准套件正是为解决这一问题而设计:它通过真实客户画像、抑郁轨迹和咨询模式,模拟生成了7749条五次咨询的对话轨迹,并标记了每次会话的抑郁状态,为训练和测试纵向抑郁追踪算法提供了标准化数据。对现有方法的测试揭示了三个反直觉的现象:单次打分更准的模型未必能正确判断好转或恶化趋势;所有模型对恶化轨迹的可靠性都更低;并且加入更多历史会话反而可能降低趋势预测的准确性——这意味着简单堆叠历史数据不是有效策略。对研究人员而言,这个基准提供了比较不同追踪方法的统一参照;对临床工作者来说,它提醒了在解读模型输出时,恶化趋势的判断需要格外警惕。不过,该基准基于模拟数据,并非真实患者记录,其实用性仍待临床验证。
来自新加坡国立大学的研究人员提出LongCounsel-8基准套件,包含三个独立生成的数据集,共7749条五次咨询的抑郁追踪轨迹,旨在推动从单会话静态评估转向多会话纵向抑郁追踪。相关论文于2026年9月3日提交至arXiv(编号2609.03507)。
基准的构成与生成方法
LongCounsel-8中的轨迹以真实世界客户档案、抑郁轨迹、症状构成和咨询模式为基础,结合三种方法生成:基于档案的模拟(profile-grounded simulation)、基于经验的症状进展状态构建(empirically informed state construction)以及间接行为实现(indirect behavioral realization)。每条轨迹包含五次会话,并带有会话级别的抑郁标签。
研究团队称,模拟的自我报告能接近受控状态,表明标签具有保真度。
对现有抑郁追踪方法的评估发现
论文在现有抑郁追踪方法上的实验得出三项关键发现:
(1)较低的单词会话分数误差并不能保证准确识别趋势(改善或恶化);
(2)现有方法在恶化轨迹上的一致性较差;
(3)额外的会话历史可能降低趋势预测的准确性。