NPCI研究团队发布FiMI Banking框架:面向印度零售银行的受控对话AI基准

研究显示,偏好优化与可验证奖励强化学习互补,能显著提升银行对话系统的安全性与工具使用能力。

AI解读:通用大模型在银行业务中常因缺乏场景知识或工具使用不当而失误。NPCI研究团队为此构建了FiMI Banking基准,基于印度零售银行的真实文档、结构化答案、合成客户资料和银行工具来训练和评估。研究发现,偏好优化可将越界提问的拒答率从52%提升至80%,而可验证奖励的强化学习则在边缘案例和需要严格顺序操作的任务上取得显著提升,同时token消耗减少29%。对开发者而言,这意味着构建可靠的银行对话助手不应只依赖单一训练方法,而需针对不同任务分层优化。

NPCI人工智能研究团队(NPCI AI Research Team)在arXiv上发布论文(编号arXiv:2609.03960v1),介绍了一个名为FiMI Banking的受控印度零售银行研究环境。该环境基于经过审核的银行文档、结构化标准答案、合成客户资料及银行工具构建,旨在评估对话系统在银行业务中的可靠性。

研究背景与动机

研究指出,银行需要能回答产品问题、协助账户相关请求,并严格遵守操作与监管约束的对话系统。通用语言模型在需要基于事实的信息回答、正确使用工具或是谨慎处理银行特定敏感情境时,表现并不稳定。

训练方法与实验结果

研究对比了两种后训练方法:偏好优化(preference optimization)用于改善模型回答层面的行为,以及使用可验证奖励的强化学习(reinforcement learning with verifiable rewards)以提升多轮工具调用任务的表现。结果显示,偏好优化显著提升了模型的安全行为——对于超出服务范围的问题,拒答率从52%提高到80%。强化学习则将边界案例的处理性能从0.509提升到0.718,对顺序敏感的任务的处理性能从0.590提高到0.679,同时生成的token减少了29%。

  • 偏好优化将越界提问的拒答率从52%提升至80%。
  • 强化学习将边界案例性能从0.509提升至0.718,顺序敏感任务性能从0.590提升至0.679。
  • 强化学习方法同时减少了29%的token生成量。

研究结论

论文作者总结认为,偏好优化与可验证奖励的强化学习分别应对了可靠银行智能体的互补性需求。该论文作者来自NPCI AI Research Team,包括Aman Kumar、Asit Desai、Chandra Bhushan等人,论文于2026年9月3日提交,9月4日对外发布。

信息来源