9月22日,江苏苏商银行一项正申请专利的发明“一种领域自适应大语言模型对齐方法”公布。其申请于2026年6月22日,涉及人工智能技术领域。
其方法包括构建多智能体的协作框架,并将多智能体的协作框架配置于大语言模型系统中,由指令生成智能体基于协作框架对知识要素进行指令生成,获得候选训练指令集;由质量评估智能体基于协作框架对所述候选训练指令集中的表述逻辑进行自我批评和质量筛选,以获得最终训练指令;由领域对齐智能体基于预先构建的领域知识图谱中的知识语句对最终训练指令进行知识整合,并基于知识整合结果更新所述大语言模型的参数。
该发明实现了从领域知识建模到模型对齐更新的全流程自动化,解决了现有大语言模型在垂直领域应用中的知识缺失、原则冲突和实时性不足等问题。
该发明的背景为,大语言模型(Large Language Model,LLM)是基于Transformer架构在大规模文本语料上预训练得到的神经网络模型。Transformer架构由Vaswani等人于2017年在论文“Attention is All You Need”中提出,其核心是自注意力机制(Self-Attention),能够有效捕捉序列中任意位置之间的依赖关系,突破了循环神经网络在长距离依赖建模上的局限性。基于此架构,GPT系列、BERT、LLaMA等模型在自然语言处理任务上取得了显著成效。这些模型通过在互联网规模的文本数据上进行预训练,学习到了丰富的语言知识和世界知识,展现出强大的文本生成和理解能力。
然而,通用大语言模型在垂直领域应用时面临若干挑战。首先是领域知识覆盖不足:预训练语料中特定行业的专业内容占比有限,导致模型对专业术语、行业规则、操作流程的理解不够深入。例如,金融领域的监管规定、医疗领域的诊疗规范、法律领域的条文解释等专业知识,在通用预训练语料中的覆盖往往不足。其次是领域原则冲突:模型从互联网数据中学习时,可能习得与特定领域规范相矛盾的知识模式。例如,在金融客服场景中,模型可能给出不符合投资者适当性管理要求的建议;在医疗问答场景中,可能给出不符合临床指南的建议。再次是知识时效性不足:领域知识持续更新演进,新的法规政策、行业标准、技术规范不断发布,而模型的知识在预训练完成后即被固化。传统的全量微调方法周期长、成本高,难以快速适配知识更新的需求。
现有的模型对齐技术主要包括监督微调(Supervised Fine-Tuning,SFT)和人类反馈强化学习(Reinforcement Learning from Human Feedback,RLHF)两大类。监督微调需要大量人工标注的高质量指令数据,标注成本高昂且难以覆盖所有应用场景。人工标注还面临标注者专业知识有限、标注标准难以统一、标注效率低等问题。人类反馈强化学习通过训练奖励模型来捕获人类偏好,但在领域对齐方面存在局限性:奖励信号难以精确表达复杂的领域原则,标注者对专业领域的理解深度不一,且RLHF的训练过程复杂、稳定性不足。此外,现有方法通常采用单一策略处理所有类型的领域原则,缺乏针对不同特性原则的差异化处理能力。
因此,亟需一种能够自动化生成高质量训练数据、灵活适配不同类型领域原则、支持知识动态更新的大语言模型对齐技术。该发明的目的正是针对现有技术存在的不足,提供一种领域自适应大语言模型对齐方法。
展开全文
- 移动支付网 | 2026/8/24 11:13:44
- 移动支付网 | 2026/7/14 9:14:56
- 移动支付网 | 2026/5/14 10:19:17
- 移动支付网 | 2025/12/25 8:56:43
- 移动支付网 | 2025/11/20 11:02:53
- 移动支付网 | 2025/11/17 9:54:29
- 移动支付网 | 2025/10/15 9:43:03
- 移动支付网 | 2025/8/13 11:39:15
- 移动支付网 | 2025/4/15 11:43:07
- 移动支付网 | 2025/3/21 11:25:16
- 移动支付网 | 2026/9/14 18:14:23
- 移动支付网 | 2026/8/17 10:55:46
- 移动支付网 | 2025/7/4 11:21:22
- 移动支付网 | 2019/10/30 11:49:27
- 移动支付网 | 2026/10/9 18:47:18






