arXiv 于 2026 年 9 月 18 日发布了一篇题为《Goal-driven Variant Categorization(目标驱动的变体分类)》的新论文,作者为 Daniel Calegari 与 Daniel Amyot,论文编号 arXiv:2609.22475v1,归属计算机科学的人工智能(cs.AI)领域,同时涉及数据库(cs.DB)与软件工程(cs.SE)两个分类,DOI 为 10.48550/arXiv.2609.22475。
论文关注的是流程挖掘中一个长期存在的现实问题。流程发现(process discovery)技术很少能给出单一而一致的过程结构,实际得到往往是大量形态各异的流程变体。为了分析,常见做法是先按结构相似度对变体进行聚类,再为聚类出来的分组赋予业务含义。问题在于,这种划分并非从组织自身的目标出发,因此分析师必须逐一手工解读并把变体归并成对业务真正有意义类别。随着变体数量与复杂度的增长,这一高度依赖人工判断的环节会变得越来越困难。
作者提出的方案是把整个工作流“倒过来”。方法的第一步不是聚类,而是先编写组织的目标模型,由该模型预先定义分类所依据的维度。随后,每一个流程变体都会被转换成一段描述其行为的文本叙事,大语言模型(LLM)在目标模型的语境下解读这段叙事,并把该变体分配到最合适的类别中。通过这种方式,基于大模型的语义推理把低层次的流程行为与分析师定义的业务目标连接起来,使分类结果天然带上业务语义,而不再需要事后人为解释。
在实现层面,作者把这一思路完整地实例化为端到端流程,并在三个公开日志数据集上进行了评估。这三个日志在规模和行为多样性上差异显著,用以检验方法的适用广度。实验结果显示,在目标模型引导下得到的变体划分,与无引导的归纳式聚类所得到的结果存在明显差异;同时,当研究者对目标模型中声明的备选方案进行受控修改时,划分结果也会随之响应。这表明分类结果确实受到组织目标驱动,而不仅仅由结构相似度决定。
论文也坦承该方法的代价:它要求使用者先编写一份目标模型,这构成额外的前期投入。因此,这条路线在可解释性、目标对齐性与人工成本之间形成了一种新的权衡,为流程挖掘结果向业务语义的转化提供了一条不同于传统聚类的思路。