arXiv 於 2026 年 9 月 18 日釋出了一篇題為《Goal-driven Variant Categorization(目標驅動的變體分類)》的新論文,作者為 Daniel Calegari 與 Daniel Amyot,論文編號 arXiv:2609.22475v1,歸屬電腦科學的人工智慧(cs.AI)領域,同時涉及資料庫(cs.DB)與軟體工程(cs.SE)兩個分類,DOI 為 10.48550/arXiv.2609.22475。
論文關注的是流程挖掘中一個長期存在的現實問題。流程發現(process discovery)技術很少能給出單一而一致的過程結構,實際得到往往是大量形態各異的流程變體。為了分析,常見做法是先按結構相似度對變體進行聚類,再為聚類出來的分組賦予業務含義。問題在於,這種劃分並非從組織自身的目標出發,因此分析師必須逐一手工解讀並把變體歸併成對業務真正有意義類別。隨著變體數量與複雜度的增長,這一高度依賴人工判斷的環節會變得越來越困難。
作者提出的方案是把整個工作流“倒過來”。方法的第一步不是聚類,而是先編寫組織的目標模型,由該模型預先定義分類所依據的維度。隨後,每一個流程變體都會被轉換成一段描述其行為的文本敘事,大語言模型(LLM)在目標模型的語境下解讀這段敘事,並把該變體分配到最合適的類別中。透過這種方式,基於大模型的語義推理把低層次的流程行為與分析師定義的業務目標連線起來,使分類結果天然帶上業務語義,而不再需要事後人為解釋。
在實現層面,作者把這一思路完整地例項化為端到端流程,並在三個公開日誌資料集上進行了評估。這三個日誌在規模和行為多樣性上差異顯著,用以檢驗方法的適用廣度。實驗結果顯示,在目標模型引導下得到的變體劃分,與無引導的歸納式聚類所得到的結果存在明顯差異;同時,當研究者對目標模型中宣告的備選方案進行受控修改時,劃分結果也會隨之響應。這表明分類結果確實受到組織目標驅動,而不僅僅由結構相似度決定。
論文也坦承該方法的代價:它要求使用者先編寫一份目標模型,這構成額外的前期投入。因此,這條路線在可解釋性、目標對齊性與人工成本之間形成了一種新的權衡,為流程挖掘結果向業務語義的轉化提供了一條不同於傳統聚類的思路。