信息与控制

北大核心,JST,CSCD,WJCI,

国内刊号:21-1138/TP

国际刊号:1002-0411

信息与控制杂志2019年第3期:一种基于Spark的不确定数据集频繁模式挖掘算法

发布日期:

作者:杨阳, 丁家满, 李海滨, 贾连印, 游进国, 姜瑛

关键词:不确定数据, 数据挖掘, 频繁模式, Spark

如何在海量不确定数据集中提高频繁模式挖掘性能是目前研究的热点.传统算法大多是以期望、概率或者权重等单一指标为数据项集支持度,在大数据背景下,同时考虑概率和权重支持度的算法难以兼顾其执行效率.为此,本文提出一种基于Spark的不确定数据集频繁模式挖掘算法(UWEFP),首先,为了同时兼顾数据项的概率和权重,计算一项集的最大概率权重值并进行剪枝;然后,为了减少对数据集的多次扫描,结合Spark框架的优点,设计了一种具有FP-tree特征的新颖的UWEFP-tree结构进行模式树的构建及挖掘;最后在Spark环境下,以UCI数据集进行实验验证.实验结果表明本文的方法在保证挖掘结果的同时,提高了效率.

来源:2019年第3期

《信息与控制》期刊编辑部

查看信息与控制杂志2019年第3期

联系我们

  • 地址:辽宁省沈阳市创新路135号
  • 电话:024-23970049
  • E-mail:xk@sia.cn

咨询工作人员