DM入门之Apriori小结

Apriori算法:使用候选项找频繁项集

Apriori算法是关联分析中一种基本算法,用于挖掘布尔关联规则频繁项集。原理:利用频繁项集的先验知识,使用逐层搜索的迭代方法,使用k项集探索(k+1)项集。这里先看哈二维Apriori算法。(一般数据库都是二维的嘛。。hehe)

Apriori性质:频繁项集的所有非空子集都必须也是频繁的。(一种反单调性质)

算法描述:
1、链接步:通过L<k-1>自连接产生候选k项集C<k>。
2、剪枝步:C<k>是L<k>的超集。利用Apriori性质,如果一个k项集的(k-1)项集不在L<k-1>中,则该k项集从C<k>中删除。(这种子集测试可以使用所有频繁项集的散列树快速完成)

上Pseudo Code:

None.gifApriori
None.gif输入:事务数据D;最小支持度阀值min_sup。
None.gif输出:D中的频繁项集L。
None.gif
None.gifL
<1> = find_frequent_1-itemset(D);
None.gif
For (k = 2; L<k-1> != empty; k++) {
None.gif    C
<k> = apriori_gen(L<k-1>, min_sup);
None.gif    
For each transaction t in D {
None.gif        C
<t> = subset(C<k>, t);    //找出t中是候选集的所有C<k>的子集
None.gif        
For each candidate c in C<t>
None.gif            c.count
++;
None.gif    }
None.gif    L
<k> = {c in C<k> | c.count >= min_sup}
None.gif}
None.gif
Return L = set of L<k>
None.gif
None.gifProcedure apriori_gen(L
<k-1>, min_sup)
None.gif    
For each itemset l1 in L<k-1>
None.gif        
For each itemset l2 in L<k-1>
None.gif            
If (l1[i] = l2[1]) && (l1[2= l2[2]) && … && (l1[k-2= l2[k-2]) && (l1[k-1< l2[k-1]) then {
None.gif                c 
= l1 * l2;    //union
None.gif                
if has_infrequent_subset(c, L<k-1>then
None.gif                    delete c;
None.gif                
else
None.gif                    add c 
to C<k>;
None.gif            }
None.gif    
Return C<k>;
None.gif
None.gifProcedure has_infrequent_subset(c, L
<k-1>)
None.gif    
For each (k-1)-subset s of c
None.gif        
If s not in L<k-1> then
None.gif
Return TRUE;
None.gif    
Return FALSE;
None.gif
None.gif



由频繁项集产生关联规则:  

Confidence(A => B) = P(A | B)
    = support(AB) / support(B) = support_count(AB) / support_count(B)

对于前面Apriori找出的每个频繁项集l,产生l的非空子集;(记得Apriori性质哦)
对于每个非空子集s,如果 support_count(l) / support_count(s) >= min_conf,则输出“s => (l – s)”(为什么用support_count(l)不用(l-s)?)



提高Apriori的有效性?数据结构的改进,扫描次数的降低等。  

1、散列项集计数,增加效率。
一个土一点的比喻:在Java里面用HashMap<Key, Val>来存。。还有种用trie树的,等我补习过Algorithms in C++再说。。

2、事务压缩:不包含k项集的事务不可能包含(k+1)项集。这样,可以给事务加删除标记,下次迭代不考虑之。

3、划分(Er。。不是等价类,是看程序设计的方便乱划,比如一次能装入内存多少就划多少)
两次扫描。第一次,将D中事务划分为n个非重叠部分,如果D中事务最小支持阀值为min_sup,则每个部分最小支持计数为(min_sup * 该部分事务数)。对每一部分,找出局部频繁项集。
局部频繁项集可能不是整个数据库D的频繁项集,但D的任何频繁项集必是局部频繁项集(WHY?)。所有局部频繁项集合并为全局候选项集。第二次扫描D,评估每个候选的实际支持度。

4、选样:就是抽样+检测手段,以精度换速度。

5、动态项集计数:不像Apriori仅在每次完整扫描前确定新的候选,现在在任何开始点添加候选集。(编程怎么实现比较好?)

转载于:https://www.cnblogs.com/dxz/archive/2007/04/05/dm_apriori_basics.html

本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若转载,请注明出处:http://www.mzph.cn/news/424034.shtml

如若内容造成侵权/违法违规/事实不符,请联系多彩编程网进行投诉反馈email:809451989@qq.com,一经查实,立即删除!

相关文章

三、自然语言分类

文章目录1 数据准备1.1 数据集拆分1.2 创建词库vocabulary1.3 batch数据&#xff0c;创建Iterator2 Word Averaging模型3 RNN模型4 CNN三种分类方式&#xff1a;Word Averaging模型、RNN、CNN。1 数据准备 第一步是准备数据。代码中用到的类库有spacy、torchtext。 torchtext中…

spring mvc学习(38):Unknow tag(c:forEach)错误解决办法,jstl.jar包以及standard.jar包下载与导入

解决问题步骤&#xff1a; ①&#xff1a;下载jstl.jar和standard.jar 点击下载jstl.jar 点击下载standard.jar ②&#xff1a;将两个包剪切到项目中的WEB-INF/lib文件夹内 右键加到eclipse环境中---bulidpath--add to path 第一行代码<% pagelanguage"java" im…

Flex【原创】Xml与Object互转/读写本地Xml文件

最近操作Xml文件比较多&#xff0c;因此封装了一下Xml文件操作类 主要功能包括&#xff1a; 1.Xml 转 Object 2.Object 转 Xml 3.读取本地Xml&#xff08;air&#xff09; 4.Xml写到本地&#xff08;air&#xff09; 代码如下&#xff1a; package {import flash.events.Eve…

处理SPS错误:只有在配置文件或 Page 指令中将启用会话状态设置为真时,才可以使用会话状态...

1、C:\Program Files\Common Files\Microsoft Shared\web server extensions\60\TEMPLATE\LAYOUTS目录里的 web.config文件里添加&#xff1a;<add name"Session" type"System.Web.SessionState.SessionStateModule"/> 加在<httpModules>里&am…

nlp中的经典深度学习模型(一)

文章目录1 DNN与词向量1.1 DNN1.2 skip-gram1.3 简单句子分类模型DAN2 RNNLSTMGRU2.1 RNN2.2 LSTM2.3 LSTM变种2.4 递归神经网络2.5 双向RNN2.6 堆叠RNN1 DNN与词向量 1.1 DNN 神经网络中每一个神经单元是一个线性变化加一个激活函数 sUTasU^TasUTa af(z)af(z)af(z) zWxbzWxb…

spring mvc学习(39):restful的crud实现删除方式

上图是目录结构&#xff0c;本节是有问同学的&#xff0c;当好好总结 pom.xml <project xmlns"http://maven.apache.org/POM/4.0.0" xmlns:xsi"http://www.w3.org/2001/XMLSchema-instance" xsi:schemaLocation"http://maven.apache.org/POM/4.0…

像程序员一样地思考

在成为程序员的道路上&#xff0c;要经历四个坎坷&#xff0c;让我们用四个境界来标明他们。 第一境界&#xff0c;就是前面所说的&#xff0c;掌握一门或则几门编程语言&#xff0c;会模仿例子来实现程序代码&#xff0c;并且让代码在计算机系统中运行起来。达到这个境界的人…

基于Hibernate+spring的公司网站打造中(二)

在JbossIDE上搭建hibernatespring 资源收集&#xff1a;一.下载JDK 地址&#xff1a;http://www.java.com/zh_CN/或者网上搜索 文件&#xff1a;jdk-1_5_0_07-windows-i586-p.exe 63.4M 二.下载JbossIDE2.1下载JBoss IDE for Eclipse 地址:http://mirror.in.th/sourceforg…

nlp中的经典深度学习模型(二)

attention和transformer都是面试重点。 文章目录3 seq2seqAttention3.1 Sequence to Sequence Model3.1.2 模型介绍3.1.2 模型训练3.2注意力机制3.2.1介绍3.2.1“Bahdanau” style attention3.2.2“Luong” style attention4 Transformer4.1 Multi-head Attention4.1.1 自注意力…

spring mvc学习(40):restful的crud实现增加方式

上图是目录结构&#xff0c;本节是有问同学的&#xff0c;当好好总结 pom.xml <project xmlns"http://maven.apache.org/POM/4.0.0" xmlns:xsi"http://www.w3.org/2001/XMLSchema-instance" xsi:schemaLocation"http://maven.apache.org/POM/4.0…

1:25万全国地形数据库说明(转)

总况1、数据库构成  全国1&#xff1a;25万数据库&#xff0c;是国家基础地理信息系统三个全国性空间数据库之一。它由地形数据库、数字高程模型&#xff08;DEM&#xff09;数据库、地名数据库三部分构成。地形数据库&#xff1a;以矢量方式存储管理1&#xff1a;25万地形图…

一个人也能精彩

今天听说一个兄弟说要在长沙买房了,很替他感到高兴的.也跟自己说,Pengc,你得加油了哦.下班后在公司玩了3个小时,到家快9点半了,不过最让人兴奋的莫过于成就感了,最近一直在弄xmlSchema的解析,感觉今天最有收获了.不过还得感谢老大Tiger,虽然他不知道我在这里感谢他&#xff0c;…

spring mvc学习(41):restful的crud的项目原型介绍

上图是目录结构&#xff0c;本节是有问同学的&#xff0c;当好好总结 pom.xml <project xmlns"http://maven.apache.org/POM/4.0.0" xmlns:xsi"http://www.w3.org/2001/XMLSchema-instance" xsi:schemaLocation"http://maven.apache.org/POM/4.0.…

nlp中的经典模型(三)

文章目录5 NLP中的卷积神经网络5.1 卷积5.2 多通道5.2 max pooling5 NLP中的卷积神经网络 RNN的问题&#xff1a; 1 时间复杂度高 2 最后一个向量包含所有信息。有点不可靠 CNN可以通过卷积核捕捉局部特征&#xff0c;那是不是可以用于句子&#xff0c;表示特定长度的词序列呢…

Android笔记-Activity相关+内存泄漏

看了下&#xff0c;上次学习android还是17年的事情&#xff0c;&#xff0c;&#xff0c;&#xff0c;两年过去了我现在终于来搞android了。。。 以下内容参考自&#xff1a;《Android从学习到产品》&#xff0c;《深入理解java虚拟机》&#xff0c;《操作系统之哲学原理》 先甩…

第一百二十九期:阿里内部员工,排查Java问题常用的工具单

平时的工作中经常碰到很多疑难问题的处理&#xff0c;在解决问题的同时&#xff0c;有一些工具起到了相当大的作用&#xff0c;在此书写下来&#xff0c;一是作为笔记&#xff0c;可以让自己后续忘记了可快速翻阅&#xff0c;二是分享&#xff0c;希望看到此文的同学们可以拿出…

再看机器翻译

前面有文章具体介绍了机器翻译用到的模型&#xff1a;seq2seq和加入attention机制。这里再说点别的。 1 机器翻译评价标准BLUE 参考文章介绍的很详细。论文地址&#xff1a;url 2 模型背后的理论&#xff1a;密码学 例如从中文翻译成英文&#xff0c;可以将中文看做是加密了…

为有朝一日自己弄个玩具玩而准备

减号&#xff0c;星号&#xff0c;问号和感叹号尽量可以用来做变量名或函数名 namespace : ns0/ns1/... : 使用 / 作分割符 module : module-name : 和文件名相同&#xff0c;包含函数和变量之类的 类型 int int : fn(param0type, param1type) funcName fn(arg0Name, arg1Name…

VML编程之------VML语言入门《VML极道教程》原著:沐缘华

《VML极道教程》原著:沐缘华1章4节:VML语言入门 1:VML语言入门 - 极道学法 在我正式开始讲解、你正式开始学习VML语言以前&#xff0c;请务必遵循以下规则&#xff0c;可以达到最佳效果、极道学习方法。 1:如果你学过HTML、CSS或精通HTML、CSS&#xff0c;那么建议你把学VML的…

第一百三十期:14种常见编程语言的优缺点及应用范围

C语言是一门通用计算机编程语言&#xff0c;应用广泛。面向过程的&#xff0c;数据与算法分开。它的重点在于算法和数据结构。1972年由美国贝尔实验室在B语言的基础上设计出。 作者&#xff1a;编程小新 C 概述:C语言是一门通用计算机编程语言&#xff0c;应用广泛。面向过程…