欢迎来到淘文阁 - 分享文档赚钱的网站! | 帮助中心 好文档才是您的得力助手!
淘文阁 - 分享文档赚钱的网站
全部分类
  • 研究报告>
  • 管理文献>
  • 标准材料>
  • 技术资料>
  • 教育专区>
  • 应用文书>
  • 生活休闲>
  • 考试试题>
  • pptx模板>
  • 工商注册>
  • 期刊短文>
  • 图片设计>
  • ImageVerifierCode 换一换

    数据挖掘考试题目—关联分析(共5页).doc

    • 资源ID:14366242       资源大小:24.50KB        全文页数:5页
    • 资源格式: DOC        下载积分:20金币
    快捷下载 游客一键下载
    会员登录下载
    微信登录下载
    三方登录下载: 微信开放平台登录   QQ登录  
    二维码
    微信扫一扫登录
    下载资源需要20金币
    邮箱/手机:
    温馨提示:
    快捷下载时,用户名和密码都是您填写的邮箱或者手机号,方便查询和重复下载(系统自动生成)。
    如填写123,账号就是123,密码也是123。
    支付方式: 支付宝    微信支付   
    验证码:   换一换

     
    账号:
    密码:
    验证码:   换一换
      忘记密码?
        
    友情提示
    2、PDF文件下载后,可能会被浏览器默认打开,此种情况可以点击浏览器菜单,保存网页到桌面,就可以正常下载了。
    3、本站不支持迅雷下载,请使用电脑自带的IE浏览器,或者360浏览器、谷歌浏览器下载即可。
    4、本站资源下载后的文档和图纸-无水印,预览文档经过压缩,下载后原文更清晰。
    5、试题试卷类文档,如果标题没有明确说明有答案则都视为没有答案,请知晓。

    数据挖掘考试题目—关联分析(共5页).doc

    精选优质文档-倾情为你奉上数据挖掘考试题目关联分析一、10个选择1.以下属于关联分析的是( )ACPU性能预测B购物篮分析C自动判断鸢尾花类别D股票趋势建模2.维克托迈尔-舍恩伯格在大数据时代:生活、工作与思维的大变革一书中,持续强调了一个观点:大数据时代的到来,使我们无法人为地去发现数据中的奥妙,与此同时,我们更应该注重数据中的相关关系,而不是因果关系。其中,数据之间的相关关系可以通过以下哪个算法直接挖掘( )AK-meansBBayes NetworkCC4.5DApriori3.置信度(confidence)是衡量兴趣度度量( )的指标。A简洁性B确定性C实用性D新颖性4.Apriori算法的加速过程依赖于以下哪个策略( )A抽样B剪枝C缓冲D并行5.以下哪个会降低Apriori算法的挖掘效率( )A支持度阈值增大B项数减少C事务数减少D减小硬盘读写速率6.Apriori算法使用到以下哪些东东( )A格结构、有向无环图B二叉树、哈希树C格结构、哈希树D多叉树、有向无环图7.非频繁模式( )A其置信度小于阈值B令人不感兴趣C包含负模式和负相关模式D对异常数据项敏感8.对频繁项集、频繁闭项集、极大频繁项集的关系描述正确的是( )注:分别以1、2、3代表之A3可以还原出无损的1B2可以还原出无损的1C3与2是完全等价的D2与1是完全等价的9.Hash tree在Apriori算法中所起的作用是( )A存储数据B查找C加速查找D剪枝10.以下不属于数据挖掘软件的是( )ASPSS ModelerBWekaCApache SparkDKnime二、10个填空1.关联分析中表示关联关系的方法主要有: 和 。2.关联规则的评价度量主要有: 和 。3.关联规则挖掘的算法主要有: 和 。4.购物篮分析中,数据是以 的形式呈现。5.一个项集满足最小支持度,我们称之为 。6.一个关联规则同时满足最小支持度和最小置信度,我们称之为 。7.在回归与相关分析中,因变量值随自变量值的增大(减小)而减小(增大)的现象叫做 。8.极大频繁项集不能无损还原出频繁项集,是因为它不包含频繁项集的 信息。9.经典的Apriori算法是逐层扫描的,也就是说它是 (选:深度/宽度)优先的。10.数据挖掘大概步骤包括:输入数据à预处理à挖掘à后处理à输出知识。其中,输出的知识可以有很多种表示形式,两种极端的形式是:内部结构难以被理解的黑匣子,比如说人工神经网络训练得出的网络;模式结构清晰的匣子,这种结构容易被人理解,比如说决策树产生的树。那么,关联分析中输出的知识的表示形式主要是 (选:黑匣子/清晰结构)。三、10个判断( )1.啤酒与尿布的故事是聚类分析的典型实例。( )2.Apriori算法是一种典型的关联规则挖掘算法。( )3.支持度是衡量关联规则重要性的一个指标。( )4.可信度是对关联规则的准确度的衡量。( )5.给定关联规则AàB,意味着:若A发生,B也会发生。( )6.频繁闭项集可用来无损压缩频繁项集。( )7.关联规则可以用枚举的方法产生。( )8.Apriori算法产生的关联规则总是确定的。( )9.不满足给定评价度量的关联规则是无趣的。( )10.对于项集来说,置信度没有意义。四、5个简答1.简述关联规则产生的两个基本步骤。2.Apriori算法是从事务数据库中挖掘布尔关联规则的常用算法,该算法利用频繁项集性质的先验知识,从候选项集中找到频繁项集。请简述Apriori算法的基本原理。3.简述Apriori算法的优点和缺点。4.针对Apriori算法的缺点,可以做哪些方面的改进?5.强关联规则一定是有趣的吗?为什么?数据挖掘考试题目+参考答案一、10个选择1.以下属于关联分析的是( B )ACPU性能预测B购物篮分析C自动判断鸢尾花类别D股票趋势建模2.维克托迈尔-舍恩伯格在大数据时代:生活、工作与思维的大变革一书中,持续强调了一个观点:大数据时代的到来,使我们无法人为地去发现数据中的奥妙,与此同时,我们更应该注重数据中的相关关系,而不是因果关系。其中,数据之间的相关关系可以通过以下哪个算法直接挖掘( D )AK-meansBBayes NetworkCC4.5DApriori3.置信度(confidence)是衡量兴趣度度量( B )的指标。A简洁性B确定性C实用性D新颖性4.Apriori算法的加速过程依赖于以下哪个策略( B )A抽样B剪枝C缓冲D并行5.以下哪个会降低Apriori算法的挖掘效率( D )A支持度阈值增大B项数减少C事务数减少D减小硬盘读写速率6.Apriori算法使用到以下哪些东东( C )A格结构、有向无环图B二叉树、哈希树C格结构、哈希树D多叉树、有向无环图7.非频繁模式( D )A其置信度小于阈值B令人不感兴趣C包含负模式和负相关模式D对异常数据项敏感8.对频繁项集、频繁闭项集、极大频繁项集的关系描述正确的是( B )注:分别以1、2、3代表之A3可以还原出无损的1B2可以还原出无损的1C3与2是完全等价的D2与1是完全等价的9.Hash tree在Apriori算法中所起的作用是( C )A存储数据B查找C加速查找D剪枝10.以下不属于数据挖掘软件的是( C )ASPSS ModelerBWekaCApache SparkDKnime二、10个填空1.关联分析中表示关联关系的方法主要有: 项集 和 关联规则 。2.关联规则的评价度量主要有: 支持度 和 置信度 。3.关联规则挖掘的算法主要有: Apriori 和 FP-Growth 。4.购物篮分析中,数据是以 不对称二元变量 的形式呈现。5.一个项集满足最小支持度,我们称之为 频繁项集 。6.一个关联规则同时满足最小支持度和最小置信度,我们称之为 强规则 。7.在回归与相关分析中,因变量值随自变量值的增大(减小)而减小(增大)的现象叫做 负相关 。8.极大频繁项集不能无损还原出频繁项集,是因为它不包含频繁项集的 支持度 信息。9.经典的Apriori算法是逐层扫描的,也就是说它是 宽度 (选:深度/宽度)优先的。10.数据挖掘大概步骤包括:输入数据à预处理à挖掘à后处理à输出知识。其中,输出的知识可以有很多种表示形式,两种极端的形式是:内部结构难以被理解的黑匣子,比如说人工神经网络训练得出的网络;模式结构清晰的匣子,这种结构容易被人理解,比如说决策树产生的树。那么,关联分析中输出的知识的表示形式主要是 清晰结构 (选:黑匣子/清晰结构)。三、10个判断( )1.啤酒与尿布的故事是聚类分析的典型实例。( )2.Apriori算法是一种典型的关联规则挖掘算法。( )3.支持度是衡量关联规则重要性的一个指标。( )4.可信度是对关联规则的准确度的衡量。( )5.给定关联规则AàB,意味着:若A发生,B也会发生。( )6.频繁闭项集可用来无损压缩频繁项集。( )7.关联规则可以用枚举的方法产生。( )8.Apriori算法产生的关联规则总是确定的。( )9.不满足给定评价度量的关联规则是无趣的。( )10.对于项集来说,置信度没有意义。四、5个简答1.简述关联规则产生的两个基本步骤。答:关联规则产生的两个基本步骤为:根据给定的支持度从项集中产生频繁项集;根据给定的置信度从频繁项集中产生关联规则。2.Apriori算法是从事务数据库中挖掘布尔关联规则的常用算法,该算法利用频繁项集性质的先验知识,从候选项集中找到频繁项集。请简述Apriori算法的基本原理。答:关联规则的产生并不依赖于Apriori算法,Apriori算法用来加速规则的产生过程。Apriori算法的加速过程依赖于这样一个先验原理:“频繁项集的子集是频繁的”。3.简述Apriori算法的优点和缺点。答:Apriori算法的优点:结构简单、易于理解。Apriori算法的缺点:产生大量的候选项集,I/O开销较大。4.针对Apriori算法的缺点,可以做哪些方面的改进?答:Apriori算法的缺点主要是产生的候选项集较多,从而导致I/O开销较大。由此,可以将庞大的数据集划分为可以装进内存的数据块,利用“频繁项集至少在一个分区中是频繁的”原理合并各个数据块产生的频繁项集得到最终的频繁项集。5.强关联规则一定是有趣的吗?为什么?答:不一定。因为:规则的评价标准有很多,可以是客观的也可以是主观的。另外,强规则也可能是负相关的,即因变量值随自变量值的增大(减小)而减小(增大)的现象。专心-专注-专业

    注意事项

    本文(数据挖掘考试题目—关联分析(共5页).doc)为本站会员(飞****2)主动上传,淘文阁 - 分享文档赚钱的网站仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对上载内容本身不做任何修改或编辑。 若此文所含内容侵犯了您的版权或隐私,请立即通知淘文阁 - 分享文档赚钱的网站(点击联系客服),我们立即给予删除!

    温馨提示:如果因为网速或其他原因下载失败请重新下载,重复下载不扣分。




    关于淘文阁 - 版权申诉 - 用户使用规则 - 积分规则 - 联系我们

    本站为文档C TO C交易模式,本站只提供存储空间、用户上传的文档直接被用户下载,本站只是中间服务平台,本站所有文档下载所得的收益归上传人(含作者)所有。本站仅对用户上传内容的表现方式做保护处理,对上载内容本身不做任何修改或编辑。若文档所含内容侵犯了您的版权或隐私,请立即通知淘文阁网,我们立即给予删除!客服QQ:136780468 微信:18945177775 电话:18904686070

    工信部备案号:黑ICP备15003705号 © 2020-2023 www.taowenge.com 淘文阁 

    收起
    展开