博客
关于我
强烈建议你试试无所不能的chatGPT,快点击我
<数据挖掘导论>读书笔记1
阅读量:6252 次
发布时间:2019-06-22

本文共 505 字,大约阅读时间需要 1 分钟。

数据预处理:

1.聚集:将两个或者多个对象合并成单个对象。

 2.抽样:一种选择数据对象子集进行分析的常用方法。抽象方法:简单随机抽样 和渐进抽样

3.维度约:我觉得翻译的不好,英文明细是降维。降维技术:1.PCA(Principal components Analysis)是一种用于连续属性的线性代数技术,它找出新的属性,这些属性是原属性的线性组合,是相互正交的,并且捕获了数据的最大变差。2.SVD(Singular Value Decomposition)

4.特征子集选择 a:嵌入方法 b:过滤方法 c:包装方法

5.特征创建:由原来的属性创建新的属性。a.特征提取 b.映射数据到新的空间 c.特征构造

6.离散化和二元化

  离散化:将连续属性变换成分类属性

  二元化:连续和离散属性变换成一个或者朵儿二元属性

7.变量变换:用户变量的所有值的变换

简单函数

规范化或者标准化

 

相似度和相异性的度量

1.简单属性之间的相似度和相异度

标称的

序数的

区间的或者比率的

 

2.数据对象之间的相异度

欧几里得距离

闵克夫斯基距离

3.数据对象之间的相似度

余弦相似度

Jaccard相似度

Bregman散度

 

转载地址:http://zsysa.baihongyu.com/

你可能感兴趣的文章
关于SQL注入,你应该知道的那些事
查看>>
jquery bxslider幻灯片样式改造
查看>>
常用JavaScript操作页面元素的方法
查看>>
学习进度条 12/18 到12/23
查看>>
varnish学习以及CDN的原理
查看>>
服务器配置 隐藏apache和php的版本
查看>>
将数据表中的数据导出到Excel、将Excel中的数据导入到数据表
查看>>
数据恢复系列(1)~恢复方案制定
查看>>
ASCII码值表
查看>>
关于Python中继承的格式总结
查看>>
2019年目标
查看>>
[SDOI2017]数字表格【莫比乌斯反演】
查看>>
每日一句(11)
查看>>
搭建nexus3版的maven私服(Centos7环境)
查看>>
[TJOI2017]可乐
查看>>
网易云信案例简析:锤科情怀缩影,子弹短信路在何方?
查看>>
c#-SimHash匹配相似-算法
查看>>
字符复习
查看>>
Linux系统挂载ntfs分区
查看>>
10.常见数据库操作1
查看>>