机器学习(周志华西瓜书) 参考答案 总目录
http://blog.csdn.net/icefire_tyh/article/details/52064910显然(∑nu=1|xiu−xju|p)1p满足非负性,同一性和对称性。只考虑直递性: distmk(xi,xj)=(∑nu=1|xiu−xju|p)1p distmk(xi,xk)=(∑nu=1|xiu−xku|p)1p distmk(xj,xk)=(∑nu=1|xju−xku|p)1p 显然当xku不在xiu和xju之间,|xiu−xku|+|xju−xku|会明显大于|xiu−xju|,使得直递性成立。 取特殊情况:对所有的u,都有xju≤xku≤xiu, 设au=|xiu−xku|,bu=|xku−xju|,则|xiu−xju|=au+bu,且au,bu≥0 所以根据闽可夫斯基不等式 (1).p≥1时,有(∑apu)1p+(∑bpu)1p≥(∑(au+bu)p)1p,直递性成立。 (2).p≤1时,有(∑apu)1p+(∑bpu)1p≤(∑(au+bu)p)1p,直递性不成立。 (3).根据极限法则可以得出 limp→∞(∑nu=1|xiu−xju|p)1p=(maxu|xiu−xju|)limp→∞(∑nu=1(|xiu−xju|maxu|xiu−xju|)p)1p=maxu|xiu−xju| 由于p \rightarrow ∞ ,\sum_{u=1}^n(\frac{|x_{iu}-x_{ju}|}{max_u|x_{iu}-x_{ju}|})^p=1 所以得证。
这个距离有点不好理解,形象点说dist_h(X,Z)是对X内所有点做圆并慢慢扩大,遇到的第一个属于Z的点时的半径,就是当前点的min{z \in Z}||x-z||_2,而所有半径中最大的一个,就是dist_h(X,Z)。由此可以看出dist_h(X,Z)是X中的样本往Z做圆,dist_h(Z,X)是Z中的样本往X做圆,所以两者不一定相当,取较大的一个作为距离。 非负性,同一性和对称性是很明显的,省略。 直递性:由于表达式太抽象,解析法不知道怎么泛化去解。取个简单的特殊情况,假设集合是连续的区间,在平面上用圆来表示 如图可知, dist_h(X,Y)是X,Y两个圆的距离加上直径,也就是圆心距加上X的半径减去Y的半径。 即dist_h(X,Y)=|o_x-o_y|+r_x-r_y 那么dist_H(X,Y)就是圆心距加上X,Y中较大的半径减去较小的半径
dist_H(X,Y)=|o_x-o_y|+max(r_x,r_y)-min(r_x,r_y) dist_H(X,Z)=|o_x-o_z|+max(r_x,r_z)-min(r_x,r_z) dist_H(Y,Z)=|o_y-o_z|+max(r_y,r_z)-min(r_y,r_z)
显然|o_x-o_z|+|o_y-o_z| \geq |o_x-o_y| 假设r_x \geq r_y 当r_z \geq r_x时 max(r_x,r_y)-min(r_x,r_y)=r_x-r_y \leq r_z-r_y=max(r_y,r_z)-min(r_y,r_z) 当r_z \leq r_y时 max(r_x,r_y)-min(r_x,r_y)=r_x-r_y \leq r_x-r_z=max(r_x,r_z)-min(r_x,r_z) 当r_x\geq r_z \geq r_y时 max(r_x,r_y)-min(r_x,r_y)=r_x-r_y=(r_x-r_z)+(r_z-r_y)=max(r_y,r_z)-min(r_y,r_z)+max(r_x,r_z)-min(r_x,r_z) 所以dist_H(X,Z)+dist_H(Y,Z) \geq dist_H(X,Z)
不能,因为k均值算法只是局部最有的近似算法,只能找到初始化均值附近的局部最优解,无法找到全局最优解。
由题意显然最大性是满足的。 连接性:假设x_i为核心对象,由于x_j可以由x_i密度可达。则存在核心对象x_k,使得x_i与x_k密度直达,x_k与x_j密度直达。由于x_k是核心对象,则x_k与x_i密度直达。且密度直达是密度可达的子集,所以x_k与x_j密度可达,x_k与x_i密度可达,所以x_i与x_j密度相连。
最大距离可以认为是所有类别先生成一个能包围所有类内样本的最小圆,然后所有圆同时慢慢扩大相同的半径,哪个类圆能完全包围另一个类则停止,并合并这两个类。由于此时的圆已经包含另一个类的全部样本,所以称为全连接。 最小距离则是扩大时遇到第一个非自己类的点就停止,并合并这两个类。由于此时的圆只包含另一个类的一个点,所以称为单连接。
显然高斯混合聚类是一种可能产生非凸的聚类方式。 高斯混合聚类并不是去最小化类间均方误差,而是通过概率模型来计算每个样本属于每个分类的概率,最后概率最大的。高斯混合概率模型不再单纯与均值相关,而且和方差(协方差)有关,所以不再一定得到凸聚类。 其余如k-means,LVQ,DBSCAN,AGNES都是凸聚类。
略。
混合属性中的连续属性,可以标准的距离为距离参数。 对于非连续属性的距离参数,可以将属性看成是字符串,计算距离时,一对一对比两个字符串各个位置的值相同的次数,并通过计算求出距离。比如两个字符串长度分别为l_i,l_2,一共对比l_il_2次,相同的字符为k,那么距离参数可以认为是t(1-\frac{k}{l_il_2}),t为一个合适缩放倍数。 然后通过指数函数将距离参数影射成真正的距离,此时的距离是非度量距离。
