Loading...

人工智能基础课-08:机器学习-简约而不简单线性回归
岭回归实现正则化的方式是在原始均方误差项的基础上添加一个待求解参数的二范数项,对这个现象的一种解释是回归结果可以完美匹配理想样本点的分布,在数理统计中,回归分析是确定多种变量间相互依赖的定量关系的。今天我和你分享了机器学习基本算法之一的线性回归的基本原理,高尔顿的思想在今天的机器学习中依然保持着旺盛的生命力。所有样本同时出现的概率则是每个样本出现概率的乘积,岭回归的作用相当于在原始最小二乘的结果上做了缩放,样本中属性的数目甚至会超过训练集中的样本总数,在深度学习大行其道的今天,巨量的参数已经成为常。

人工智能基础课:课外辅导数学基础-拓展阅读参考书
这本通过直观形象的概念性解释阐述抽象的基本概念,同时辅以大量线性代数在各领域内的实。着重公式背后的代数意义和几何意义,同样配有大量应用实例,力图传授利用统计观点去观察和分析事物的能力,数理统计的基础读物可以选择陈希孺院士所著的。但它在机器学习中的重要作用毋庸置疑。讲清了信息论中各个基本概念的物理内。本书偏重于信息论在通信中的应用。入浅出地介绍线代中的基本概念,方差回归等统计学中的基本问题。线性代数推荐两本国外的教材。的角度探讨了基于频率的概率,很多机器学习中广泛使用的方法。本书包含部分概率论的内容,

人工智能基础课-07:机器学习-数山有路,学海无涯机器学习概论
学习器依赖已知数据对真实情况进行拟合,即由学习器得到的模型要尽可能逼近真实模型,因此要。每一组属性值的集合都是这个空间中的一个点,因而每个实例都可以视为特征空。数据的不同属性之间可以视为相互独立,因而每个属性都代表了一个不同的。实用的学习器都是测试误差较低,即在新样本上表现较好的学习器。机器学习要做的就是根据已有的训练数据推导出描述所有数据的模。需要注意的是这里的特征向量不是和特征值对应的那个概念,参数的取值也是影响模型性能的重要因素,同样的学习算法。训练误差描述的是输入属性与输出分类之间的相关性,

人工智能基础课-06:数学基础-明日黄花迹难寻形式逻辑
成的结论就可以为另一个产生式规则作为已知的前提或条件使用,以进一步解决更加复杂的问题,今天我和你分享了人工智能必备的形式逻辑基础,以及采用形式逻辑进行自动推理的基本原理,如果将认知过程定义为对符号的逻辑运算,人工智能的基础就是形式逻辑;当规则库中的某条产生式的前提可与事实库中的某些已知事实匹配时,个体词是可以独立存在的具体或抽象的描述对象,比如前文例子中的。亚里士多德的贡献不仅在于证明了人工智能的不断发展,人类的判断方式绝非一头扎进浩如烟海的数据中学习,这要求将一般成年人的知识和信念进行显式的表达,

人工智能基础课-05:数学基础-万物皆数,信息亦然信息论
最大熵原理的本质在于在推断未知分布时不引入任何多余的约束和假设,因而可以得到最不确定的结果,根据单个事件的自信息量可以计算包含多个符号的信源的信息熵。而不同的消息带来的信息即使在直观感觉上也是不尽相同的。各个符号的自信息量在信源构成的概率空间上的统计平均值。使得表示该信源所需的平均比特数最少(等于该信源的信源熵。上的数学期望应该相等,即对给定特征函数数学期望的估计应。重要的问题是一条消息来自于一个所有可能的消息的集。上的数学期望和在由训练数据集推导出的经验分布。但信息增益的值很大程度上依赖于数据集的信息。

人工智能基础课-04:数学基础-不畏浮云遮望眼最优化方法
在最优化方法中,基于数学定理的搜索式算法和基于仿生学原理的启发式算法,哪一种能够在人工智能的发展中发挥更大的作用呢?讲,由原目标函数和约束条件共同构成的拉格朗日函数与原目标函数具有共同的最优点集和共同的。的人工智能问题最后都会归结为一个优化问题的求解,因而最优化理论同样是人工智。当函数的输入为向量时,目标函数的图象就变成了高维空间上的曲面,可遗憾的是,目前实用的最优化算法都不具备这样的上帝视角。二阶导数描述的则是一阶导数如何随输入的变化而变化,在置信域内寻找目标函数的二次近似模型的最优点,

人工智能基础课-03:数学基础-窥一斑而知全豹数理统计
在人工智能的研究中,数理统计同样不可或缺。基础的统计理论有助于对机器学习的算法和数据挖掘的结果做出解释,只有做出合理的解读,数据的价值才能够体现。数理统计(mathematicalstatistics)根据观察或实验得到的数据来研究随机现象,并对研究对象的客观规律做出合理的估计和判断。虽然数理统计以概率论为理论基础,但两者之间存在方法上的本质区别。概率论作用的前提是随机变量的分布已知,根据已知的分布来分析随机变量的特征与规律;

人工智能基础课-02:数学基础-月有阴晴圆缺,此事古难全概率论
所谓“逆概率”解决的是在事件结果已经确定的条件下($P(A)$),推断各种假设发生的可能性($P(B_i|A)$)。全概率公式的作用在于将复杂事件的概率求解转化为在不同情况下发生的简单事件的概率求和,即$$P(A)=\sum_{i=1}^{N}P(A|B_i)\cdotP(B_i)$$$$\sum_{i=1}^{N}P(B_i)=1$$全概率公式代表了频率学派解决概率问题的思路,即先做出一些假设($P(B_i)$),再在这些假设下讨论随机事件的概率($P(A|B_i)$)。

人工智能基础课-01:数学基础-九层之台,起于累土线性代数
如果有一个集合,它的元素都是具有相同维数的向量(可以是有限个或无限个),并且定义了加法和数乘等结构化的运算,这样的集合就被称为线性空间(linearspace),定义了内积运算的线性空间则被称为内积空间(innerproductspace)。在线性空间中,变化的实现有两种方式:一是点本身的变化,二是参考系的变化。对一个给定向量,$L^1$范数计算的是向量所有元素绝对值的和,$L^2$范数计算的是通常意义上的向量长度,$L^{\infty}$范数计算的则是向量中最大元素的取值。

人工智能基础课-开篇词:人工智能新时代的必修课
人工智能的早期发展遵循的是符号主义学派的发展路径,但狭窄的应用领域让它在短暂的辉煌之后迅速走向沉寂。自此,人工智能不仅以如火如荼之势赚足了政策的关注、资本的涌入、以及吃瓜群众的眼球,其技术进展更是以令人瞠目结舌的速度狂飙突进,悄无声息地改造着普通人的生活。出于可读性的考虑,我在专栏里不会使用大量复杂的数学公式,而是力图以通俗的语言解释清楚公式背后的道理,起到入门的作用。你好,在未来的几个月中,我将通过“人工智能基础课”这个专栏和你分享人工智能的基础知识,以帮助你更好地理解人工智能的内涵。

机器学习40讲-结课:终有一天,你将为今天的付出骄傲
不知不觉间,又一个40期的机器学习专栏也走到了尾声。在专栏里,我从理解概率的两大流派入手,以每种流派中的各个模型为主线,对统计机器学习和贝叶斯机器学习做了系统的介绍,并从这些模型中梳理出它们之间关系的脉络,帮助你尽可能地从更加宏观的角度来理解模型内部的关联。和上一季的“人工智能基础课”相比,这一季专栏的内容聚焦于机器学习一点,力求更加深入地挖掘这个主题。增加深度意味着提升难度,无论是写作的我还是阅读的你,都需要投入更多的时间和精力去理解与消化。

机器学习40讲-总结课:贝叶斯学习的模型体系
比如在分析学生的成绩时,物理/化学/生物这几门课程之间会存在较强的相关性,政治/历史/地理这几门课程也会存在较强的相关性,物理/政治、化学/历史之间的相关性就会较弱,这样的相关关系就可以用理科和文科两个互不相关的公因子来刻画。在统计学习中,几乎所有模型都可以追溯到线性回归的演化,在贝叶斯学习里,起到万物之源作用的是具有最大不确定性的高斯分布,对高斯分布的不同处理方式决定了不同的数据生成方式。如果给高斯混合模型中的隐变量添加时序关系,让下一时刻的状态依赖于这一时刻的状态,就形成了隐马尔可夫模型。

机器学习40讲-40:结构学习基于约束与基于评分
具体的做法是判断选出的两个节点$i,j$在给定其他所有结点的条件下是否条件独立,如果存在让$i$和$j$满足$d$分离性的结点子集,那就把$i$和$j$之间的边去掉。基于评分的学习的首要任务是选择合适的评分函数。结构EM算法在具有结构和参数两个维度的假设空间内进行搜索,在每一轮次的搜索中,原始的EM算法是为固定的模型更新参数,结构EM算法则同时更新参数和模型,更新的方式是让模型的评分函数最大化,评分函数的选择是参数关于模型后验概率的信息熵,当然也可以使用贝叶斯信息量准则或者最小描述长度这类指标。

机器学习40讲-39:隐变量下的参数学习EM方法与混合模型
如果已知每个样本${\bfx}_n$所对应的隐变量$z_{nk}=1$,那就意味着第$n$个样本由第$k$个混合成分产生,上面的表达式就可以简化为$$L(\boldsymbol\theta|{\bfX},{\bfZ})=\sum\limits_{n=1}^N\log\pi_k\mathscr{N}({\bfx}_n|\boldsymbol\mu_k,\boldsymbol\Sigma_k)$$但隐变量本身也是随机变量,只能用概率描述。这里的硬币选择就是不能直接观测的隐变量。

机器学习40讲-38:完备数据下的参数学习有向图与无向图
在给定一组数据$a,b,c$时,这个实例的似然概率可以写成$$p(a,b,c)=\dfrac{\phi_1(a,b)\cdot\phi_2(b,c)}{Z}=\dfrac{\phi_1(a,b)\cdot\phi_2(b,c)}{\sum\limits_{a,b,c}\phi_1(a,b)\cdot\phi_2(b,c)}$$在对这个式子进行最大化时,就不能对$\phi_1(a,b)$和$\phi_2(b,c)$分开处理,各自求解最大值了。那就是简化参数估计的运算。

机器学习40讲-37:随机近似推断MCMC
但在具体问题中,任意选择的目标分布$p(x)$和起到转移矩阵作用的建议分布$q(x)$很难满足细致平稳性,这时就需要对它们做一些人为的修正,修正方式是引入参数$\alpha$,令它满足$$p(i)Q(i,j)\alpha(i,j)=p(j)Q(j,i)\alpha(j,i)$$不难看出,参数的引入使转移矩阵被修正为${\bfQ}(\cdot)\alpha(\cdot)$,这可以避免Metropolis算法对小概率样本的一刀切。有些时候,即使目标分布的形式是已知的,对它的求解也存在着困难。

机器学习40讲-36:确定近似推断变分贝叶斯
确定性近似的典型代表是变分贝叶斯推断(variationalBayesianinference),它解决的问题是对隐变量$\bfy$关于已知输入$\bfx$的后验概率$p({\bfy}|{\bfx})$的近似,近似的方式是利用最优的近似概率分布$q({\bfy})$来逼近$p({\bfy}|{\bfx})$。优化的目的是用简单的、容易计算的分布$q({\bfy})$来拟合复杂的、不容易计算的后验分布$p({\bfy}|{\bfx})$,优化的对象是变分下界。

机器学习40讲-35:精确推断变量消除及其拓展
fo$与$do$的关系已经由上面计算出的新因子所定义,与$lo$的关系则是纯粹的条件概率,两者结合可以表示为另一个新因子$$\psi_2(do,lo)=\sum\limits_{fo}\psi_1(fo,do)p(fo)p(lo|fo)$$变量$lo$只出现在新因子$\psi_2$中,消除这个变量的结果就是只和变量$do$有关的因子$\psi_3(do)=\sum_{lo}\psi_2(do,lo)$求和。从运算效率的角度对变量消去加以改进,得到的就是置信传播算法。

机器学习40讲-34:连续序列化模型线性动态系统
隐藏状态变量初始的取值${\bfX}^{(0)}$也满足高斯分布,其概率密度可以写成$$P({\bfX}^{(0)})=\mathscr{N}({\bfX}^{(0)}|\boldsymbol\mu_0,V_0)$$如果将线性动态系统放在状态空间表象(statespacerepresentation)下观察,上面的条件概率就可以改写成状态方程的形式$${\bfX}^{(n)}={\bfA}{\bfX}^{(n-1)}+{\bfw}$$

机器学习40讲-33:序列化建模隐马尔可夫模型
在隐马尔可夫模型中,罐子表示的是由概率模型生成的不可观测的随机序列,每个罐子都代表了系统的一种状态,所以这个隐藏的序列叫作状态序列(statesequence),也就是上图中圆圈的部分。这里的上层分布起到的就是前面无信息先验的作用,可以决定哪些状态更容易出现,它的浓度参数决定了状态的密度。假设所有可能的状态$q_i$总共有$N$个,所有可能的观测结果$v_j$总共有$M$个,所有抽取出的状态结果$i_t$构成长度为$T$的状态序列,所有状态生成的观测结果$o_t$则构成长度为$T$的观测序列。

欢迎留下您的脚印