统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

2
我可以使用glm算法进行多项式逻辑回归吗?
我在项目中使用Spotfire(S ++)进行统计分析,并且必须对大型数据集运行多项逻辑回归。我知道最好的算法应该是mlogit,但不幸的是,这在s ++中不可用。但是,我可以选择使用glm算法进行回归。我想在这里澄清两件事: 1.我的理解是否正确,glm也可以用于运行多项式逻辑回归? 如果对上一个问题的回答是“是”,那么应在glm算法中使用哪些参数? 谢谢,

2
处理具有可变数量特征的数据集
对具有可变数量特征的数据进行分类的方法有哪些? 例如,考虑一个问题,其中每个数据点都是x和y点的向量,而每个实例的点数不相同。我们可以将每对x和y点视为一个特征吗?还是应该以某种方式总结这些点,以便每个数据点都具有固定数量的功能?

3
动态推荐系统
一个推荐系统将测量不同用户的收视率和产量的建议关于这可能是他感兴趣的项目给定用户之间的相关性。 但是,口味会随着时间而变化,因此旧评分可能无法反映当前的偏好,反之亦然。您可能曾经将“优秀”放到一本书中,现在将其评为“不太讨厌”,依此类推。而且,利益本身也会发生变化。 推荐系统如何在不断变化的环境中工作? 一种选择是切断“旧”等级,假设您正确定义了“旧”,它可能就可以正常工作(您甚至可以说等级永不过期并假装问题不存在)。但这不是最好的选择:当然,口味会演变,这是正常的生活流程,并且没有理由为什么我们不能使用曾经正确的过去评级的额外知识。 另一种选择是以某种方式容纳这些额外的知识。因此,我们不仅可以为您当前的兴趣找到一个“即时匹配”,还可以为您建议您接下来可能喜欢的事情(而不是现在可能喜欢的事情)。 我不确定我是否解释得足够好。基本上,我赞成第二种方法,并且谈论的是一种推荐系统,该系统将测量口味轨迹和产量建议之间的相关性,从而满足个人需求。好吧,我们称之为个人成长-因为它们将来自那些“口味轨迹”(而不仅仅是“口味快照”)与您的相似。 现在的问题是:我想知道是否已经存在类似于“选项2”的东西,如果存在,我想知道它是如何工作的。如果不存在,欢迎您讨论它的工作方式!:)

3
一个人能告诉一个小学生统计学和机器学习什么?
下周,我们有一个来自当地一家学校的实习生。他短暂实习的概念是了解现实世界的工作方式以及某些工作的处理方式,日常工作的样子等。 现在我想知道,一个人能告诉/展示/演示这样一个关于统计学和机器学习的小孩,以便他/她 了解这方面的基本思想 变得很热情(假设孩子的先验知识对其他兴趣没有太大权重) 第二天不会忘记的 我主要是在寻找粘贴图像,演示示例等。 孩子的背景: 15-16岁 基本的数学概念是已知的(什么是图形,三个规则,什么是变量(从数学上讲,不是统计学上的说法)) 由于此问题的难点是在没有任何背景知识的情况下向您解释您所在的地区,因此该问题也可以作为与亲戚和朋友聊天的参考。 旁注:我特意跳过了对工作的描述,因此该问题不太具体,该问题通常与该站点的主题有关。

2
将分类特征编码为数字以进行机器学习
许多机器学习算法,例如神经网络,都希望处理数字。因此,当您拥有分类数据时,需要对其进行转换。绝对的意思是,例如: 汽车品牌:奥迪,宝马,雪佛兰...用户ID:1、25、26、28 ... 即使用户ID是数字,它们也只是标签,并不意味着在连续性方面(例如年龄或总金额)。 因此,基本方法似乎使用二进制向量来编码类别: 奥迪:1,0,0 ...宝马:0,1,0 ...雪佛兰:0,0,1 ... 类别很少时还可以,但除此之外,它看起来效率低下。例如,当您有10,000个用户ID进行编码时,它就是10,000个功能。 问题是,有没有更好的方法?也许涉及概率之一?

1
为什么我们要讨论不同拓扑中不同估计量的收敛行为?
在《代数几何与统计学习理论》一书的第一章中,讨论了不同函数空间中的估计的收敛性,其中提到贝叶斯估计对应于Schwartz分布拓扑,而最大似然估计对应于超范数拓扑(第7页): 例如sup-norm, -norm,希尔伯特空间弱拓扑,Schwartz分布拓扑等。是否收敛成立,很大程度上取决于函数空间的拓扑。贝叶斯估计对应于Schwartz分布拓扑,而最大似然或后验方法对应于超范数。这种差异会强烈影响单一模型的学习结果。大号p大号pL^p大号2大号2L^2ķñ( w )→ K( w )ķñ(w)→ķ(w)K_n(w)\to K(w) 其中和分别是真实模型与参数模型(参数)之间的经验KL散度(观测值之和)和真实KL散度(数据分布的总和)。Kn(w)Kn(w)K_n(w)K(w)K(w)K(w)www 谁能解释一下,或暗示我书中哪个地方有道理?谢谢。 更新:版权内容已删除。

3
有人可以解释动态时间扭曲以确定时间序列相似性吗?
我正在尝试掌握动态时间扭曲量度以将时间序列一起比较。我有三个时间序列数据集,如下所示: T1 <- structure(c(0.000213652387565, 0.000535045478866, 0, 0, 0.000219346347883, 0.000359669104424, 0.000269469145783, 0.00016051364366, 0.000181950509461, 0.000385579332948, 0.00078170803205, 0.000747244535774, 0, 0.000622858922454, 0.000689084895259, 0.000487983408564, 0.000224744353298, 0.000416449765747, 0.000308388157895, 0.000198906016907, 0.000179549331179, 9.06289650172e-05, 0.000253506844685, 0.000582896161212, 0.000386473429952, 0.000179839942451, 0, 0.000275608635737, 0.000622665006227, 0.00036075036075, 0.00029057097196, 0.000353232073472, 0.000394710874285, 0.000207555002076, 0.000402738622634, 0, 0.000309693403531, 0.000506521463847, 0.000226988991034, 0.000414164423276, 9.6590360282e-05, 0.000476689865573, 0.000377572210685, 0.000378967314069, 9.25240562546e-05, 0.000172309813044, 0.000447627573859, …

1
约束力矩产生功能
这个问题源于一问这里大约约束矩生成函数(MGFS)。 假设XXX是一个有界零均值随机变量承担值 [−σ,σ][−σ,σ][-\sigma, \sigma]和让G(t)=E[etX]G(t)=E[etX]G(t) = E[e^{tX}]是其MGF。从结合在Hoeffding不等式的证明使用中,我们有 G(t)=E[etX]≤eσ2t2/2G(t)=E[etX]≤eσ2t2/2G(t) = E[e^{tX}] \leq e^{\sigma^2t^2/2} 其中右侧可识别为标准偏差为σσ\sigma的零均值正常随机变量的MGF 。现在,的标准偏差XXX可以是不大于σσ\sigma,与出现的最大值时XXX是一个离散随机变量,使得 P{X=σ}=P{X=−σ}=12P{X=σ}=P{X=−σ}=12P\{X = \sigma\} = P\{X = -\sigma\} = \frac{1}{2}。因此,所谓的界限可以说是指零均值有界随机变量XXX的MGF高于零均值正常随机变量的MGF,其标准偏差等于XXX可以达到的最大可能标准偏差。有。 我的问题是:这是一个众所周知的独立利益结果,用于霍夫丁不等式的证明以外的其他地方吗?如果是这样,是否还可以用非零均值扩展到随机变量? 的,提示这个问题结果允许不对称范围[a,b][a,b][a,b]为XXX与a&lt;0&lt;ba&lt;0&lt;ba < 0 < b但并坚持E[X]=0E[X]=0E[X] = 0。结合的是 G(t)≤et2(b−a)2/8=et2σ2max/2G(t)≤et2(b−a)2/8=et2σmax2/2G(t) \leq e^{t^2(b-a)^2/8} = e^{t^2\sigma_{max}^2/2} ,其中σmax=(b−a)/2σmax=(b−a)/2\sigma_{\max} = (b-a)/2是值限制为[a,b][a,b][a,b]的随机变量可能的最大标准偏差,但除非b=−ab=−ab = -a否则零均值随机变量不会达到该最大值 。

5
如何使Weibull分布适合包含零的输入数据?
我正在尝试重现由退休研究员传承的现有预测算法。第一步是将一些观察到的数据拟合为威布尔分布,以获得将用于预测未来值的形状和比例。我正在用R做到这一点。这是我的代码示例: x&lt;-c(23,19,37,38,40,36,172,48,113,90,54,104,90,54,157,51,77,78,144,34,29,45,16,15,37,218,170,44,121) f&lt;-fitdistr(x, 'weibull') 除非输入数组中有任何零,否则它将完全失败,这可以正常工作。SAS中也会发生同样的事情。据我了解,这是因为计算Weibull分布的步骤之一是采用自然对数,该自然对数未定义为0。是否有合理的方法来解决此问题? 到目前为止,我发现最好的方法是在所有输入值中加1,拟合曲线,然后从预测值中减去1(“上移”曲线,然后下移1)。这非常适合先前预测的数据,但是这样做似乎是错误的方法。 编辑:输入数组中的值是多年来观察到的真实数据(某物的出现次数)。因此,在某些年份中发生的次数为零。不管这是不是最好的方法(我同意可能不是),原始算法作者声称已经使用了Weibull分布,并且我不得不尝试复制他们的过程。

1
用于相等和不等式约束的约束优化库
对选择适合我的优化功能的约束优化库有什么建议吗?我正在最小化ai)具有线性等式和不等式约束的非线性函数,并且ii)具有函数的梯度和粗麻布。 如果有帮助,我要最小化的函数是Kullback-Liebler散度。 constrOptim仅处理不平等约束。Quadprog处理二次方。信任不支持约束。因此,KL差异不适合这些解决方案。 R Cran任务页面上有很多用于优化的解决方案。我能够使用fmincon()函数在MATLAB中执行优化,该函数似乎使用了内部点或信任区域反射。理想情况下,有一个非常适合定义的问题的库。

4
“适度”还是“互动”?
我遇到了在很多情况下可以互换使用的这两个术语。 基本上,调节者(M)是影响X和Y之间关系的因素。调节分析通常使用回归模型进行。例如,性别(M)会影响“产品研究”(X)和“产品购买”(Y)之间的关系。 在交互中,X1和X2交互以影响Y。此处的相同示例是“产品研究”(X1)受“性别”(X2)影响,并且一起影响“产品购买”(Y)。 我可以看到,适度时,M影响XY关系,但在交互作用中,M(在这种情况下为性别)影响其他IV。 问题:如果我的项目目的是看性别如何影响X和Y之间的关系,我应该使用节制还是互动? 注意:我的项目是关于X和Y之间的相关性,而不是X和Y之间的因果关系。

2
ARMA / ARIMA与混合效果建模有何关系?
在面板数据分析中,我使用了具有随机/混合效应的多级模型来处理自相关问题(即,观察结果随时间聚集在个体中),并添加了其他参数以调整一些时间规格和感兴趣的冲击。ARMA / ARIMA似乎旨在解决类似问题。 我在网上找到的资源讨论了时间序列(ARMA / ARIMA)或混合效应模型,但是除了建立在回归之上之外,我不了解两者之间的关系。可能要在多层次模型中使用ARMA / ARIMA吗?两者之间是等效还是多余? 讨论此问题的资源的答案或指针将是很棒的。

3
截短的分布是什么意思?
在一篇有关动力系统常微分方程模型敏感性分析的研究文章中,作者提供了模型参数的分布,即正态分布(mean = 1e-4,std = 3e-5)截断了[0.5e -4 1.5e-4]。然后,他使用截断后的分布中的样本进行模型仿真。截短的分布并从该截短的分布中采样是什么意思? 我可以想出两种方法: 从正态分布采样,但是在仿真之前忽略所有落在指定范围之外的随机值。 以某种方式获得特殊的“截断正态”分布并从中获取样本。 这些有效和等效的方法吗? 我认为,在第一种情况下,如果要绘制样本的实验cdf / pdf,则它看起来不会像正态分布,因为曲线不会延伸到。±∞±∞\pm\infty

4
如何消化统计背景?
首先,我想并不是这个有趣站点的所有活跃成员都是统计学家。否则,以下问题将毫无意义!我当然尊重他们,但是我需要一个更实际而不是概念上的解释。 我首先从Wikipedia定义一个示例point process: 令S为配备有Borelσ代数B(S)的局部紧凑的第二个可数Hausdorff空间。为S上的局部有限计数量度集写为N上的最小σ代数写N,N使得所有点计数都可测量。NN\mathfrak{N}NN\mathcal{N}NN\mathfrak{N} 对我来说,这没有任何意义。我更容易理解工程方面的解释。 评论:大多数时候,由于类似的复杂文本(至少对我而言),我发现Wikipedia的解释毫无用处。根据我的经验,只有两种类型的统计参考书:a)非常简化b)非常复杂! 读这两个书对我完全没有好处! 题: 您有解决此问题的方法吗?或类似的经历? 对于那些认为这篇文章有用的人,还可以检查一下好处:咨询统计学家以向其客户提供参考的参考,这些参考从不同角度讨论了相关主题。

8
机器学习的“热门算法”是什么?
对于开始学习机器学习的人来说,这是一个幼稚的问题。这些天,我正在阅读Marsland的著作《机器学习:算法的观点》。我觉得它作为入门书籍很有用,但是现在我想进入高级算法,那些算法目前效果最好。我最感兴趣的是生物信息学:生物网络的聚类和生物序列中的模式发现,尤其是应用于单核苷酸多态性(SNP)分析。您能为我推荐一些评论或书籍吗?

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.