统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答


1
重复测量方差分析:LM vs LMER
我试图重现两者之间lm以及lmer重复测量(2x2x2)之间的几个交互测试。我想比较这两种方法的原因是因为SPSS的重复测量GLM产生的结果与lm此处介绍的方法完全相同,因此最后我想比较SPSS与R-lmer。到目前为止,我仅设法(紧密地)复制了其中的一些交互。 您会在下面找到一个脚本来更好地说明我的观点: library(data.table) library(tidyr) library(lmerTest) library(MASS) set.seed(1) N <- 100 # number of subjects sigma <- 1 # popuplation sd rho <- .6 # correlation between variables # X1: a a a a b b b b # X2: a a b b a a b b # X3: a …

1
是MLE
假设(X,Y)(X,Y)(X,Y)具有pdf Fθ(x ,y)= e- (X / θ + θ ÿ)1个x > 0 ,y> 0,θ > 0fθ(x,y)=e−(x/θ+θy)1x>0,y>0,θ>0f_{\theta}(x,y)=e^{-(x/\theta+\theta y)}\mathbf1_{x>0,y>0}\quad,\,\theta>0 样品的密度(X,Y)= (X一世,Y一世)1个≤ 我≤ Ñ(X,Y)=(Xi,Yi)1≤i≤n(\mathbf X,\mathbf Y)=(X_i,Y_i)_{1\le i\le n}从这一人群得出因此是 Gθ(x,y)= ∏我= 1ñFθ(x一世,ÿ一世)= 经验[ - Σ我= 1ñ(x一世θ+ θ ÿ一世) ] 1X1个,… ,xñ,ÿ1个,… ,yñ> 0= 经验[ − n x¯θ- θ Ñ ÿ¯] 1X(1 ),ÿ(1 )> 0,θ …

2
使用ARMA-GARCH模型模拟外汇价格
我已经将ARIMA(1,1,1)-GARCH(1,1)模型拟合到几年中以一分钟为间隔采样的澳元/美元汇率记录价格的时间序列,估计模型的上百万个数据点。该数据集可在此处获得。为了清楚起见,这是一个ARMA-GARCH模型,由于对原木价格进行一阶整合,因此适合对原木进行回报。原始的AUD / USD时间序列如下所示: 然后,我尝试根据拟合模型模拟时间序列,从而得到以下结果: 我既期望也希望模拟的时间序列与原始时间序列不同,但是我并不期望会有如此大的差异。从本质上讲,我希望模拟的序列的行为或大致看起来像原始序列。 这是我用来估计模型和模拟序列的R代码: library(rugarch) rows <- nrow(data) data <- (log(data[2:rows,])-log(data[1:(rows-1),])) spec <- ugarchspec(variance.model = list(model = "sGARCH", garchOrder = c(1, 1)), mean.model = list(armaOrder = c(1, 1), include.mean = TRUE), distribution.model = "std") fit <- ugarchfit(spec = spec, data = data, solver = "hybrid") sim <- ugarchsim(fit, …

2
模糊逻辑发生了什么?
当我在读研究生时(2000年代初),模糊逻辑似乎是机器学习和数据挖掘研究的活跃领域。模糊推理系统,模糊c均值,各种神经网络的模糊版本和支持向量机体系结构都在研究生课程中进行了讲授,并在会议中进行了讨论。 自从我再次开始关注ML(〜2013)以来,Fuzzy Logic似乎已完全脱离了人们的视野,鉴于所有AI的炒作,Fuzzy Logic在当前ML领域的缺席是显而易见的。 这是不是只是一个话题过时的案例,还是由于模糊逻辑和模糊推理的特定限制而导致该话题被研究人员抛弃了? 根据jbowman的评论进行澄清:是否有某些事件或发现导致FL过时,例如类似于60年代的神经网络,当时它们已经过时,因为事实证明它们无法解决XOR ?还是模糊系统在竞争范式方面表现出色?

5
为什么要不惜一切代价避免装仓?
因此,我读了几篇关于为什么应始终避免合并的文章。该链接的流行参考是此链接。 主要的缺点是分档点(或切点)相当随意,并且会导致信息丢失,因此应首选样条线。 但是,我目前正在使用Spotify API,该API对它们的某些功能有很多连续的置信度度量。 看一下“工具性”这一功能,引用指出: 预测曲目是否不包含人声。在这种情况下,“哦”和“啊”的声音被视为乐器。说唱或说出的单词轨迹显然是“声音”。器乐性值越接近1.0,则曲目中没有人声内容的可能性越大。高于0.5的值旨在表示乐器轨迹,但随着该值接近1.0,置信度更高。 考虑到我的数据分布非常偏左(大约90%的样本几乎不超过0,我发现将此功能转换为两个分类特征是明智的:“ instrumental”(所有值均大于0.5的样本)和“ non_instrumental” ”(对于所有小于0.5的样本)。 错了吗 当我几乎所有(连续)数据都围绕一个值旋转时,将会有什么选择呢?根据我对样条曲线的了解,它们也不能解决分类问题(我在做什么)。

2
为什么Neyman-Pearson引理是引理而不是定理?
这更多是历史问题,而不是技术问题。 为什么``Neyman-Pearson引理''是引理而不是定理? 链接至Wiki:https : //zh.wikipedia.org/wiki/内曼(Neyman)% E2%80%93Pearson_lemma 注意:问题不是关于什么是引理以及如何使用引理证明定理,而是关于内曼-皮尔森引理的历史。它曾经用来证明一个定理,然后碰巧更有用吗?是否有任何证据证明这是事实?

4
严格来说,“随机投影”不是投影吗?
随机投影算法的当前实现方式是使用投影矩阵将数据样本从映射到从而降低了数据样本的维数,该矩阵的条目来自适当的分布(例如来自):RdRd\mathbb R^dRkRk\mathbb R^kd×kd×kd\times kRRRN(0,1)N(0,1)\mathcal N(0,1) x′=1k√xRx′=1kxRx^\prime = \frac{1}{\sqrt k}xR 方便地,存在理论证明,表明该映射近似保留了成对的距离。 但是,最近我发现了这些注释,其中作者声称该单词与严格矩阵的线性代数意义上的投影并不是严格意义上的投影(第6页)。根据此处给出的说明,这是因为当的列从中独立选择时,它们的列并非严格正交。因此,可以将强制执行列的正交性的RP的早期版本视为投影。RRRN(0,1)N(0,1)\mathcal N(0,1)RRR 您能否提供以下更详细的解释:(1)从严格意义上讲,投影的定义是什么;(2)为什么在这种定义下RP不是投影?

7
在模型构建中避免社会歧视
我有一些问题来自亚马逊最近的招聘丑闻,在那起丑闻中,他们被指控在招聘过程中歧视妇女。更多信息在这里: Amazon.com Inc.的机器学习专家发现了一个大问题:他们的新招聘引擎不喜欢女性。 自2014年以来,该团队就一直在构建计算机程序来审查求职者的简历,以机械化寻找顶尖人才的目标 ……该公司的实验性招聘工具使用人工智能为求职者提供了1到5星的评分…… 但到2015年,公司意识到其新系统并未以性别中立的方式对软件开发人员职位和其他技术职位的候选人进行评级。 那是因为亚马逊的计算机模型经过培训,可以通过观察十年来提交给公司的简历中的模式来审查申请人。大多数人来自男性,这反映了整个科技行业中男性的主导地位。(有关技术领域性别崩溃的图表,请参阅:此处)实际上,亚马逊的系统告诉自己,男性候选人更可取。它对包括“妇女”一词的简历进行了惩罚,例如“妇女的象棋俱乐部队长”。知情人士说,这降低了两所女子大学的毕业生的等级。他们没有指定学校的名称。 亚马逊对程序进行了编辑,以使其对这些特定条款保持中立。知情人士说,但这不能保证机器不会设计出其他方法来对候选人进行分类,这可能会造成歧视。 西雅图公司最终在去年年初解散了团队,因为高管对该项目失去了希望 ……公司的实验……提供了有关机器学习局限性的案例研究。 ……在卡内基梅隆大学(Carnegie Mellon University)教授机器学习的Nihar Shah等计算机科学家表示,还有许多工作要做。 他说:“如何确保算法是公平的,如何确保算法是真正可解释和可解释的-仍然相距甚远。” MASCULINE LANGUAGE [Amazon]在亚马逊的爱丁堡工程中心成立了一个团队,该团队已经发展到大约十二个人。知情人士说,他们的目标是开发可以迅速爬网并找到值得招聘候选人的AI。 该小组创建了500个针对特定工作职能和位置的计算机模型。他们教会每个人识别过去候选人履历中出现的大约50,000个术语。这些算法学到的知识对IT申请人常见的技能几乎没有什么意义,例如编写各种计算机代码的能力…… 相反,该技术偏爱应聘者使用在男性工程师的简历中更常见的动词来形容自己的候选人,例如一位人士说,“被处决”和“被俘”。 假设我想建立一个统计模型来预测个人数据的一些输出,例如帮助您招募新人的五星级评级。假设我也想避免性别歧视,这是一种道德约束。给定除性别以外两个完全相等的配置文件,模型的输出应相同。 我应该使用性别(或与之相关的任何数据)作为输入并尝试纠正其影响,还是避免使用这些数据? 如何检查是否存在性别歧视? 如何为统计上可区分但我出于道德原因不想成为模型的数据更正我的模型?

2
广义正态分布的提案分布
我正在使用具有概率密度函数的广义正态分布(维基百科条目)来模拟植物扩散。 b2aΓ(1/b)e−(da)bb2aΓ(1/b)e−(da)b \frac{b}{2a\Gamma(1/b)} e^{-(\frac{d}{a})^b} 其中是行进距离,是比例参数,是形状参数。平均行驶距离由以下分布的标准偏差给出:dddaaabbb a2Γ(3/b)Γ(1/b)−−−−−−−−√a2Γ(3/b)Γ(1/b) \sqrt{\frac{a^2 \Gamma(3/b)}{\Gamma(1/b)}} 这是方便的,因为它允许以指数形式时,高斯形状时,并且对于尖峰厚尾分布时。这种分布在植物传播文献中经常出现,尽管通常它很少见,因此很难找到有关的信息。b=1b=1b=1b=2b=2b=2b&lt;1b&lt;1b<1 最有趣的参数是和平均分散距离。bbb 我正在尝试使用MCMC 估算和,但是我正在努力想出一种有效的方法来对提案价值进行抽样。到目前为止,我已经使用Metropolis-Hastings,并且从和均匀分布中得出,并且我得到的后平均分散距离约为200-400米,这确实具有生物学意义。但是,收敛确实很慢,并且我不确信它正在探索整个参数空间。aaabbb0&lt;a&lt;4000&lt;a&lt;4000 < a < 400 0&lt;b&lt;30&lt;b&lt;3 0 < b<3 为和分配更好的提案分配是棘手的,因为它们彼此依赖,而没有太多意义。平均分散距离确实具有明确的生物学意义,但是给定的平均分散距离可以用和许多组合来解释。因此,和在后面相关。aaabbbaaabbbaaabbb 到目前为止,我已经使用了Metropolis Hastings,但是我对在这里可以使用的其他算法持开放态度。 问题:有人可以建议一种更有效的方法来绘制和投标值吗?aaabbb 编辑:关于系统的其他信息:我正在研究沿山谷的植物种群。目的是确定花粉在供体植物和它们授粉的植物之间传播的距离分布。我的数据是: 每个可能的花粉供体的位置和DNA 从已经生长并进行基因分型的60种母本植物(即花粉接受者)的样品中收集的种子。 每个母本植物的位置和DNA。 我不知道供体植物的身份,但是可以通过确定哪些供体是每株幼苗的父亲,从遗传数据中推论得出。假设此信息包含在概率矩阵G中,每个后代都有一行,每个候选供体都有一列,这仅根据遗传数据就可以得出每个候选者是每个后代的父亲的概率。G需要大约3秒钟的时间来计算,并且每次迭代都需要重新计算,这大大降低了速度。 由于我们通常期望更接近的候选人捐赠者更有可能是父亲,因此,如果您共同推断父子关系和分散父子关系,则父子关系推断会更准确。矩阵D具有与G相同的维度,并且仅基于母体与候选者之间的距离和某些参数向量的函数包含父系概率。在给定遗传和空间数据的情况下,D和G中的相乘元素给出了父权的联合概率。乘积值的乘积给出了离散模型的可能性。 如上所述,我一直在使用GND来建模色散。实际上,我实际上使用了GND和均匀分布的混合体,以允许非常遥远的候选者仅由于偶然性(遗传杂乱)而具有较高的亲子关系可能性(如果忽略,这会使GND的明显尾部膨胀)。因此,扩散距离的概率为:ddd cPr(d|a,b)+(1−c)NcPr(d|a,b)+(1−c)N c \Pr(d|a,b) + \frac{(1-c)}{N} 其中是到GND的散布距离的概率,N是候选者的数量,而()确定GND对散布的贡献。Pr(d|a,b)Pr(d|a,b)\Pr(d|a,b)ccc0&lt;c&lt;10&lt;c&lt;10< c <1 因此,还有两个额外的考虑因素会增加计算负担: 色散距离是未知的,但必须在每次迭代中进行推断,而创建G来做到这一点非常昂贵。 有第三个参数进行积分。ccc 由于这些原因,在我看来,执行网格插值过于复杂,但我很高兴被说服。 例 这是我使用的python代码的简化示例。我简化了从遗传数据中对亲子关系的估计,因为这将涉及很多额外的代码,并将其替换为0到1之间的值矩阵。 首先,定义函数以计算GND: import numpy as np …

2
为什么将指数logistic回归系数视为“奇数比”?
Logistic回归将事件的对数几率建模为一组预测变量。也就是说,log(p /(1-p))其中p是某种结果的概率。因此,对于某些变量(x)的原始逻辑回归系数的解释必须在对数优势比上。就是说,如果x的系数= 5,那么我们知道x值对应的1单位更改对应于对数赔率标度上的5单位更改,将发生结果。 但是,我经常看到人们将指数 logistic回归系数解释为优势比。但是,显然exp(log(p /(1-p)))= p /(1-p),这是一个赔率。据我了解,优势比是一个事件发生的几率(例如,事件A的p /(1-p))与另一个事件发生的几率(例如,事件p /(1-p)) B)。 我在这里想念什么?似乎这种对指数逻辑回归系数的常见解释是不正确的。


3
计算约束(非负)最小二乘法中的p值
我一直在使用Matlab来执行无约束的最小二乘(普通最小二乘),它会自动输出系数,检验统计量和p值。 我的问题是,在执行约束最小二乘法(严格为非负系数)时,它仅输出系数,而无检验统计量,p值。 可以计算这些值以确保重要性吗?为何不能直接在软件(或与此相关的任何其他软件)上使用它?

1
钓鱼问题
假设您想在上午8点至晚上8点去附近的湖钓鱼。由于过度捕捞,已经制定了一项法律,规定您每天只能捕捞一条鱼。当您抓到一条鱼时,您可以选择保留它(然后将其带回家),或将其扔回湖中继续捕鱼(但要冒着以后再用较小的鱼或根本不养鱼的风险)的选择。您想钓到尽可能多的鱼;具体来说,您想使您带回家的鱼的预期数量最大化。 形式上,我们可能会这样设置此问题:以一定的速度捕获鱼(因此,捕获下一条鱼所需的时间遵循已知的指数分布),并且捕获的鱼的大小遵循某些(也称为)分布。我们需要一些决策过程,根据当前时间和您刚抓到的鱼的大小,来决定是保留鱼还是将其扔回去。 所以问题是:该如何做出决定?是否有一些简单(或复杂)的方法来决定何时停止钓鱼?我认为问题等同于在给定的时间t内确定最佳渔民在时间t开始要带回家的预期鱼群数量。当且仅当鱼比预期的质量重时,最佳决策过程才能保留鱼。但这似乎是自指的。我们正在根据最佳渔民来定义最佳捕捞策略,但我不确定如何进行。


By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.