统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

4
交叉验证与数据监听有何不同?
我刚读完《统计学习入门》。我想知道使用交叉验证为各种机器学习技术找到最佳调整参数是否不同于数据监听? 我们正在反复检查调整参数的哪个值会在测试集中产生最佳的预测结果。如果我们得到的调整参数恰好偶然地适合于此特定测试集,而在将来的某些测试集上表现不佳怎么办? 请原谅我对机器学习的新知识,我渴望受过教育。 编辑:请参阅@AdamO答案有关“数据监听”的定义。我在问题中使用的术语非常不准确。

2
在拟合回归时是否有理由不使用正交多项式?
总的来说,我想知道在对具有高阶变量的回归进行拟合时是否最好不要使用正交多项式。特别是,我想知道使用R: 如果poly()与raw = FALSE产生相同的拟合值作为poly()与raw = TRUE和poly与raw = FALSE解决了与多项式回归相关的问题,那么应该poly()用raw = FALSE 始终被用于拟合多项式回归?在什么情况下最好不要使用poly()?

2
离散均匀随机变量(?),在封闭区间内取所有有理值
我刚刚发生了(智力)恐慌发作。 一个连续的随机变量,它在一个封闭的间隔中遵循统一:这是一种非常熟悉的统计概念。 ü(a ,b )U(a,b)U(a,b) 在扩展的实数(一半或整个)上具有支持的连续均匀rv:不是rv固有的,而是基本贝叶斯概念,用于不适当的先验,有用和适用。 一个离散的统一值,其值是有限的:让我们扔一个测地线圆顶,没什么大不了的。 但是,一个函数具有一个以整数为界的封闭区间中包含的所有有理数(如果需要,以开头)的函数呢?我们想在概率框架中使用它,要求每个可能值与所有其他值都具有相等的概率吗?[ 0 ,1 ][0,1][0,1] 可能值的数量是无穷大的(表征许多离散分布),但是如果我们希望概率相等,那么如何表达单个值的概率呢? 我们能否说出证明这种实体是(不是)随机变量? 如果不是,这是否是“不当先验”的又一个化身(也许已经众所周知)? 这个实体在某种意义上是否可能定义为连续统一rv的“等效”(无论多么特别)?还是我只是犯了一个基本罪? 似乎该域是一个封闭的间隔这一事实并不能让我放手。有界的东西通常是可管理的。 为了指示内部漩涡,问题很多。我不是要得到每个问题的答案。 在任何时候,如果我想出任何见解,我都会进行更新。 更新:目前的问题在这里刚刚获得了一个建构主义的续集。

2
偏最小二乘(PLS)回归的模型假设
我正在尝试查找有关PLS回归假设的信息(单)。我对将PLS的假设与OLS回归的假设进行比较特别感兴趣。 ÿyy 我已经阅读/浏览了有关PLS主题的大量文献;Wold(Svante and Herman),Abdi和许多其他人的论文,但找不到令人满意的来源。 沃尔德等。(2001)PLS回归:化学计量学的基本工具确实提到了PLS的假设,但是只提到了 X不必独立, 该系统是一些潜在变量的函数, 该系统在整个分析过程中应表现出同质性,并且 测量误差是可以接受的。 XXX 没有提及观察到的数据或模型残差的任何要求。有谁知道解决这个问题的资源吗?考虑基础数学类似于PCA(以最大化ÿyy和X之间的协方差为目标XXX)是(y,X)(y,X)(y, X)的多元正态性吗?模型残差是否需要表现出方差均匀性? 我也相信我在某处读到,观察不必是独立的。就重复测量研究而言,这意味着什么?

1
Cauchy分布中的位置参数的MLE
居中后,可以将两个测量值x和-x假定为具有概率密度函数的柯西分布的独立观测值: 1F(x :θ )=f(x:θ)=f(x :\theta) = ,-∞&lt;x&lt;∞1个π(1 + (X - θ )2)1π(1+(x−θ)2)1\over\pi (1+(x-\theta)^2) ,- ∞ &lt; X &lt; ∞,−∞&lt;x&lt;∞, -∞ < x < ∞ 表明,如果的MLE θ是0,但如果X 2 &gt; 1有两个MLE的θ,等于± √X2≤ 1x2≤1x^2≤ 1θθ\thetaX2&gt; 1x2&gt;1x^2>1θθ\thetaX2− 1-----√x2−1\sqrt {x^2-1} 我认为要找到MLE,必须区分对数可能性: =Σ2(X我-θ)d升dθdldθdl\over d\theta = ∑=∑=\sum =2(-X-θ)2 (x一世- θ )1 + (x一世- θ )22(xi−θ)1+(xi−θ)22(x_i-\theta)\over 1+(x_i-\theta)^2 === …

2
Kolmogorov–Smirnov检验有一个简单的等效检验版本吗?
是否对Kolmogorov-Smirnov检验设计了两个等效的单面检验(TOST),以检验两个分布至少相差某个研究人员指定水平的否定主义原假设? 如果不是TOST,那么是否进行其他形式的等效测试? 尼克·斯汤纳(Nick Stauner)明智地指出,(我应该已经知道;)还有其他非参数TOST等价检验,用于随机等价的零假设,并且在更严格的假设下,还包括中位数等价物。

2
在估算数据中使用邻居信息或查找偏离数据(在R中)
我有一个数据集,假设最近的邻居是最好的预测变量。只是可视化的双向梯度的完美示例- 假设我们缺少一些值,可以很容易地根据邻居和趋势进行预测。 R中的对应数据矩阵(用于锻炼的虚拟示例): miss.mat &lt;- matrix (c(5:11, 6:10, NA,12, 7:13, 8:14, 9:12, NA, 14:15, 10:16),ncol=7, byrow = TRUE) miss.mat [,1] [,2] [,3] [,4] [,5] [,6] [,7] [1,] 5 6 7 8 9 10 11 [2,] 6 7 8 9 10 NA 12 [3,] 7 8 9 10 11 12 13 …

3
为了得出“天花板效应”正在发生,必须满足什么条件?
根据SAGE社会科学研究方法百科全书 ... [a]上限效应发生在一项措施具有潜在响应的明显上限并且参与者集中度达到或接近该上限时。尺度衰减是一个方法学问题,每当以这种方式限制方差时都会发生。…例如,某种程度的态度可能会产生天花板效应,其中高分表示一种有利态度,而最高的反应却无法捕捉到最积极的评价。…解决天花板效应的最佳解决方案是试点测试,这可以尽早发现问题。如果发现上限效应,并且[结果]度量标准是任务绩效,则可以使任务更加难以增加潜在响应的范围。1个 [重点添加] 似乎有很多的建议和问题,(在这里)处理分析这表明类似于上述报价的天花板埋入影响的数据。 我的问题可能很简单,也可能很幼稚,但是如何真正检测出数据中存在上限效应呢?更具体地说,例如,创建了一个心理测验,并怀疑其导致了上限效应(仅视觉检查),然后对该测验进行了修改,以产生更大范围的值。如何显示修订后的测试已从其生成的数据中消除了上限效应?是否有一项测试表明数据集a中存在上限效应,但数据集b中没有上限效应? 我幼稚的方法是仅检查分布偏斜,如果不偏斜,则得出结论没有上限效应。这太简单了吗? 编辑 再举一个更具体的例子,我说开发了一种可以测量某些潜在特征x的工具,该特征x随着年龄的增长而增加,但最终趋于平稳,并随着年龄的增长而开始下降。我制作了第一个版本,范围为1-14,进行了一些试验,发现似乎有一个上限效应(很多响应在14或接近14时,最大值。)查看数据,但是为什么呢?是否有严格的方法来支持该主张? 然后,我将度量值修改为1-20,并收集更多数据。我看到趋势更加符合我的期望,但是我怎么知道测量范围足够大。我需要再次修改吗?从外观上看,这似乎还可以,但是有没有一种方法可以验证我的怀疑? 我想知道如何才能在数据中检测到这种上限效应,而不仅仅是查看它。这些图代表实际数据,而非理论数据。扩大仪器的范围可以产生更好的数据分布,但这足够吗?我该如何测试? 1 Hessling,R.,Traxel,N.,&Schmidt,T.(2004)。天花板效果。SAGE社会科学研究方法百科全书,由 Michael S. Lewis-Beck,A。Bryman和Tim Futing Liao(编)撰写。(第107页)。加利福尼亚州千橡市:Sage Publications,Inc. doi:10.4135 / 9781412950589.n102

2
微观计量经济学中的因果关系与时间序列计量经济学中的格兰杰因果关系
我了解微观经济学(尤其是IV或回归不连续性设计)中使用的因果关系,以及时间序列计量经济学中使用的Granger因果关系。如何将彼此联系起来?例如,我已经看到两种方法都用于面板数据(例如,T = 20)。在这方面对论文的任何引用将不胜感激。ñ= 30N=30N=30Ť= 20T=20T=20

3
多层次/层次结构数据上的随机森林
我对机器学习,CART技术等并不陌生,我希望我的天真不会太明显。 随机森林如何处理多级/分层数据结构(例如,当需要进行跨级交互时)? 也就是说,在几个层次级别上具有分析单位的数据集(例如,嵌套在学校中的学生,以及有关学生和学校的数据)。 仅作为示例,考虑一个多级数据集,其中第一级的个人(例如,具有投票行为,人口统计等数据)嵌套在第二级的国家中(具有国家级数据;例如,人口): ID voted age female country population 1 1 19 1 1 53.01 2 1 23 0 1 53.01 3 0 43 1 1 53.01 4 1 27 1 1 53.01 5 0 67 0 1 53.01 6 1 34 1 2 47.54 7 0 54 1 …

3
不确定性的几种测量的标准偏差
我有两个2个小时的GPS数据,采样率为1 Hz(7200次测量)。中的数据形式给出,其中Ñ σ是测量不确定性。(X,Xσ,Y,Yσ,Z,Zσ)(X,Xσ,Y,Yσ,Z,Zσ)(X, X_\sigma, Y, Y_\sigma, Z, Z_\sigma)ñσNσN_\sigma 当我取所有测量值的平均值(例如,这两个小时的平均Z值)时,其标准偏差是多少?我当然可以从Z值计算出标准偏差,但是后来我忽略了已知的测量不确定性这一事实... 编辑:数据全部来自同一测站,并且每秒重新测量所有坐标。由于卫星星座等原因,每次测量都具有不同的不确定性。我的分析目的是找出由于外部事件(例如地震)引起的位移。我想取地震前7200次测量的平均值(2h),取地震后2h的另一个平均值,然后计算所得的差值(例如,高度)。为了指定此差异的标准偏差,我需要知道两种方法的标准偏差。

1
如何解释PCA负载?
在阅读有关PCA时,我遇到了以下解释: 假设我们有一个数据集,其中每个数据点代表一个学生在数学测验,物理测验,阅读理解测验和词汇测验中的分数。 我们找到前两个主要成分,它们捕获了数据中90%的可变性,并解释了它们的负载。我们得出的结论是,第一个主要成分代表总体学习能力,第二个代表定量能力和语言能力之间的对比。 该文指出,PC1和PC2负载量的PC1和为PC2,并提供以下解释:(0.5 ,0.5 ,- 0.5 ,- 0.5 )(0.5,0.5,0.5,0.5)(0.5,0.5,0.5,0.5)(0.5, 0.5, 0.5, 0.5)(0.5,0.5,−0.5,−0.5)(0.5,0.5,−0.5,−0.5)(0.5, 0.5, -0.5, -0.5) 第一个分量与平均分数成正比,第二个分量测量第一对分数和第二对分数之间的差。 我无法理解该解释的含义。
13 pca 

1
重复数据删除的最新技术
记录重复数据删除中最先进的方法是什么?重复数据删除有时也称为:记录链接,实体解析,身份解析,合并/清除。我知道例如CBLOCK [1]。 如果答案中还包含对实现该方法的现有软件的引用,我将不胜感激。例如,我知道Mahout实现了树冠群集。还有使用Lucene 的Duke。 有许多用于重复数据删除的商业系统。了解它们的工作方式和效率将非常有价值。 我对单个数据集中的重复数据删除以及来自不同来源的多个数据集之间的链接都感兴趣。效率和处理大量数据的能力也很重要。 [1] CBLOCK:用于大规模重复数据删除任务的自动阻止机制

4
为什么所有已知分布都是单峰的?
我不知道任何多峰分布。 为什么所有已知分布都是单峰的?是否有不止一种模式的“著名”发行版? 当然,分布的混合通常是多峰的,但是我想知道是否存在任何不止一种具有多个模式的分布。


By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.