统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

1
使用自举获得1%的抽样分布
我有一个人口样本(大小为250)。我不知道人口的分布。 主要问题:我想要对人口的第一个百分点进行点估计,然后我希望在我的点估计周围有95%的置信区间。 我的估计值将是样本1st- percentile。我将其表示为。XXx 之后,我尝试围绕点估计值建立置信区间。我不知道在这里使用引导是否有意义。我对Bootstrap缺乏经验,所以请谅解如果我没有使用适当的术语等。 这是我尝试的方法。我从原始样本中抽取了1000个随机样本进行替换。我得到1 日从他们每个人的百分位。因此,我有1000点- “1 日 -percentiles”。我看一下这1000点的经验分布。我表示它的平均值。我将“偏差”表示为:。我走2.5 个百分位和97.5 个百分点的1000点,以获得较低和较高端我所说周围1 95%的置信区间ST百分位原始样品。我表示这些点和。X米Ë 一个ÑX米Ë一个ñx_{mean}偏差=X米Ë 一个Ñ- x偏压=X米Ë一个ñ-X\text{bias}=x_{mean}-xX0.025X0.025x_{0.025}X0.975X0.975x_{0.975} 最后剩下的步骤是适应这个置信区间是围绕1 日百分位的的人口,而不是周围的1 日百分位的的原始样本。因此,我将作为下端,将作为上端人口的第一个百分位数的点估计值附近的95%置信区间的概率。这是我一直在寻找的时间间隔。X - 偏见- (X米Ë 一个Ñ-X0.025)X-偏压-(X米Ë一个ñ-X0.025)x-\text{bias}-(x_{mean}-x_{0.025})X - 偏压+ (X0.975-X米Ë 一个Ñ)X-偏压+(X0.975-X米Ë一个ñ)x-\text{bias}+(x_{0.975}-x_{mean}) 一个关键点,在我看来,是它是否有意义的使用引导1 日百分值是相当接近人口的未知潜在分布的尾部。我怀疑这可能有问题;考虑使用引导程序在最小(或最大)附近建立置信区间。 但是,也许这种方法有缺陷吗?请告诉我。 编辑: 转念一想这个问题有点多,我看到我的解决方案意味着:经验1 日百分原始样品的可能是1的偏估计ST百分点的人口。如果是这样,则应该对点估计值进行偏差调整:。否则,偏差调整后的置信区间将与偏差未经调整的点估计不兼容。我需要调整点估计和置信区间,或者都不调整。X - 偏置X-偏压x-\text{bias} 另一方面,如果我不允许估计有偏差,则不必进行偏差调整。也就是说,我将作为点估计,将作为下限,将作为95%的上限。置信区间。我不确定这个间隔是否合理...XXxx − (X米Ë 一个Ñ-X0.025)X-(X米Ë一个ñ-X0.025)x-(x_{mean}-x_{0.025})x + (X0.975-X米Ë 一个Ñ)X+(X0.975-X米Ë一个ñ)x+(x_{0.975}-x_{mean}) 所以,这有什么意义假设样品1 日百分比是人口1的偏估计ST百分?如果不是,我的替代解决方案是否正确?

1
如何解释套索模型中排除或包含的变量?
我从其他帖子中得知,不能将“重要性”或“重要性”归因于进入套索模型的预测变量,因为计算这些变量的p值或标准差仍在进行中。 在这种推理下,断言一个人不能说套索模型中排除的变量是“无关紧要”还是“无关紧要”是正确的吗? 如果是这样,对于套索模型中排除或包含的变量,我实际上能提出什么主张?在我的特定情况下,我通过重复10次交叉验证100次来选择调整参数lambda,以减少randonmess并平均误差曲线。 UPDATE1:我遵循以下建议,并使用引导程序示例重新运行套索。我试了100个样本(这是我的计算机功能可以在一夜之间解决的数量),并且出现了一些模式。我的41个变量中的2个进入模型的次数超过95%,3个变量超过90%,5个变量超过85%。当我使用原始样本运行模型时,这5个变量属于进入模型的9个变量,是当时系数值最高的变量。如果我运行带有1000个引导程序样本的套索并且保留了这些模式,那么呈现结果的最佳方法是什么? 1000个引导程序样本听起来是否足够?(我的样本大小为116) 我是否应该列出所有变量以及它们进入模型的频率,然后认为输入频率更高的变量更有意义? 就我所能要求的范围而言吗?因为它正在进行中(请参见上文),所以我不能使用截止值,对吗? UPDATE2:根据以下建议,我计算出以下内容:平均而言,原始模型中的变量有78%进入了为100个自举样本生成的模型。另一方面,反之则只有41%。这在很大程度上与以下事实有关:为引导程序样本生成的模型往往比原始模型(9)包含更多的变量(平均17个)。 UPDATE3:如果你能帮助我解释我是从引导和蒙特卡罗模拟得到的结果,请看看这个其他职位。

2
如何创建“美国Reddit”图?
以下是p中的图表。Christian Rudder的Dataclysm的 202 ,尽管它是由James Dowdell制造的。它说明了排名前200的子reddit之间的关系,这是reddit.com上感兴趣的区域,用户可以在其中提交链接,评论和投票。这些类似于此站点上的标签。次修订区域的大小代表了它们的受欢迎程度。子评论通过交叉注释进行分组,并且较深的色调表示留在该子评论中而不发布给他人的人数百分比。 这仅仅是一个标准的Voronoi分区,带有一些用于孤立的颜色,还是更多地涉及其中? 如何去做其中之一?

1
套索配方之间的联系
这个问题可能是愚蠢的,但我注意到拉索回归有两种不同的表达方式。我们知道套索问题是最小化由平方损失加 -1惩罚项组成的目标,表示为: LLLminβ∥y−Xβ∥22+λ∥β∥1minβ‖y−Xβ‖22+λ‖β‖1 \min_\beta \|y - X \beta\|_2^2 + \lambda \|\beta\|_1 \; 但是通常我看到套索估计量可以写成 β^n(λ)=argminβ{12n∥y−Xβ∥22+λ∥β∥1}β^n(λ)=arg⁡minβ{12n‖y−Xβ‖22+λ‖β‖1} \hat{\beta}_n(\lambda) = \displaystyle\arg \min_{\beta} \{\frac {1}{2n} \|y - X \beta\|_2^2 + \lambda \|\beta\|_1 \} 我的问题是,等价的吗?\ frac {1} {2n}一词从何而来?12n12n\frac {1}{2n}这两种说法之间的联系对我而言并不明显。 [更新]我想我应该问的另一个问题是, 为什么会有第二种说法?从理论上或计算上,以这种方式提出问题有什么好处?
9 lasso 

1
如果存在两个未知数,负二项式是否不能像指数族那样表达?
假设色散参数是一个已知的常数,我有一个作业分配以表示负二项式分布为指数分布族。这相当简单,但是我想知道为什么他们要求我们将参数固定。我发现我无法想出一种方法来以正确的形式将两个参数未知。 在网上寻找时,我发现这是不可能的。但是,我找不到任何证明是真的。我自己也似乎无法提出。有人证明吗? 按照下面的要求,我提出了一些要求: “具有固定失败次数(也称为停止时间参数)r的负二项式分布族是指数族。但是,当允许上述任何固定参数发生变化时,所得族都不是指数族。 ” http://en.wikipedia.org/wiki/Exponential_family “二参数负二项式分布不是指数族的成员。但是,如果我们将色散参数视为已知的固定常数,则它是一个成员。” http://www.unc.edu/courses/2006spring/ecol/145/001/docs/lectures/lecture21.htm

1
观测到的费舍尔信息
从Y. Pawitan的“在所有可能性中:使用可能性进行统计建模和推断”中,重新参数化的可能性被定义为 使得如果g是一对一,则L ^ *(\ psi)= L(g ^ {-1} (\ psi))(第45页)。我试图显示练习2.20,其中指出如果\ theta是标量(并且我假设g也应该是标量函数),则 I ^ *(g(\ hat {\ theta}))= I( \ hat {\ theta})\ left | \ frac {\ partial g(\ hat {\ theta})} {\ partial \ hat {\ theta}} \ right | ^ {-2}, 其中 I(\ theta) =-\ frac {\ …

1
样本量很小的回归
我想使用4到5个解释变量进行回归,但是我只有15个观察值。无法假设这些变量是正态分布的,是否存在非参数或任何其他有效的回归方法?

1
排列检验:选择检验统计量的条件
我经常使用排列测试,并且喜欢它们的简单性。我从Good所著的《重采样方法》一书中学到了很多东西,其中作者在整个示例中选择测试统计数据时似乎很有创造力。同样,该帖子给人的印象是,可以很大程度地选择测试统计信息。 我确实想知道测试统计量是否符合理论要求。还是只要可以直观地使用并且具有良好的I / II类型错误率的统计量,我们就可以使用它吗? 例如,当由于非正态总体而使用置换检验而不是t检验时,我已经看到很多次仍然从t统计量获得置换检验p值。尽管不一定是错误的,但考虑到Student t分布的起源,这似乎是一个奇怪的选择。

1
通过依次选择一个球并对其进行标记来估计球数
可以说我的书包里有N个球。在我的第一个平局中,我标记了球并将其放在袋子中。在第二次抽签中,如果我捡到一个标记的球,我会将其放回书包。但是,如果我捡起一个未标记的球,则对其进行标记,然后将其放回袋子。我将继续进行任何抽奖。给定多次抽签和带标记/不带记号的抽签历史,预期袋子中的球数是多少?

2
如何评估适应功能的优劣
尽管我对分类和回归有一定的了解,但我还是生存分析的新手。 对于回归,我们具有MSE和R平方统计量。但是,除了某种图形化的图(KM曲线),我们如何说生存模型A优于生存模型B? 如果可能的话,请举例说明差异(例如R中的rpart包)。您如何证明一棵CART生存树比另一棵CART生存树好?可以使用哪些指标?

1
个人问题调查方法
我的一位统计学家朋友告诉我,一种有趣的技术可用于在处理敏感问题的调查中获得诚实的答复。我记得该方法的基本要点,但想知道是否有人知道细节,是否有人引用它。 故事是,佛罗里达州AMA希望评估医生之间的药物使用情况。他们发出了一个死者的问卷。IIRC上的指示大致是“滚死。如果您曾经吸毒或得到6,则写下6;否则写下任何数字”。这样的想法是,如果有人拿出医生的问卷调查表并看到一个六,他可以说他没有服药,他只是碰巧一个六。

4
Minitab在现实世界中有多有用?[关闭]
已关闭。这个问题是基于观点的。它当前不接受答案。 想改善这个问题吗?更新问题,以便通过编辑此帖子以事实和引用的形式回答。 5年前关闭。 我目前是一个非常优秀的课程的统计学学生。我们将Minitab用于各种项目/类。但是,正如我的本科生告诉我的那样,您在学校中使用的不一定是现实世界中使用的。我也精通C#,python,并且正在学习SAS(几乎准备参加SAS的第一次认证测试)。 Minitab是否在现实世界的研究/工作中广泛使用?我是否应该在学习SAS上投入更多时间?
9 sas  minitab 

2
如何证明流形假设是正确的?
在机器学习中,通常假设数据集位于光滑的低维流形上(流形假设),但是有任何方法可以证明假设满足某些条件,则确实(近似)生成了数据集来自低维平滑流形? 例如,给定一个数据序列 {X1个…Xñ}{X1…Xn}\{\mathbf{X}_1 \ldots \mathbf{X}_n\} 哪里 X一世∈[RdXi∈Rd\mathbf X_i \in \mathbb{R}^d (例如具有不同角度的面部图像序列)和相应的标签序列 {ÿ1个…ÿñ}{y1…yn}\{ y_1 \ldots y_n\} 哪里 ÿ1个⪯ÿ2…… ⪯ÿñy1⪯y2…⪯yny_1 \preceq y_2 \ldots \preceq y_n (说出面部序列的角度)。假设何时X一世XiX_i 和 X我+ 1Xi+1X_{i+1} 非常接近,他们的标签 yiyiy_i 和 yi+1yi+1y_{i+1} 距离也很近,我们可以想象,很可能 {X1…Xn}{X1…Xn}\{\mathbf{X}_1 \ldots \mathbf{X}_n\}躺在低维流形上。这是真的?如果是这样,我们怎么证明呢?或者该序列需要满足什么条件才能证明流形假设是正确的?

3
测试以区分周期性数据和几乎周期性数据
假设我有一些未知功能与域ℝ,我知道要实现像连续性一些合理的条件。我知道在某些等距采样点t_i = t_0 +iΔt且i∈ \ {1,…,n \}的情况下f的确切值(因为数据来自模拟),我可以假设它足够精细来捕获所有f的相关方面,例如,我可以假设在两个采样点之间最多有一个f的局部极值。我正在寻找一个测试,该测试告诉我我的数据是否符合正好是周期性的f,即∃τ:f(t +τ)= f(t)\,∀\,tfffRℝℝfffti=t0+iΔtti=t0+iΔtt_i=t_0 + iΔti∈{1,…,n}i∈{1,…,n}i∈\{1,…,n\}fffffffff∃τ:f(t+τ)=f(t)∀t∃τ:f(t+τ)=f(t)∀t∃τ: f(t+τ)=f(t) \,∀\,t,周期长度有些合理,例如Δt&lt;τ&lt;n⋅ΔtΔt&lt;τ&lt;n·ΔtΔt < τ < n·Δt(但可以想象,如果需要的话,我可以设定更强的约束条件)。 从另一个角度来看,我有数据x0,…,xnx0,…,xn{x_0, …, x_n}并且正在寻找一个测试来回答是否存在周期函数fff(如上所述的满足条件)使得f(ti)=xi∀if(ti)=xi∀if(t_i)=x_i ∀ i。 重要的一点是fff至少非常接近周期性(例如,f(t):=sin(g(t)⋅t)f(t):=sin⁡(g(t)·t)f(t) := \sin(g(t)·t)或f(t):=g(t)⋅sin(t)f(t):=g(t)·sin⁡(t)f(t) := g(t)·\sin(t)与g′(t)≪g(t0)/Δtg′(t)≪g(t0)/Δtg'(t) ≪ g(t_0)/Δt)到这样的程度:只需少量更改一个数据点就足以使数据符合fff是精确的周期性。因此,用于频率分析的标准工具(例如傅立叶变换或分析零交叉)将无济于事。 请注意,我正在寻找的测试可能不会出现概率。 我对如何自己设计这样的测试有一些想法,但是想避免重新发明轮子。因此,我正在寻找现有的测试。

2
直观地汇总一堆有向线段
我有一个数百万有向线段的数据集。线段是连续的-这是一个气候变量(显热),每半小时就有观察和模拟的值。我正在尝试寻找模拟执行方式的模式。我正在查看obs与仿真值的散点图,并将它们与线段链接(箭头表示时间方向)。如果我绘制它们,我将得到一个无法解释的模糊混乱,就像这样: 这是10000行的子集,绘制得很好并且具有低不透明度: ggplot(d, aes(x=Qh_obs, xend=lead(Qh_obs), y=Qh_sim, yend=lead(Qh_sim))) + geom_segment(size=0.1, alpha=0.2, arrow=arrow(length=unit(2, units='mm'))) dput() 前700行数据(受发布长度限制): structure( list( Qh_sim = c( 56.401439666748, 33.9568634033203, 16.2147789001465, 0.797790050506592, -3.19529962539673, -10.3250732421875, -11.6082448959351, -21.5074787139893, -21.5963478088379, -21.4389324188232, -19.8912830352783, -18.5908279418945, -19.2523441314697, -19.663516998291, -19.1126575469971, -18.4237308502197, -16.6181221008301, -14.7601175308228, -14.5604763031006, -14.3527803421021, -14.6219816207886, -14.791407585144, -15.452392578125, -15.8962726593018, -11.9349966049194, -7.97028636932373, 12.4507570266724, 32.1654815673828, 56.9330673217773, 82.0748443603516, 110.501235961914, …

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.