统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

2
“最强密码”
我有一个受四位数PIN码保护的应用程序,该用户在锁定帐户之前进行了五次登录尝试。 现在,我的一位客户希望“加强”安全性,并提倡另一种解决方案: 六位数密码 否“彼此相邻的相同数字”:例如:11 3945或39 55 94 否“三个运行数字”:例如:123 654或53 789 3 现在开始思考:哪种解决方案最强? 我可以很容易地计算出四位数,但是如何计算另一位数呢? 谢谢! 更新资料 您会得到您想要的-特别是在使用数学时:) 所以,我要的是两个数字序列的组合数。 通读答案和评论,对我来说很清楚,这真的没有关系。如果您有5个猜测,那么有10.000或〜800.000可以选择。更重要的是排除1234和出生日期。在我的情况下,我实际上有用户的出生日期,因此我需要检查一些东西。 感谢您的精彩讨论!

3
为什么要分别估计SVM中的偏差项而不是特征向量中的额外维?
SVM中的最佳超平面定义为: w⋅x+b=0,w⋅x+b=0,\mathbf w \cdot \mathbf x+b=0, 其中bbb代表阈值。如果我们有一些映射ϕϕ\mathbf \phi将输入空间映射到某个空间ZZZ,我们可以在空间定义SVM ZZZ,其中最佳水平平面将是: w⋅ϕ(x)+b=0.w⋅ϕ(x)+b=0.\mathbf w \cdot \mathbf \phi(\mathbf x)+b=0. 然而,我们可以总是限定映射ϕϕ\phi使得ϕ0(x)=1ϕ0(x)=1\phi_0(\mathbf x)=1,∀x∀x\forall \mathbf x,然后将最佳hiperplane将被定义为 w⋅ϕ(x)=0.w⋅ϕ(x)=0.\mathbf w \cdot \mathbf \phi(\mathbf x)=0. 问题: 为什么许多论文使用w⋅ϕ(x)+b=0w⋅ϕ(x)+b=0\mathbf w \cdot \mathbf \phi(\mathbf x)+b=0时,他们已经有映射ϕϕ\phi和参数估计ww\mathbf w和theshold bbb separatelly? 小号。Ť。ÿ Ñ 瓦特·& φ( X Ñ)≥1,∀Ñminw||w||2minw||w||2\min_{\mathbf w} ||\mathbf w ||^2 s.t. ynw⋅ϕ(xn)≥1,∀ns.t. ynw⋅ϕ(xn)≥1,∀ns.t. \ y_n …
11 svm  threshold 

3
交互仅在回归分析中有用吗?
我一直在回归的背景下阅读交互一词。我们是否还应考虑与不同模型(例如knn或svm)的交互? 如果有,甚至更多的功能,并且可以说有观察值,那么找到有用的交互的通常方法是什么?尝试所有组合吗?还是只使用有意义的组合?505050100100100100010001000

2
秘密圣诞老人的安排将导致完美配对的可能性
因此,我们有秘密圣诞老人在工作。 我们是8个人。我们每个人轮流从碗上拉出一小张上面有名字的纸。唯一的规则:如果您拉名字,则必须将纸放回碗中,然后重试。 我们称人们A,B,C,D,E,F,G,H,这也是他们拣纸的顺序。 昨晚我们做了礼物交换。 A是F的秘密圣诞老人。 B是E的秘密圣诞老人。 C是D的秘密圣诞老人。 D是C的秘密圣诞老人。 E是B的秘密圣诞老人。 F是A的秘密圣诞老人。 G是H的秘密圣诞老人。 H是G的秘密圣诞老人。 看看发生了什么事?我们结了夫妻。 A和F是彼此的秘密圣诞老人。 B和E是彼此的秘密圣诞老人。 C和D是彼此的秘密圣诞老人。 G和H是彼此的秘密圣诞老人。 发生这种情况的可能性是多少?如何计算?

1
近似
我随便读了一篇经济学文章,对具有以下近似值:log(E(X))log⁡(E(X))\log(E(X)) log(E(X))≈E(log(X))+0.5var(log(X))log⁡(E(X))≈E(log⁡(X))+0.5var(log⁡(X))\log(E(X)) \approx E(\log(X))+0.5 \mathrm{var}(\log(X)), 如果X是对数正态的(我知道),作者说的就是正确的。 我不知道如何得出这种近似值。我尝试计算二阶泰勒逼近,而我想到的只是这个表达式: log(E(X))≈E(log(X))+0.5var(X)E(X)2log⁡(E(X))≈E(log⁡(X))+0.5var(X)E(X)2\log(E(X)) \approx E(\log(X))+0.5\frac{\mathrm{var}(X)}{E(X)^2}

4
为什么色散测度比中心测度更直观?
在人类的理解中似乎有些东西在直觉上理解差异的概念方面造成了困难。从狭义上讲,答案是立竿见影的:平方使我们脱离了反思的理解。但是,仅仅是方差带来了问题,还是整个数据扩散的想法?我们寻求避难范围,或仅说明最小值和最大值,但我们只是避免真正的困难吗?在平均值(众数或中位数)中,我们找到了中心,摘要...是一种简化;差异分散了周围的东西并使他们不舒服。原始人肯定会通过三角剖分来祈祷,从而在狩猎动物中利用中庸之道,但是我认为,很晚以后我们才感到需要量化事物的传播。实际上,方差一词最早是在1918年由罗纳德·费舍尔(Ronald Fisher)在论文“孟德尔继承假设中的亲戚之间的相关性”中引入的。 多数关注此消息的人都会听过拉里·萨默斯(Larry Summers)关于按性别划分的数学才能的不幸演讲,这可能与他离开哈佛有关。简而言之,他建议男性与女性的数学能力分布差异更大,即使男性和女性的平均能力相同。无论适当性或政治含义如何,这似乎在科学文献中得到了证实。 更重要的是,也许对气候变化等问题的理解(请原谅我提出可能导致完全不提倡讨论的话题)可以通过提高人们对方差观念的了解而得到帮助。 如本文所示,当我们尝试掌握协方差时,这个问题变得更加复杂,这是@whuber 在此处给出的出色而丰富多彩的答案。 它可能是很有诱惑力驳回这个问题太一般,但很显然,我们正在间接地讨论这个问题,因为在这个岗位,其中数学是微不足道的,但这个概念被继续难以捉摸,belying更舒适的接受范围为反对更细微的思想差异。 在费舍尔给EBFord的一封信中,谈到了他对孟德尔实验的怀疑,我们读到:“现在,当数据被伪造时,我很清楚人们普遍低估了广泛的机会偏差的频率,因此趋势总是使他们与期望太吻合……(在孟德尔的数据中)偏差很小。” 伟大的RA费舍尔非常热衷于怀疑小样本中的微小差异,他写道:“除其他方面外,孟德尔还是被一位非常了解所期望的助手欺骗的可能性。” 如今,这种对低估或误解传播的偏见很可能继续存在。如果是这样,是否有任何解释说明为什么我们对中心概念比对分散更满意?我们可以做些什么来使这个想法内化吗? Ë我π+ 1 = 0eiπ+1=0\small e^{i\pi}+1=0Ë= 米Ç2E=mc2\small E=mc^2 纳西姆·塔莱布(Nassim Taleb)将他对方差的理解有误(实际上是贝诺伊特·曼德布罗特的理解)运用于危机发生时发了大财,并试图通过以下句子使大众理解这一概念:“方差是认识论的,这是关于缺乏对中庸之道的了解的一种衡量方法。”-是的,这口子还有更多的背景...值得称赞的是,他还通过“ 感恩节土耳其”的想法简化了这一过程。有人可能会说,投资的关键是了解方差(和协方差)。 那么,为什么这么滑,以及如何补救呢?没有公式……仅仅是多年处理不确定性的直觉……我不知道答案,但这不是数学上的(有必要):例如,我想知道峰度的想法是否会干扰方差。在下图中,我们有两个直方图重叠,几乎没有变化。但是,我的膝盖跳动反应是,尾巴最长,峰顶最高(峰度更高)的那一点更“散开”:

3
在贝叶斯推断中先验了解贝塔共轭频率
以下摘录自《博尔斯塔德的贝叶斯统计概论》。 对于所有在那里的专家来说,这可能是微不足道的,但是我不明白作者是如何得出结论的,我们不必进行任何积分就可以计算出某个值的后验概率。我理解第二个表达式,它是比例关系以及所有条件的来源(似然x Prior)。而且,我知道,我们不必担心分母,因为只有分子是直接成比例的。但是,继续讲第三个方程式,我们是否就忘记了贝叶斯规则的分母?去哪了?而且由Gamma函数计算的值不是常数吗?常数不会在贝叶斯定理中抵消吗?ππ\pi



2
拉丁超立方采样渐近线
我正在尝试为我正在研究的问题构建证明,而我所做的一个假设是,我从中采样的点集在整个空间中都是密集的。实际上,我使用拉丁超立方体采样来获取整个采样空间中的点。我想知道的是,如果让您的样本大小趋于那么拉丁超立方体样本在整个空间中是否密集?如果是这样,将不胜感激对此事实的引用。∞∞\infty

3
绘制结果仅具有平均值和标准偏差
我正在尝试在此表中的观察值和召回得分的标准差的可视化中绘制一个合适的图: 召回控制意思37标清8实验性意思21标清6控制实验性意思标清意思标清召回378216\begin{array} {c|c c|c c|} & \text{Control} & & \text{Experimental} & \\ & \text{Mean} & \text{SD} &\text{Mean} &\text{SD} \\ \hline \text{Recall} & 37 & 8 & 21 & 6 \\ \hline \end{array} 最好的方法是什么?条形图是一个好方法吗?在这种情况下如何说明标准偏差?

1
如何使用前k个(经验)矩拟合近似PDF(即密度估计)?
我有一种情况,我能够估计数据集的(第一个)矩,并希望使用它来生成密度函数的估计。ķkk 我已经遇到过Pearson分布,但是意识到它仅依赖于前4个矩(对矩的可能组合有一些限制)。 我还理解,当不使用更多假设时,任何有限的时刻集不足以“固定”特定分布。但是,我仍然希望获得更一般的发行版(Pearson发行版家族除外)。查看其他问题,我找不到这样的分布(请参阅:这里,这里,这里,这里,这里和这里)。 是否可以为任何矩集定义一些(“简单”)广义分布族?(也许是一组可以采用标准正态分布的变换,并对其进行变换,直到所有k个矩集都被确认为止)ķkkķkk (如果我们假设其他矩是否为0,则我不太在乎)k + 1 … ∞k+1…∞k+1\ldots\infty 谢谢。 ps:我很高兴有一个扩展的例子。最好以R代码为例。

1
非参数自举p值与置信区间
语境 这有点类似于此问题,但我认为这并非完全相同。 当您寻找有关如何执行自举假设检验的说明时,通常会指出,使用经验分布作为置信区间是可以的,但是您需要从原假设下的分布中正确地自举以获得p-值。例如,请参阅对此问题的公认答案。在互联网上进行的一般搜索似乎似乎可以找到类似的答案。 不使用基于经验分布的p值的原因是,大多数时候我们没有平移不变性。 例 让我举一个简短的例子。我们有一个硬币,我们想进行一个单面测试,看看正面的频率是否大于0.5 我们执行试验,得到个头。该测试的真实p值为。n=20n=20n = 20k=14k=14k = 14p=0.058p=0.058p = 0.058 另一方面,如果我们从20个磁头中引导14个,则可以有效地从且的二项分布中进行采样。通过减去0.2来偏移此分布,当针对获得的经验分布测试观察值0.7时,我们将得到几乎没有显着结果。n=20n=20n = 20p=1420=0.7p=1420=0.7p = \frac{14}{20}=0.7 在这种情况下,差异很小,但是当我们测试的成功率接近1时,差异会更大。 题 现在让我提出我的问题的实质:对于置信区间,同样的缺陷也成立。实际上,如果置信区间具有规定的置信度水平则在无效假设下不包含参数的置信区间等效于在重要性水平为拒绝无效假设。αα\alpha1−α1−α1- \alpha 为什么基于经验分布的置信区间被广泛接受而p值却未被接受? 是否存在更深层的原因,或者人们是否没有那么自信的保守度? Peter Dalgaard 在这个答案中给出的答案似乎与我的观点一致。他说: 这种推理方式没有什么特别错误的,至少没有(比)CI的计算差很多。 (很多)从哪里来?这意味着以这种方式生成p值会稍差一些,但在这一点上没有详细说明。 最后的想法 同样在《埃夫隆(Efron)和蒂布希尔尼(Tibshirani)的引言》中,它们为置信区间分配了很多空间,但没有为p值分配空间,除非它们是在适当的零假设分布下生成的,除了关于有关置换测试的章节中的置信区间和p值。 让我们也回到我链接的第一个问题。我同意迈克尔·切尔尼克(Michael Chernick)的回答,但他再次重申,在某些情况下,基于经验自举分布的置信区间和p值同样不可靠。它没有解释为什么您会发现很多人告诉您间隔是正确的,但p值却不正确。

2
p值的两个定义:如何证明它们的等价性?
我正在阅读拉里·瓦瑟曼(Larry Wasserman)的《所有统计》一书,目前正在阅读有关p值的信息(第187页)。首先让我介绍一些定义(我引用): 定义1的拒绝区域中的试验的幂函数RRR由下式定义 β(θ)=Pθ(X∈R)β(θ)=Pθ(X∈R)\beta(\theta)=P_{\theta}(X\in R) 的测试的大小被定义为 如果测试的大小小于或等于\ alpha,则称该测试具有\ alpha级别。α=supθ∈Θ0β(θ)α=supθ∈Θ0β(θ)\alpha = \sup_{\theta\in\Theta_0}\beta(\theta)αα\alphaαα\alpha 这基本上说αα\alpha,大小是类型I的错误的“最大”概率。然后通过(I quote)定义ppp值。 定义2假设对于每个α∈(0,1)α∈(0,1)\alpha\in(0,1)我们都有一个带有拒绝区域R_ \ alpha的大小αα\alpha测试。然后, p \ text {-value} = \ inf \ {\ alpha:T(X ^ n)\ in R_ \ alpha \} 其中X ^ n =(X_1,\ dots,X_n)。RαRαR_\alphap-value=inf{α:T(Xn)∈Rα}p-value=inf{α:T(Xn)∈Rα}p\text{-value}=\inf\{\alpha:T(X^n)\in R_\alpha\}Xn=(X1,…,Xn)Xn=(X1,…,Xn)X^n=(X_1,\dots,X_n) 对我来说,这意味着:给定特定的αα\alpha有一个测试和拒绝区域RαRαR_\alpha以便α=supθ∈Θ0(α)Pθ(T(Xn)∈Rα)α=supθ∈Θ0(α)Pθ(T(Xn)∈Rα)\alpha=\sup_{\theta\in\Theta_{0}(\alpha)}P_\theta(T(X^n)\in R_\alpha)。对于ppp值,我只需取所有\ alpha中的最小值即可αα\alpha。 问题1如果是这种情况,那么对于任意小的,我可以清楚地选择。我对定义2的错误解释是什么,即它的确切含义是什么?εα=ϵα=ϵ\alpha = \epsilonϵϵ\epsilon 现在,Wasserman连续并陈述了一个定理,以具有我所熟悉的值的“等效”定义(我引用):ppp 定理假设大小检验的形式为 然后, 其中,是的观测值。拒绝 H …

3
存在时提取更多因素总是更好吗?
与主成分分析不同,因子分析模型的解决方案不一定是嵌套的。也就是说,当仅提取第一个因子与第一个两个因子相同时,第一个因子的负载(例如)不一定相同。 考虑到这一点,请考虑以下情况:您具有一组高度相关的清单变量,并且(根据其内容的理论知识)应由单个因素来驱动。想象一下,探索性因素分析(无论您喜欢哪种度量标准:并行分析,卵石图,本征值> 1等)都强烈暗示着存在因素:主要因素较大,次要因素较小。您有兴趣使用清单变量和因子解来估计(即,获取因子得分)参与者对第一个因子的值。 在这种情况下,最好是:222 拟合因子模型以仅提取因子,并获得因子得分(等),或1个1个1 拟合因子模型以提取两个因子,获得因子的因子得分,但是扔掉/忽略第二个因子的得分? 对于哪种更好的做法,为什么呢? 关于这个问题有研究吗?

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.