统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

2
关于Bootstrap重采样的最佳建议教科书?
我只是想问一问,您认为哪本书是最好的自助书。因此,我并不一定只指其开发人员编写的内容。 您能否指出哪本教科书最适合您,并能满足以下条件? 该技术的哲学/流行病学基础列出了适用范围,优点和缺点,对模型选择的重要性? 一组很好的简单示例,显示了实现的基本原理,最好是在Matlab中?

2
关于使用神经网络进行Q学习的问题
我已经按照中所述实施了Q-Learning, http://web.cs.swarthmore.edu/~meeden/cs81/s12/papers/MarkStevePaper.pdf 为了大约。Q(S,A)我使用如下的神经网络结构, 激活乙状结肠 输入,输入数量+动作神经元的1(所有输入按0-1比例缩放) 输出,单路输出。Q值 N个M隐藏层。 探索方法随机0 <rand()<propExplore 在每次学习迭代中,使用以下公式, 我计算一个Q目标值,然后使用计算一个误差, error = QTarget - LastQValueReturnedFromNN 然后通过神经网络传播错误。 Q1,我走对了吗?我已经看到了一些论文,这些论文的每个动作都实现了一个带有一个输出神经元的NN。 Q2,我的奖励函数返回-1和1之间的数字。当激活函数为S形(0 1)时,可以返回-1和1之间的数字吗? 问题3,根据我对这种方法的理解,给定足够的培训实例,应该对其进行隔离以找到最佳的政策依据?训练XOR有时会在2k次迭代后学习,有时甚至在40k 50k迭代后也不会学习。

1
“因子分析的基本定理”如何应用于PCA,或如何定义PCA载荷?
我目前正在查看用于“因子分析”(据我所知的PCA)的幻灯片集。 其中,得出了“因子分析的基本定理”,它声称可以使用因子加载矩阵()恢复进入分析的数据的相关矩阵():RR\bf RAA\bf A R=AA⊤R=AA⊤\bf R = AA^\top 但是,这使我感到困惑。在PCA中,“因子负载”矩阵由数据协方差/相关矩阵的特征向量矩阵给出(因为我们假设数据已经标准化,所以它们是相同的),每个特征向量都按比例缩放为具有长度一。此矩阵是正交的,从而这是在一般不等于。AA⊤=IAA⊤=I\bf AA^\top = IRR\bf R



2
报告Welch t检验的自由度
不等方差的Welch t检验(也称为Welch-Satterthwaite或Welch-Aspin)通常具有非整数的自由度。报告测试结果时应如何引用这些自由度? 根据各种消息来源,“通常在查询标准t表之前先四舍五入为最接近的整数” *-这很有意义,因为这种舍入方向是保守的。**一些较旧的统计软件也可以这样做(例如,版本之前的Graphpad Prism 6),一些在线计算器仍然可以使用。如果已使用此程序,则报告四舍五入的自由度似乎是适当的。(尽管使用一些更好的软件可能更合适!) 但是绝大多数现代软件包都使用小数部分,因此在这种情况下,似乎应该引用小数部分。我看不出引用多于两个小数位是适当的,因为千分之一的自由度只会对p值产生微不足道的影响。 环顾Google学者,我可以看到一些论文用df整数,小数点后一位或小数点后两位。是否有关于使用多少精度的准则?此外,如果软件使用完整的小数部分,应在引用DF进行四舍五入向下到的数字的期望数目(例如7.5845...→7.57.5845...→7.57.5845... \rightarrow 7.5至1个DP或→7→7\rightarrow 7作为整体数目),为是适当的与保守计算,或者对我来说似乎更明智,按常规取整(至最接近的整数),以使7.5845...→7.67.5845...→7.67.5845... \rightarrow 7.6至1 dp或→8→8\rightarrow 8至最接近的整数? 编辑:除了了解报告非整数df的理论上最合理的方法外,了解人们在实践中的工作也将是一件好事。大概期刊和风格指南有其自己的要求。我很好奇,像APA这样需要有影响力的风格指南。据我所知(他们的手册不能在线免费获得),APA普遍认为几乎所有内容都应显示到小数点后两位,除了p值(可能是2或3 dp)和百分比(四舍五入为整数)。最接近的百分比) -覆盖回归斜率,吨统计,˚F统计,χ2χ2\chi^2统计资料等等。考虑到第二个小数位在有效位数上的差异非常大,这很不合逻辑,并且在2.47中表示的精度与982.47中的精度完全不同,但是这可能解释了我在不科学的样本中看到的带有两个小数位的Welch df的数量。 ∗∗*例如Ruxton,GD不等方差t检验是学生t检验和Mann–Whitney U检验的未充分使用的替代方法,行为生态学(2006年7月/八月)17(4):688-690 doi:10.1093 / beheco / ark016 ∗∗∗∗**虽然韦尔奇-萨特思韦特近似本身可能会或可能不会是保守的,在它不是保守的,舍去自由度的情况下是没有整体补偿的保证。

1
为什么对一致估计量的定义是如此?一致性的其他定义呢?
引用维基百科: 在统计中,一致估计量或渐近一致估计量是一个估计量-一种计算参数的规则-具有以下性质:随着所使用的数据点的数量无限增加,所得到的估计序列在概率上收敛于θ ^ *。θ ∗θ∗θ∗θ^*θ∗θ∗θ^* 为了使该语句更精确,让θ∗θ∗\theta^*为您要估计的真实参数的值,并让θ^(Sn)θ^(Sn)\hat\theta(S_n)为根据数据估算该参数的规则。然后,可以通过以下方式表达估计量一致性的定义: limn→∞Pr[|θ(Sn^)−θ∗|≥ϵ]=0limn→∞Pr[|θ(Sn^)−θ∗|≥ϵ]=0\lim_{n \to \infty} Pr[|\hat{\theta(S_{n}}) - \theta^*|\geq \epsilon ]=0 我的问题乍看之下似乎很肤浅,但它是:为什么用“一致性/一致性”一词来描述估算器的这种行为? 我之所以关心这一点,是因为从直觉上来说,一致性一词对我来说意味着不同的东西(或者至少对我来说似乎不同,也许可以证明它们是相等的)。让我通过一个例子告诉你这意味着什么。假设“您”始终是“好”(对于“好”的定义),则表示您每次有机会证明/向您证明自己是好时,您确实每次都向我证明自己是好人(或至少大部分时间)。 让我根据直觉来定义估计量的一致性。令“ you”为计算的函数,让“ good”表示您与真实估计值距离(在范式中,好,为什么不是)。那么对一致性的更好定义是: θ*升1θ^θ^\hat{\theta}θ∗θ∗\theta^*l1l1l_1 ∀n,∀Sn,Pr[|θ(Sn^)−θ∗|≥ϵ]&lt;δ∀n,∀Sn,Pr[|θ(Sn^)−θ∗|≥ϵ]&lt;δ\forall n,\forall S_n, Pr[|\hat{\theta(S_{n}}) - \theta^*|\geq \epsilon ] < \delta 即使一致性的定义可能不太有用,但对我来说定义一致性的方式对我来说更有意义,因为对于您投入到估算器任何训练/样本集,我将能够做得好,即我会一直做得很好。我知道,对所有n执行此操作有点不切实际(可能是不可能的),但是我们可以通过以下方式修正此定义:θ^θ^\hat\theta ∃n0,∀n≥n0,∀Sn,Pr[|θ(Sn^)−θ∗|≥ϵ]&lt;δ∃n0,∀n≥n0,∀Sn,Pr[|θ(Sn^)−θ∗|≥ϵ]&lt;δ\exists n_0, \forall n \geq n_0,\forall S_n, Pr[|\hat{\theta(S_{n}}) - \theta^*|\geq \epsilon ] < \delta 也就是说,对于足够大的n,我们的估计量不会比真实差(即,与“真相”相距不超过)(试图捕获您至少需要的直觉)一些例子可以学习/估计任何东西,一旦达到这个数字,如果估计量与我们尝试定义它的方式保持一致,则估计量在大多数情况下都会做得很好。ε θ * Ñ 0ϵϵ\epsilonϵϵ\epsilonθ∗θ∗\theta^*n0n0n_0 …

5
时间序列计量经济学和面板数据计量经济学有什么区别?
这个问题可能很幼稚,但是如果时间序列方法和面板数据方法之间存在差异,那么我对计量经济学的教学方式就会感到困惑。 关于时间序列,我涵盖了诸如协方差平稳,AR,MA等主题。关于面板数据,我只看到了固定效应与随机效应(或更笼统地说是分层模型),差异-差异等 这些主题是否在某些方面相关?由于面板数据也具有时间维度,因此为什么也没有讨论AR,MA等问题? 如果答案是我对面板方法的教育还远远不够,那么您能指出一本书不仅仅涉及FE / RE和差异吗?


1
一阶导数为零时如何使用增量法?
http://en.wikipedia.org/wiki/Delta_method 在Wikipedia文章中,假设g′(θ)g′(θ)g'(\theta)必须存在,并且g′(θ)g′(θ)g'(\theta)为非零值。 是否可以找到√的渐近分布n−−√(g(Xn)−g(θ))n(g(Xn)−g(θ))\sqrt{n}(g(X_n)-g(\theta)) 鉴于g′(θ)g′(θ)g'(\theta)可以是零和?n−−√(Xn−θ)→dN(0,σ2)n(Xn−θ)→dN(0,σ2)\sqrt{n}(X_n-\theta) \stackrel{d}{\rightarrow} N(0,\sigma^2)

3
项目反应理论与验证性因素分析
我想知道项目响应理论和确认性因素分析之间的核心,有意义的区别是什么。 我了解计算方法存在差异(更多地关注项目与协方差;对数线性与线性)。 但是,我不知道从更高的角度讲这意味着什么-这是否意味着在某些情况下IRT比CFA更好?还是最终用途略有不同? 任何思考都将是有用的,因为对研究文献的扫描导致对IRT和CFA的更多描述,而不是对它们之间核心差异的任何有用比较。

5
有没有衡量传播“均匀性”的方法?
我在网上查找,但找不到任何有用的信息。 我基本上是在寻找一种衡量值的“平均”分配方式的方法。例如,X的“均匀”分布分布: 均值和标准差大致相同的“不均匀”分布Y: 但是,是否有任何均匀性度量m使得m(X)&gt; m(Y)?如果没有,那么创建这种度量的最佳方法是什么? (图片来自可汗学院的屏幕截图)

5
审查数据到底是什么?
我已经阅读了审查数据的不同描述: A)如该线程中所述,审查低于或高于某个阈值的未量化数据。未量化表示数据高于或低于某个阈值,但我们不知道确切值。然后在回归模型中将数据标记为低阈值或高阈值。它与本演示文稿中的描述相符,我发现它很清楚(第一页的第二张幻灯片)。换句话说,因为我们不知道该范围之外的真实值,所以将YYY限制为最小值,最大值或两者均设为上限。 B)一个朋友告诉我,只要我们至少有一些关于未知Y i结果的极限信息,我们就可以对部分未知的 YYY观测值应用审查数据模型。例如,我们希望基于一些定性标准(商品类型,国家/地区,投标人的财富等)来估计无声拍卖和公开拍卖的最终价格。对于公开拍卖,我们知道所有最终价格Y i,对于无声拍卖,我们只知道第一个出价(例如$ 1,000),而不是最终价格。有人告诉我,在这种情况下,数据是从上方进行审查的,因此应采用审查后的回归模型。YiYiY_iYiYiY_i C)最后是Wikipedia给出的定义,其中YYY完全缺失,但预测变量可用。我不确定此示例与截断的数据有何不同。 那么,检查数据到底是什么呢?

2
k-均值vs k-中位数?
我知道有k均值聚类算法和k均值。一个使用均值作为聚类的中心,另一个使用中位数。我的问题是:什么时候/在哪里使用?

3
引导程序:过度拟合的问题
假设一个人通过从原始n个观测值中替换得到每个大小为n的样本来执行所谓的非参数引导。我相信此过程等效于通过经验CDF估算累积分布函数:BBBnnnnnn http://en.wikipedia.org/wiki/Empirical_distribution_function 然后通过从估计的cdf B次连续模拟观察值来获得引导程序样本。nnnBBB 如果我对此是正确的,则必须解决过度拟合的问题,因为经验CDF具有大约N个参数。当然,它渐近收敛于总体cdf,但是有限样本呢?例如,如果我告诉你,我有100个观测,我会估计CDF为N(μ,σ2)N(μ,σ2)N(\mu, \sigma^2)有两个参数,你就不会惊慌。但是,如果参数数量增加到100,则似乎根本不合理。 同样地,当一个采用标准多元线性回归,误差项的分布被估计为。如果有人决定改用残差自举法,他必须意识到现在大约有nN(0,σ2)N(0,σ2)N(0, \sigma^2)nnn参数仅用于处理误差项分布。 您能否将我定向到一些明确解决此问题的消息源,或者告诉我如果您认为我做错了为什么这不是问题。

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.