统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

4
下列哪些统计课程在金融/科技行业中最适用且最有用?[关闭]
已关闭。这个问题是基于观点的。它当前不接受答案。 想改善这个问题吗?更新问题,以便通过编辑此帖子以事实和引用的形式回答。 3年前关闭。 我正在选择3种统计学课程来参加我的应用数学课程群(专注于精算科学或统计分析)。您认为以下哪三类在金融/科技/计算机科学领域最有用/最适用? 随机过程(随机行走,离散时间马尔可夫链,泊松过程) 线性建模:理论与应用 时间序列简介 现代统计预测与机器学习 博弈论 计量经济分析简介(统计与经济之间的交叉注册)

2
生成满足约束条件的随机变量
我需要生成一个随机变量的列表,该列表受约束的约束,可以以的形式表示,其中是矩阵,如果有个条目。在我处理的所有情况下,,例如约为14,000,等于50。我不确定我将使用哪种方法进行随机采样,无论是正常采样还是均匀采样,不是明确哪种方法最适合我要解决的问题,但是我需要从均值和范围/方差相同的分布中采样所有变量。xx\bf{x}Ex=bEx=b\bf{E}x=bEE\bf{E}m×nm×nm \times n xx\bf{x}nnnn>>mn>>mn >> mnnnmmm 为了解决这个问题,我一直在做以下事情:将简化为行梯形形式,将与最后一个枢轴右侧的列对应的所有变量都设置为随机值,然后解决剩余的方阵相等性。EE\bf{E} 但是,为了解决平方矩阵相等性,我要从右侧减去已经设置的值。不幸的是,方差也增加了,所以我最近的50个值往往相差很大,这在这个问题上是令人无法接受的。 有一个更好的方法吗?我想不出一种方法来修复当前使用的方法。我用R

3
如何在R中条形图并排的情况下创建条形图
已锁定。该问题及其答案被锁定,因为该问题是题外话,但具有历史意义。它目前不接受新的答案或互动。 我想为R中的这些数据创建一个图表(从CVS文件读取): Experiment_Name MetricA MetricB Just_X 2 10 Just_X_and_Y 3 20 具有下图: 我是初学者,我也不知道该如何开始。

2
平均绝对偏差是否小于标准偏差?
我想用这种定义将一般情况下的平均绝对偏差与标准偏差进行比较: MAD=1n−1∑1n|xi−μ|,SD=∑n1(xi−μ)2n−1−−−−−−−−−−−√MAD=1n−1∑1n|xi−μ|,SD=∑1n(xi−μ)2n−1MAD = \frac{1}{n-1}\sum_1^n|x_i - \mu|, \qquad SD = \sqrt{\frac{\sum_1^n(x_i-\mu)^2}{n-1}} 其中。μ=1n∑n1xiμ=1n∑1nxi\mu =\frac{1}{n}\sum_1^n x_i 每个是否正确?MAD≤SDMAD≤SDMAD \le SD{xi}n1{xi}1n\{x_i\}^n_1 它的虚假为,becouse,对于每个。n=2n=2n=2x+y≥x2+y2−−−−−−√x+y≥x2+y2x+y \ge \sqrt{x^2+y^2}x,y≥0x,y≥0x, y \ge 0 很容易证明: MAD≤nn−1−−−−−√×SDMAD≤nn−1×SDMAD \le \sqrt{\frac{n}{n-1}} \times SD

3
随机效应模型处理冗余
我正在尝试使用重复的二进制结果来处理事件分析。假设到达事件的时间以天为单位,但目前我们将时间离散为几周。我想使用重复的二进制结果来近似估计Kaplan-Meier估计量(但允许协变量)。这似乎是一个回旋的路,但是我正在探索这如何扩展到顺序结果和复发事件。 如果您创建了一个二进制序列,对于在3周内被审查的某人,它看起来像000;对于在4w时被审查的某人,它看起来像0000,而对于在5w时失败的主题,它看起来像是0000111111111111...。(1扩展到最后一个主题然后在研究中进行计算),当您计算特定于周的比例为1s时,您将获得普通的累积发生率(直到获得可变的审查时间,这仅是近似值,但并不等于Kaplan-Meier累积发生率估算值)。 我可以使用GEE用二元逻辑模型拟合重复的二元观测值,而不是像上面那样使时间离散,而要使用时间样条。群集三明治协方差估计器工作得相当好。但是我想通过使用混合效果模型来获得更精确的推断。问题在于第一个1之后的1是多余的。有谁知道一种指定随机效应或指定一种模型的方法,该模型考虑了冗余,从而不会缩小标准误差? 请注意,此设置与Efron的设置不同,因为他使用逻辑模型来估计风险集中的条件概率。我正在估计无条件概率。



1
在线性回归中,为什么正则化也会同时惩罚参数值?
目前正在学习岭回归,对于更复杂的模型(或更复杂的模型的定义)的惩罚我感到有些困惑。 据我了解,模型复杂度不一定与多项式阶数相关。因此:是比更复杂的模型2 + 3 + 4 x2+ 5 x3+ 6 x42+3+4X2+5X3+6X4 2 + 3+ 4x^2 + 5x^3 + 6x^45 x55X5 5x^5 而且我知道正则化的目的是保持模型复杂度低,例如说我们有一个五阶多项式F(x ; w )= w0+ w1个x + w2X2+ w3X3+ w4X4+ w5X5F(X;w)=w0+w1个X+w2X2+w3X3+w4X4+w5X5 f(x; w) = w_0 + w_1x + w_2x^2 + w_3x^3 + w_4x^4 + w_5x^5 参数越多,则0越好。 但是我不明白的是,如果是相同阶数的多项式,为什么较低的参数值会减少较少的损失?那么为什么会: 2 + …

2
如何测试?
假设我有三个独立的组,分别为均值。μ1, μ2, μ3μ1, μ2, μ3\mu_1,~ \mu_2,~\mu_3 如何使用每个组中的样本来测试是否?μ1&lt;μ2&lt;μ3μ1&lt;μ2&lt;μ3\mu_1 < \mu_2 <\mu_3n1, n2, n3n1, n2, n3n_1,~n_2,~n_3 我想知道一些一般的方法,而不是详细的计算。我不知道如何设置假设和。H0H0H_0H1H1H_1

2
如何找到多边形的协方差矩阵?
假设您有一个由一组坐标(x1,y1)...(xn,yn)(x1,y1)...(xn,yn)(x_1,y_1)...(x_n,y_n)定义的多边形。。。(x n,y n)并且其质心在(0,0)(0,0)(0,0)。您可以将多边形视为具有多边形边界的均匀分布。 我正在寻找一种可以找到多边形的协方差矩阵的方法。 我怀疑多边形的协方差矩阵与面积的第二矩密切相关,但是我不确定它们是否相等。在我链接的Wikipedia文章中找到的公式似乎(这里是一个猜测,对我来说不是很清楚)指的是绕x,y和z轴而不是多边形的主轴的旋转惯量。 (顺便说一句,如果有人可以指出我如何计算多边形的主轴,那对我也很有用) 试图仅对坐标执行PCA是很诱人的,但是这样做会遇到这样的问题,即坐标不一定在多边形周围均匀分布,因此不能代表多边形的密度。一个极端的例子是北达科他州的轮廓,其多边形由紧随红河的大量点定义,再加上仅两个定义该州西部边缘的点。

2
的概率
假设X1X1X_1和X2X2X_2是具有参数ppp独立几何随机变量。什么是概率X1≥X2X1≥X2X_1 \geq X_2? 我对这个问题感到困惑,因为除了X1X1X_1和X2X2X_2是几何图形之外,我们什么都没告诉。这不是50%50%50\%因为X1X1X_1和X2X2X_2可以在该范围内吗? 编辑:新尝试 P(X1≥X2)=P(X1&gt;X2)+P(X1=X2)P(X1≥X2)=P(X1&gt;X2)+P(X1=X2)P(X1 ≥ X2) = P(X1 > X2) + P(X1 = X2) P(X1=X2)P(X1=X2)P(X1 = X2) =∑x∑x\sum_{x} (1−p)x−1p(1−p)x−1p(1−p)x−1p(1−p)x−1p(1-p)^{x-1}p(1-p)^{x-1}p =p2−pp2−p\frac{p}{2-p} P(X1&gt;X2)P(X1&gt;X2)P(X1 > X2) = P(X1&lt;X2)P(X1&lt;X2)P(X1 < X2)和P(X1&lt;X2)+P(X1&gt;X2)+P(X1=X2)=1P(X1&lt;X2)+P(X1&gt;X2)+P(X1=X2)=1P(X1 < X2) + P(X1 > X2) + P(X1 = X2) = 1 因此,P(X1&gt;X2)P(X1&gt;X2)P(X1 > X2) = 1−P(X1=X2)21−P(X1=X2)2\frac{1-P(X1 = X2)}{2} =1−p2−p1−p2−p\frac{1-p}{2-p}添加P(X1=X2)=p2−pP(X1=X2)=p2−pP(X1 = …

3
如何为Logistic回归模型减少正确的预测变量
因此,我一直在阅读一些有关建模的书籍(或其中的一部分)(包括F. Harrell的“回归建模策略”),因为我目前的现状是我需要基于二进制响应数据进行逻辑模型处理。我的数据集中有连续数据,分类数据和二进制数据(预测变量)。基本上我现在大约有100个预测变量,对于一个好的模型来说,显然太多了。同样,这些预测变量中有许多是相关的,因为尽管它们有些不同,但它们通常基于相同的度量。 无论如何,我一直在阅读中,使用单变量回归和逐步技术是您可以做的一些最糟糕的事情,目的是减少预测变量的数量。我认为LASSO技术还可以(如果我正确理解的话),但是显然您不能在100个预测变量上使用它,并且认为会带来任何好处。 那么我在这里有什么选择呢?我是否真的必须坐下来,与我的所有主管和工作中的聪明人交谈,并真的考虑一下(应该是错误的)前5名最佳预测指标是什么,或者我应该选择哪种方法?考虑代替吗? 是的,我也知道这个话题已经被广泛讨论(在线和书籍中),但是当您对该建模领域的新手了解时,有时似乎有点不知所措。 编辑: 首先,我的样本量为+1000名患者(这在我的领域中是很多),并且其中有70-170个阳性反应(例如,其中170个是阳性反应,而其中一种情况约为900个没有反应) 。 基本上,该想法是预测放射治疗后的毒性。我有一些预期的二元响应数据(即毒性,或者是毒性(1),或者是毒性(0)),然后我有几种类型的指标。一些指标是患者特定的,例如年龄,使用的药物,器官和目标体积,糖尿病等,然后我基于目标的模拟治疗场获得了一些治疗特定的指标。从中我可以找到几个预测因子,这些预测因子在我的领域中通常是高度相关的,因为大多数毒性与所接收的辐射量(含糖量)高度相关。因此,例如,如果我治疗肺部肿瘤,则有一定剂量的剂量可能会击中心脏。然后,我可以计算出多少x心脏体积接收到x剂量剂量,例如“ 只需选择一个开始即可(尽管过去的实验当然尝试过,而且我也希望这样做),因为我需要“确切地”知道在何种程度上心脏毒性之间实际上存在很大的相关性和体积剂量(再次举例来说,还有其他类似的指标,其中应用了相同的策略)。是的,这几乎就是我的数据集的样子。一些不同的指标,有些有些相似。只需选择一个开始即可(尽管过去的实验当然尝试过,而且我也希望这样做),因为我需要“确切地”知道在何种程度上心脏毒性之间实际上存在很大的相关性和体积剂量(再次举例来说,还有其他类似的指标,其中应用了相同的策略)。是的,这几乎就是我的数据集的样子。一些不同的指标,有些有些相似。几乎是我的数据集的样子。一些不同的指标,有些有些相似。几乎是我的数据集的样子。一些不同的指标,有些有些相似。 然后,我要做的是建立一个预测模型,这样我就可以预测哪些患者有发生某种毒性的风险。而且由于响应数据是二进制的,所以我的主要思想当然是使用逻辑回归模型。至少这是其他人在我领域所做的。但是,在完成许多已经完成的论文时,其中有些似乎是错误的(至少在阅读这些特定类型的建模书籍(例如F. Harrel's)时)。许多人使用单变量回归分析来选择预测变量,并将其用于多元分析(如果我没记错的话,建议您这样做),并且许多人使用逐步技术来减少预测变量的数量。当然,这还不是全部。许多人使用LASSO,PCA,交叉验证,自举等,但是我所看过的 关于功能选择,这可能是我现在的位置。如何选择/找到在模型中使用的正确预测变量?我曾经尝试过这些单变量/逐步方法,但是每次我都想:“为什么这样做,如果错了?”。但是也许这是一个很好的方法,至少在最后显示了“好的模型”以正确的方式与“坏模型”以错误的方式相抵触。因此,我现在可能会以某种错误的方式进行操作,我需要帮助的是以正确的方式进行操作。 很抱歉,编辑时间太长。 编辑2: 只是我的数据看起来像一个简单的例子: 'data.frame': 1151 obs. of 100 variables: $ Toxicity : Factor w/ 2 levels "0","1": 2 1 1 1 1 1 1 1 1 1 ... $ Age : num 71.9 64 52.1 65.1 63.2 …

1
为什么贝叶斯后验集中在KL散度的最小值上?
考虑贝叶斯后验。渐近地,其最大值出现在MLE估计,这恰好使似然性 argmin最大化。θ∣Xθ∣X\theta\mid Xθ^θ^\hat \thetaargminθfθ(X)argminθfθ(X)\operatorname{argmin}_\theta\, f_\theta(X) 所有这些概念(贝叶斯先验,使可能性最大化)听起来都是超级原则,一点也不随意。看不到日志。 然而,MLE最小化了实分布和之间的KL散度,即,它最小化了f~f~\tilde ffθ(x)fθ(x)f_\theta(x) KL(f~∥fθ)=∫+∞−∞f~(x)[logf~(x)−logfθ(x)]dxKL(f~∥fθ)=∫−∞+∞f~(x)[log⁡f~(x)−log⁡fθ(x)]dx KL(\tilde f \parallel f_\theta) = \int_{-\infty}^{+\infty} \tilde f(x) \left[ \log \tilde f(x) - \log f_\theta(x) \right] \, dx 哇,这些日志是从哪里来的?为什么特别是KL分歧? 例如,为什么最小化不同的差异与贝叶斯后验的超原则性和积极性概念不相符,而使上述可能性最大化呢? 在这种情况下,KL散度和/或对数似乎有一些特殊之处。当然,我们可以举手示意这就是数学。但是我怀疑可能会有更深刻的直觉或发现的联系。

13
如果“ B更有可能给定A”,那么“ A更有可能给定B”
我试图获得更清晰的直觉:“如果使更有可能,那么使更有可能”一个AA乙BB乙BB一个AA 令表示和所在的空间的大小,然后Ñ (小号)n(S)n(S)一个AA乙BB 要求:使得P(B|A)&gt;P(B)P(B|A)&gt;P(B)P(B|A)>P(B)n(AB)/n(A)&gt;n(B)/n(S)n(AB)/n(A)&gt;n(B)/n(S)n(AB)/n(A) > n(B)/n(S) 所以n(AB)/n(B)&gt;n(A)/n(S)n(AB)/n(B)&gt;n(A)/n(S)n(AB)/n(B) > n(A)/n(S) 这是P(A|B)&gt;P(一)P(A|B)&gt;P(A)P(A|B)>P(A) 我理解数学,但是为什么这很直观?


By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.