统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

1
我应该报告可信区间而不是置信区间吗?
在统计教科书中迷失了这个概念之后,我试图做出自己的决定,最后得出一个结论,该结论似乎符合我到目前为止所看到的所有解释:非统计学家认为可信的区间是可信的间隔是。 对于像我这样一个小时的人来说,离题 如果我们观察到数据并从中预测出一些参数,则可以说是平均值 μμ\mu,可信区间是区间 [μ分, μ最高][μ分, μ最高][\mu_{\text{min}},\ \mu_{\text{max}}]为此,我们有95%的把握确保mu属于内部(如果使用其他级别,则为95%以外的某个数字)。入门级统计课中讲授的置信区间可以与可信区间重叠,但并不总是重叠良好。如果你要勇敢的解释,尝试阅读这和这对交叉验证的问题; 经过反复的摸爬滚打,我终于明白了的是这个答案。 这是否意味着在结果中使用可信区间而不是置信区间在科学上更可取?如果是,为什么我还没有看到使用它的出版物? 是因为应该使用该概念,但测量科学家尚未赶上正确的统计方法吗? 还是说原始置信区间的含义更适合于解释经验研究的结果? 还是在实践中它们经常重叠以至根本没有关系? 选择是否取决于我们为数据假设的统计分布?也许具有高斯分布,它们总是在数值上重叠,因此,纯粹的统计数据之外没有人关心这种差异(我读过的许多研究甚至都不费心计算任何间隔,也许大约有1%会给思想留下空间他们的数据可能不会以正态分布)。 这是否取决于我们的科学理论地位?例如,感觉在实证主义工作中应该使用置信区间,而在解释主义工作中应该使用可信区间,但是我不确定这种感觉是否正确。

2
为什么0.05 <p <0.95的结果称为假阳性?
编辑:我的问题的基础是有缺陷的,我需要花一些时间弄清楚它是否甚至可以说得通。 编辑2:澄清一下,我认识到p值不是零假设的概率的直接量度,但是我假设p值越接近1,则假设就越有可能被选择用于相应零假设为真的实验测试,而p值越接近0,则被选择用于相应零假设为假的实验测试的可能性就越大。除非所有假设(或为实验选择的所有假设)的集合在某种程度上是病理性的,否则我看不到这是错误的。 编辑3:我认为我仍然没有使用明确的术语来问我的问题。当彩票号码被读出并与彩票一一对应时,情况就会发生变化。您赢了的概率不会改变,但是您可以关闭收音机的概率却不会改变。实验完成时也会发生类似的变化,但是我感到我使用的术语-“ p值会更改选择正确假设的可能性”-不是正确的术语。 编辑4:我收到了两个非常详尽而翔实的答案,其中包含大量信息供我参考。我现在将它们都投票给我,然后在我从两个答案中学到足够多的知识后知道他们已经回答了我的问题或使我的问题无效时,再回来接受它们。这个问题打开了比我原本希望吃的蠕虫还要大得多的蠕虫罐。 在我读过的论文中,我看到经过验证的p&gt; 0.05的结果称为“假阳性”。但是,当实验数据的ap &lt;0.50低但大于0.05且不是零假设和p时,我选择一个假设以错误的相应零假设进行检验的可能性是否更大?考虑到@NickStauner 链接中指出的不对称性,研究假设在0.05 &lt;p &lt; 0.95之间的任何地方统计上不确定/无关紧要(鉴于常规的统计显着性临界值)。 让我们将数字称为A,并将其定义为p值,该值表示您为实验/分析选择了真实零假设的可能性相同,p值为0.05表示您的可能性为我们为您的实验/分析选择了一个真实的非零假设。0.05 &lt;p &lt;只是说:“您的样本量不足以回答问题,在您获得更大的样本并获得统计数据之前,您将无法判断应用程序/现实世界的重要性意义整理出来了吗? 换句话说,当且仅当p&gt; A时才将结果绝对确定为假(而不是仅仅不受支持)是否正确? 这对我来说似乎很简单,但是如此广泛的使用告诉我我可能是错的。我是 a)误解了数学, b)抱怨一种无害(如果不是完全正确)的惯例, c)完全正确,或者 d)其他? 我认识到这听起来像是在征求意见,但这似乎是一个问题,它在数学上有明确的正确答案(一旦设定了有效截断值),那么我或(几乎)其他所有人都会出错。

1
在Excel vs R中计算卡方的奇怪方法
我正在查看一个自称正在计算的Excel工作表,但我不知道这样做的方式,我想知道是否丢失了某些东西。χ2χ2\chi^2 这是它正在分析的数据: +------------------+----------+----------+ | Total Population | Observed | Expected | +------------------+----------+----------+ | 2000 | 42 | 32.5 | | 2000 | 42 | 32.5 | | 2000 | 25 | 32.5 | | 2000 | 21 | 32.5 | +------------------+----------+----------+ 这是为计算卡方而对每个组所做的总和: P = (sum of all observed)/(sum of total …
9 r  chi-squared  excel 

3
为什么线性回归不能预测简单确定性序列的结果?
我的一位同事向我发送了这个问题,显然是在互联网上巡回演出: If $3 = 18, 4 = 32, 5 = 50, 6 = 72, 7 = 98$, Then, $10 =$ ? 答案似乎是200。 3*6 4*8 5*10 6*12 7*14 8*16 9*18 10*20=200 当我在R中进行线性回归时: data &lt;- data.frame(a=c(3,4,5,6,7), b=c(18,32,50,72,98)) lm1 &lt;- lm(b~a, data=data) new.data &lt;- data.frame(a=c(10,20,30)) predict &lt;- predict(lm1, newdata=new.data, interval='prediction') 我得到: fit lwr …
9 r  regression  lm 

1
将岭回归应用于欠定方程组?
当,对值施加球形限制最小二乘问题可以写成 对于超定系统,。\ | \ cdot \ | _2是向量的欧几里得范数。y=Xβ+ey=Xβ+ey = X\beta + eδδ\deltaββ\betamin ∥y−Xβ∥22s.t. ∥β∥22≤δ2min⁡ ‖y−Xβ‖22s.t.⁡ ‖β‖22≤δ2\begin{equation} \begin{array} &\operatorname{min}\ \| y - X\beta \|^2_2 \\ \operatorname{s.t.}\ \ \|\beta\|^2_2 \le \delta^2 \end{array} \end{equation}∥⋅∥2‖⋅‖2\|\cdot\|_2 \ beta的对应解ββ\beta由 β^=(XTX+λI)−1XTy ,β^=(XTX+λI)−1XTy ,\begin{equation} \hat{\beta} = \left(X^TX + \lambda I\right)^{-1}X^T y \ , \end{equation} 可以从拉格朗日乘数的方法得出(λλ\lambda是乘数): L(β,λ)=∥y−Xβ∥22+λ(∥β∥22−δ2)L(β,λ)=‖y−Xβ‖22+λ(‖β‖22−δ2)\begin{equation} \mathcal{L}(\beta,\lambda) = …

1
可以使用引导重采样来计算数据集方差的置信区间吗?
我知道,如果您多次对数据集进行重新采样并每次计算平均值,则这些均值将遵循正态分布(通过CLT)。因此,您可以对数据集的平均值计算置信区间,而无需对数据集的概率分布进行任何假设。 我想知道您是否可以对差异做类似的事情。也就是说,如果我要多次从数据集中重新采样并每次计算方差,那么这些方差会遵循一定的分布吗(不管数据集的原始概率分布是什么)? 我知道,如果原始数据集是正态的,则方差将遵循卡方分布。但是在不正常的情况下该怎么办?

1
期望K数之和而不需替换
给定数字,每个数字的值不同,分别表示为,选择每个数字的概率分别为。nnnv1,v2,...,vnv1,v2,...,vnv_1, v_2, ..., v_np1,p2,...,pnp1,p2,...,pnp_1, p_2, ..., p_n 现在,如果我根据给定的概率选择数字,其中,那么这数字之和的期望是什么?请注意,选择是没有替换的,因此号不能包含重复的数字。我知道如果选择替换,则数字之和的期望等于,其中KKKK≤nK≤nK \leq nKKKKKKKKKK×E(V)K×E(V)K \times E(V)E(V)=v1×p1+v2×p2+...+vn×pn.E(V)=v1×p1+v2×p2+...+vn×pn.E(V) = v_1 \times p_1 + v_2 \times p_2 + ... + v_n \times p_n. 此外,对那些数的方差的期望又如何呢?KKK 我是CS博士学生,正在研究大数据问题,而且我没有任何统计背景。我希望有人可以给我一个公式作为答案。但是,如果答案过于复杂而无法用公式描述或需要进行大量计算,则近似答案是完全可以接受的。 您可以假设此处的很大,并且概率可能相差很大。实际上,这些概率的值来自查询日志,该日志记录了一系列聚合查询。关键是查询中涉及的每个数字的频率可能会偏斜,即,很少查询一些,而某些查询则非常频繁。您可以假设概率分布是正态分布,zipf分布或任何其他合理的替代。nnn 值分布只是任何可能分布的连续子集。换句话说,如果您有一个表示一定分布的直方图,则此问题涉及的所有数字都是单个存储桶中的所有数字。 根据K的值,您可以假定它总是小于经常查询的元素的数量。

1
差异数据设置
使用差异回归模型中的差异哪种设置正确 ÿ我小号Ť= α +γs* T+ λdŤ+ δ∗ (T∗dŤ)+ϵ我小号Ťÿ一世sŤ=α+γs∗Ť+λdŤ+δ∗(Ť∗dŤ)+ϵ一世sŤY_{ist} = \alpha +\gamma_s*T + \lambda d_t + \delta*(T*d_t)+ \epsilon_{ist} 如果观察到的是治疗组,则T是一个等于1的假人,而d是在发生治疗后的时间段中等于1的假人。 1)每个组和时间的随机样本(即4个随机样本) 要么 2)在两个时间段内跟踪相同单位的面板数据? 有关系吗?如果没有,在任何情况下都可以使用OLS吗?


2
在Dirichlet分布中将单纯形表示为三角形曲面的含义?
我正在读一本介绍Dirchilet分布的书,然后提供有关它的图。但是我真的不能理解那些数字。我将图附加在底部。我不理解的是三角形的含义。 通常,当要绘制一个包含2个变量的函数时,可以使用var1和va2的值,然后绘制这两个变量的函数值的值...这可以在3D维度中显示。但是这里有3个维度,而函数值有一个其他值,因此可以在4D空间中进行可视化。我不明白这些数字! 希望有人可以澄清一下! 编辑:这是我从图2.14a中无法理解的内容。因此,我们从K = 3 dirichlet中提取了一个样本theta(基本上是一个向量),即:theta = [theta1,theta2,theta3]。三角形绘图[theta1,theta2,theta3]。从原点到每个theta_i的距离是theta_i的值。然后为每个theta_i放置一个顶点,并将所有三个顶点连接起来,并制成一个三角形。我知道,如果将[theta1,theta2,theta3]插入dir(theta | a),我将得到一个数,即向量theta的联合概率。我也理解连续随机变量的概率是对面积的度量。但是这里我们有3个维度,因此联合概率将是粉红色平面及其下方(即金字塔)的空间量的度量。现在我不明白三角形在这里的作用。


2
耦合来自具有多个空间分辨率/尺度的源的时间序列信息
我有许多来自不同传感器的卫星光栅图像。根据这些,较粗的那些具有非常丰富的时间分辨率。中分辨率栅格的采集日期往往较少,但仍可获得一定程度的信息。较高分辨率的时间分辨率非常低,在不到两年的时间内从2到6个观测日期跨越。我想知道是否有人以任何方式努力研究这种多尺度时间序列?我希望使用较粗略的可用信息来预测较细微的将来值。对我来说有意义的是,数据必须相关(是的,图像覆盖相同的区域),但是我不知道如何在预测模型中开始耦合此信息。


1
RandomForest-sklearn中的分类阈值
1)如何更改sklearn中RandomForest中的分类阈值(我认为默认值为0.5)? 2)如何在sklearn中进行欠采样? 3)我从RandomForest分类器中得到以下结果:[[1635 1297] [520 3624]] precision recall f1-score support class 0 0.76 0.56 0.64 2932 class 1 0.74 0.87 0.80 4144 平均/总计0.75 0.74 0.73 7076 首先,数据是不平衡的(0级为30%,1级为70%)。因此,我认为分类器更倾向于偏向于类别1,这意味着将类别从类别0转移到类别1(类别0的分类错误为1297,类别1的分类错误为520)。我怎样才能解决这个问题?缩减采样是否有帮助?或更改分类阈值? 更新:0级人口占40%,而1级人口占60%。但是,从0级到1级(1297)的漂移很高,而我希望它变低。

2
人口稳定指数-除以零
总体稳定性指数通过比较两个时间段内的数据样本来量化变量分布的变化。它非常常用于衡量分数变化。 计算方法如下: 1)离散基期的样本。通常将其分为十分位数 2)使用与第一步相同的时间间隔将目标期间的样本离散化 其中: -在基准期间中第i个bin的份额。 -目标时段中第i个bin的份额。 P小号一世=∑一世(一个一世-乙一世)⋅ 升Ñ (一个一世乙一世)P小号一世=∑一世(一个一世-乙一世)⋅升ñ(一个一世乙一世)PSI = \sum_{i} (A_{i} - B_{i}) \cdot ln(\frac{A_{i}}{B_{i}}) 一个一世一个一世A_{i}乙一世乙一世B_{i} 问题:当目标样本中的一个容器为空时,该怎么办?

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.